CPU, GPU und TPU: Warum die GPU für KI so wichtig ist
Einleitung
Wenn Du Dich mit Künstlicher Intelligenz beschäftigst, hörst Du ständig von GPU, CPU und manchmal auch TPU. Aber was ist eigentlich der Unterschied? Warum brauchte ChatGPT tausende NVIDIA GPUs und nicht einfach schnelle CPUs?
Die Antwort liegt in der Art, wie diese Prozessoren arbeiten. Eine CPU ist wie ein kluger Allrounder, der komplexe Aufgaben nacheinander löst. Eine GPU ist wie ein Heer von einfachen Arbeitern, die gleichzeitig Millionen einfacher Aufgaben erledigen. Und eine TPU ist ein Spezialist, der genau eine Sache kann, dafür aber extrem schnell.
In diesem Artikel lernst Du, wie CPU, GPU und TPU funktionieren, warum die GPU für KI so wichtig ist und wann welche Hardware die richtige Wahl ist.
CPU: Der Allrounder
In a Nutshell
Die CPU (Central Processing Unit) ist das Gehirn Deines Computers. Sie kann alles, aber nicht alles gleichzeitig. Eine CPU hat wenige, aber sehr schnelle Rechenkerne (meist 4 bis 16). Jeder Kern kann komplexe Aufgaben nacheinander ausführen, wie zum Beispiel eine Datenbank abfragen, ein Betriebssystem verwalten oder eine Benutzeroberfläche steuern.
Stell Dir vor, Du hast 4 sehr kluge Köche in einer Küche. Jeder Koch kann ein komplexes Gericht zubereiten, von der Planung bis zum Anrichten. Aber 4 Köche können gleichzeitig nur 4 Gerichte kochen, nicht mehr.
Kernkomponenten einer CPU
- ALU (Arithmetic Logic Unit): Führt grundlegende Rechenoperationen aus, wie Addition, Subtraktion und logische Vergleiche.
- Control Unit: Koordiniert die Ausführung von Befehlen, lädt Daten aus dem Cache und steuert den Datenfluss.
- Register: Extrem schneller, aber winziger Speicher direkt im Prozessor. Hier liegen die aktuellen Werte, mit denen die CPU gerade arbeitet.
- Cache (L1, L2, L3): Mehrstufiger Zwischenspeicher, der häufig genutzte Daten bereithält, um den langsamen Zugriff auf den Hauptspeicher zu vermeiden.
Wie wichtig ist dies wirklich in der Praxis
Als Anwendungsentwickler schreibst Du Code, der auf der CPU läuft. Dein Betriebssystem, Dein Browser, Dein IDE, Dein lokaler Dev Server, alles läuft auf der CPU. Wenn Du eine Webanwendung baust, verarbeitet die CPU die HTTP Requests, führt die Geschäftslogik aus und steuert die Datenbankzugriffe.
Die CPU ist und bleibt das Herzstück jedes Computers. Für KI ist sie nur nicht optimal, weil KI vor allem aus massenhaft einfachen Mathe-Aufgaben besteht.
GPU: Der Massenprozessor
In a Nutshell
Die GPU (Graphics Processing Unit) wurde ursprünglich für die Darstellung von 3D Grafiken entwickelt. Um ein Bild mit Millionen Pixeln zu berechnen, müssen viele einfache Mathe-Operationen gleichzeitig ausgeführt werden. Genau das kann eine GPU extrem gut.
Eine GPU hat nicht 4 oder 16 Kerne, sondern Tausende. NVIDIA’s H100 hat zum Beispiel 16.896 Kerne. Jeder einzelne Kern ist einfacher und langsamer als ein CPU Kern, aber zusammen sind sie unschlagbar bei Aufgaben, die sich parallelisieren lassen.
Stell Dir vor, Du hast 16.896 Hilfsköche in einer riesigen Küche. Jeder Koch kann nur eine Sache, zum Beispiel eine Zwiebel schneiden. Aber alle gleichzeitig. Wenn Du 16.896 Zwiebeln schneiden musst, sind diese Hilfsköche um ein Vielfaches schneller als die 4 klugen Köche der CPU.
Kernkomponenten einer GPU
- CUDA Cores / Stream Processors: Die eigentlichen Recheneinheiten. Tausende einfache Kerne, die parallel arbeiten.
- VRAM (Video RAM): Eigener Speicher auf der GPU, sehr schnell mit hoher Bandbreite. Eine NVIDIA H100 hat 80 GB HBM3 Speicher.
- Tensor Cores: Spezielle Einheiten in modernen NVIDIA GPUs, die genau für KI Berechnungen (Matrix Multiplikationen) optimiert sind.
- SM (Streaming Multiprocessors): Gruppen von Kernen, die gemeinsam auf Speicher und Rechenressourcen zugreifen.
Warum die GPU für KI so wichtig ist
KI Modelle, besonders neuronale Netze, bestehen aus einer riesigen Anzahl von Matrix Multiplikationen. Eine Matrix Multiplikation ist nichts anderes als viele einfache Multiplikationen und Additionen, die gleichzeitig ausgeführt werden können.
Hier ein einfaches Beispiel: Ein Bild mit 224x224 Pixeln hat 50.176 Pixel. Jeder Pixel hat 3 Farbwerte (Rot, Grün, Blau). Das sind 150.528 Zahlen. In einem neuronalen Netz wird jeder dieser Werte mit einem Gewicht multipliziert und aufaddiert. Das sind Hunderttausende einfacher Rechenoperationen, die alle gleichzeitig ausgeführt werden können.
# CPU: Berechnet eine Matrix Multiplikation nacheinander
import numpy as np
a = np.random.rand(1000, 1000)
b = np.random.rand(1000, 1000)
# Auf der CPU dauert das mehrere Sekunden
result = np.dot(a, b) # Jede Zelle wird nacheinander berechnet
# GPU: Berechnet dieselbe Matrix Multiplikation parallel
import cupy as cp # NVIDIA GPU Bibliothek
a_gpu = cp.random.rand(1000, 1000)
b_gpu = cp.random.rand(1000, 1000)
# Auf der GPU dauert das Millisekunden, da Tausende Kerne parallel rechnen
result_gpu = cp.dot(a_gpu, b_gpu)
Der Geschwindigkeitsunterschied ist massiv. Eine NVIDIA H100 GPU kann Matrix Multiplikationen etwa 10 bis 50 Mal schneller ausführen als eine High-End CPU, bei großen KI Modellen sogar 100 Mal schneller.
Wie wichtig ist dies wirklich in der Praxis
Wenn Du als Entwickler mit KI arbeitest, kommst Du um die GPU nicht herum. Ob Du ein lokales LLM mit Ollama betreibst, ein Modell mit PyTorch trainierst oder Bilder mit Stable Diffusion generierst, überall braucht es GPU Leistung.
Auch wenn Du Cloud KI Services nutzt, läuft im Hintergrund eine GPU. OpenAI nutzt tausende NVIDIA GPUs für ChatGPT. Google nutzt TPUs für Gemini. Ohne diese Hardware wäre moderne KI nicht möglich.
TPU: Der Spezialist
In a Nutshell
Die TPU (Tensor Processing Unit) ist ein Prozessor, den Google speziell für KI entwickelt hat. Während eine GPU ein Allrounder für parallele Berechnungen ist, ist die TPU ein reiner Spezialist für Tensor Operationen, also genau die Matrix Multiplikationen, die in neuronalen Netzen vorkommen.
Stell Dir vor, Du hast einen Automaten in der Küche, der nichts anderes kann als Zwiebeln schneiden. Aber er schneidet 100.000 Zwiebeln pro Sekunde. Nichts anderes kann er, aber dafür ist er unschlagbar.
Kernkomponenten einer TPU
- MXU (Matrix Multiply Unit): Das Herz der TPU. Ein spezialisiertes Hardware Modul, das ausschließlich Matrix Multiplikationen ausführt, mit extrem hoher Geschwindigkeit.
- Unified Buffer: Großer lokaler Pufferspeicher, der Zwischenergebnisse der Matrix Berechnungen speichert.
- Activation Pipeline: Führt Aktivierungsfunktionen (wie ReLU oder Sigmoid) direkt in Hardware aus, ohne den Umweg über den Hauptspeicher.
TPU vs GPU: Was ist besser?
| Kriterium | GPU | TPU |
|---|---|---|
| Entwickler | NVIDIA, AMD | |
| Verfügbarkeit | Frei käuflich | Nur Google Cloud |
| Flexibilität | Hoch, für viele Aufgaben | Niedrig, nur KI Workloads |
| Geschwindigkeit bei KI | Sehr hoch | Extrem hoch |
| Preis | Teuer (H100 ca. 30.000 Euro) | Cloud Miete, nicht käuflich |
| Framework Support | PyTorch, TensorFlow, JAX | TensorFlow, JAX |
| Community | Riesig | Klein, Google fokussiert |
Für die meisten Entwickler ist die GPU die beste Wahl. TPUs sind interessant, wenn Du大规模 Modelle in der Google Cloud trainierst und maximale Performance brauchst.
NPU: Der KI Spezialist im Alltag
In a Nutshell
Die NPU (Neural Processing Unit) ist ein KI Beschleuniger, der direkt in Consumer Hardware wie Laptops, Smartphones und Tablets integriert ist. Sie ist schwächer als eine GPU, aber extrem stromsparend und spezialisiert auf einfache KI Aufgaben wie Spracherkennung, Bilderkennung und kleine KI Modelle.
Stell Dir vor, Du hast einen Küchenroboter, der nur Salat schneiden kann. Er ist nicht so schnell wie die 16.896 Hilfsköche der GPU, aber er verbraucht kaum Strom, ist klein und immer da, wenn Du ihn brauchst.
Kernkomponenten einer NPU
- Systolic Arrays: Spezialisierte Matrix Recheneinheiten, die für KI Inference optimiert sind.
- Low Power Design: Entwickelt für minimalen Stromverbrauch, wichtig für mobile Geräte.
- On-Chip Memory: Kleiner, aber schneller lokaler Speicher, um Datenübertragungen zu minimieren.
- INT8 Unterstützung: Fokus auf 8-Bit Ganzzahlen statt 32-Bit Fließkommazahlen, was Rechenleistung und Stromverbrauch reduziert.
NPU vs GPU: Was ist besser?
| Kriterium | NPU | GPU |
|---|---|---|
| Einsatzort | Laptops, Smartphones, Tablets | Desktop PCs, Server |
| Stromverbrauch | Sehr gering (wenige Watt) | Hoch (bis zu 700 Watt) |
| Leistung | Bis 50 TOPS | Bis zu 2000 TFLOPS |
| Flexibilität | Niedrig, nur KI Inference | Hoch, Training und Inferenz |
| Preis | In Gerät integriert | Zusätzliche Hardware |
| Typische Aufgaben | Spracherkennung, Bilderkennung | KI Training, LLMs, Rendering |
Wie wichtig ist dies wirklich in der Praxis
Als Anwendungsentwickler wirst Du NPUs zunehmend sehen. Intel, AMD und Apple integrieren NPUs in ihre CPUs. Microsoft Windows 11 hat spezielle NPU APIs. Für einfache KI Aufgaben wie lokale Spracherkennung oder Bildklassifizierung ist die NPU perfekt, weil sie stromsparend arbeitet und die CPU entlastet.
Für komplexes KI Training oder große LLMs reicht die NPU nicht aus. Hier brauchst Du weiterhin eine GPU.
TOPS und FLOPS: Wie misst man KI Leistung?
In a Nutshell
TOPS (Tera Operations Per Second) und FLOPS (Floating Point Operations Per Second) sind Maßeinheiten für die Rechenleistung von Prozessoren. FLOPS ist der Standard für allgemeine Rechenleistung, TOPS ist speziell für KI und misst Ganzzahl-Operationen (INT8), die in KI Modellen häufig verwendet werden.
Was ist FLOPS?
FLOPS steht für Floating Point Operations Per Second. Eine FLOP ist eine Fließkomma-Operation wie Addition oder Multiplikation. Eine NVIDIA H100 erreicht bis zu 4.000 TFLOPS (Tera FLOPS) bei 16-Bit Fließkommazahlen. Das entspricht 4 Billiarden Rechenoperationen pro Sekunde.
# FLOPS Beispiel: Eine Matrix Multiplikation mit Fließkommazahlen
import numpy as np
# 1000x1000 Matrix Multiplikation erfordert etwa 2.000.000.000 FLOPS
a = np.random.rand(1000, 1000).astype(np.float32)
b = np.random.rand(1000, 1000).astype(np.float32)
result = np.dot(a, b) # 2 TFLOPS bei 1000x1000
Was ist TOPS?
TOPS steht für Tera Operations Per Second, aber speziell für Ganzzahl-Operationen (INT8). KI Modelle nutzen oft 8-Bit Ganzzahlen statt 32-Bit Fließkommazahlen, weil das schneller und stromsparender ist. Eine NPU mit 50 TOPS kann 50 Milliarden Ganzzahl-Operationen pro Sekunde ausführen.
# TOPS Beispiel: Eine Matrix Multiplikation mit Ganzzahlen
import numpy as np
# 1000x1000 Matrix Multiplikation mit INT8 erfordert etwa 2.000.000.000 TOPS
a = np.random.randint(0, 255, (1000, 1000)).astype(np.int8)
b = np.random.randint(0, 255, (1000, 1000)).astype(np.int8)
result = np.dot(a, b) # 2 TOPS bei 1000x1000
Warum TOPS statt FLOPS für KI?
KI Modelle für Inferenz nutzen zunehmend Quantisierung, also die Reduzierung der Genauigkeit von 32-Bit auf 8-Bit. Das ist schneller, stromsparender und für die meisten Anwendungen präzise genug. TOPS ist daher das bessere Maß für KI Inference Hardware, während FLOPS für Training und allgemeine Rechenleistung relevant bleibt.
Vergleich: CPU, GPU, TPU und NPU in TOPS/FLOPS
| Prozessor | FLOPS (FP16) | TOPS (INT8) | Typische Nutzung |
|---|---|---|---|
| Intel Core i9-14900K | 1.500 TFLOPS | 50 TOPS | Desktop, Gaming |
| NVIDIA RTX 4090 | 2.000 TFLOPS | 330 TOPS | Gaming, KI Inferenz |
| NVIDIA H100 | 4.000 TFLOPS | 2.000 TOPS | KI Training, LLMs |
| Apple M3 NPU | 0 TFLOPS | 18 TOPS | MacBook, KI Inferenz |
| Intel Core Ultra NPU | 0 TFLOPS | 10 TOPS | Laptop, KI Inferenz |
| Google TPU v5p | 0 TFLOPS | 4.700 TOPS | KI Training bei Google |
Wie wichtig ist dies wirklich in der Praxis
Als Entwickler solltest Du TOPS und FLOPS kennen, um Hardware für KI Projekte auszuwählen. Für lokale KI Inferenz auf einem Laptop ist eine NPU mit 10 bis 50 TOPS ausreichend. Für KI Training brauchst Du eine GPU mit Hunderten bis Tausenden TOPS.
Achte beim Hardware Kauf auf die TOPS Angabe, wenn Du KI Inferenz auf mobilen Geräten planst. Für Desktop KI Workloads ist die FLOPS Angabe der GPU wichtiger.
Vergleich: CPU, GPU, TPU und NPU
| Eigenschaft | CPU | GPU | TPU | NPU |
|---|---|---|---|---|
| Anzahl Kerne | 4 bis 16 | Tausende (bis 16.896) | Spezialisierte Matrix Einheiten | Systolic Arrays (bis 50 TOPS) |
| Aufgabenart | Komplex, sequenziell | Einfach, parallel | Nur Tensor Operationen | KI Inference (INT8) |
| Stärke | Logik, Kontrolle, I/O | Parallele Mathe | KI spezifische Mathe | Stromsparende KI Inferenz |
| Speicher | 32 bis 128 GB RAM | 8 bis 80 GB VRAM | 16 bis 128 GB HBM | On-Chip Memory |
| KI Eignung | Gering, zu langsam | Sehr hoch | Extrem hoch | Mittel, für Inferenz |
| Preis | 200 bis 5.000 Euro | 500 bis 30.000 Euro | Cloud Miete | In Gerät integriert |
| Typisches Einsatzgebiet | Betriebssystem, Apps | KI Training, Grafik | KI Training bei Google | Spracherkennung, Bilderkennung |
Welcher Prozessor für welchen Zweck?
- CPU: Für alles, was nicht KI ist. Betriebssystem, Web Server, Datenbanken, normale Anwendungen.
- GPU: Für KI Training und Inferenz, wenn Du Flexibilität brauchst. Die Standardwahl für die meisten KI Entwickler.
- TPU: Für großskaliges KI Training in der Google Cloud, wenn Du maximale Performance für TensorFlow oder JAX Modelle brauchst.
- NPU: Für lokale KI Inferenz auf Laptops und Smartphones. Spracherkennung, Bilderkennung, kleine KI Modelle mit minimalem Stromverbrauch.
Buchempfehlungen zum Thema
Künstliche Intelligenz
Bücher über KI, Machine Learning und Artificial Intelligence
Künstliche Intelligenz für Dummies
Bei Amazon ansehenAffiliate-Link: Bei einem Kauf erhalten wir möglicherweise eine Provision.
Zusammenfassung
- CPU ist der Allrounder: Wenige, aber kluge Kerne. Perfekt für komplexe, sequenzielle Aufgaben wie Betriebssystem und Anwendungslogik.
- GPU ist der Massenprozessor: Tausende einfache Kerne, die parallel arbeiten. Perfekt für KI, weil neuronale Netze aus Millionen einfacher Mathe-Aufgaben bestehen.
- TPU ist der Spezialist: Von Google gebaut, nur für KI Tensor Operationen. Extrem schnell, aber unflexibel und nur in der Google Cloud verfügbar.
- NPU ist der KI Beschleuniger im Alltag: Integriert in Laptops und Smartphones, extrem stromsparend für einfache KI Aufgaben wie Spracherkennung.
- Warum GPU für KI: KI Modelle bestehen aus massenhaft Matrix Multiplikationen. Eine GPU kann diese parallel ausführen und ist dadurch 10 bis 100 Mal schneller als eine CPU.
- TOPS vs FLOPS: FLOPS misst Fließkomma-Operationen (Training), TOPS misst Ganzzahl-Operationen (Inference). Für KI Inferenz ist TOPS das relevante Maß.
- Praxis: Als KI Entwickler nutzt Du GPU für Training und Inferenz. NPU für lokale KI auf mobilen Geräten. TPU nur bei Google Cloud.
Verwandte Artikel:
- Rechnerarchitektur Grundlagen: CPU, Bus, Speicher, Adressierung
- CPU Aufbau: Fetch, Decode, Execute, Register, Cache
- Rechnerarchitektur: Von Neumann, CPU, Speicherhierarchie, DMA
- Das beste Betriebssystem für Deine KI Agenten
- Bester KI PC: Ryzen AI Max+ 395 vs NVIDIA DGX Spark
FAQ CPU, GPU und TPU, Typische Prüfungsfragen
1. Was ist der Hauptunterschied zwischen CPU und GPU?
2. Warum ist eine GPU für KI besser als eine CPU?
3. Was ist eine TPU und wer hat sie entwickelt?
4. Wie viele Kerne hat eine typische GPU?
5. Was sind Tensor Cores in einer GPU?
6. Kann man eine TPU kaufen?
7. Was ist VRAM und warum ist es wichtig für KI?
8. Was bedeutet parallele Datenverarbeitung?
9. Kann KI auch auf einer CPU laufen?
10. Was ist der Unterschied zwischen CUDA Cores und Stream Processors?
11. Warum hat OpenAI tausende GPUs für ChatGPT gebraucht?
12. Was ist eine Matrix Multiplikation und warum ist sie wichtig für KI?
13. Was ist HBM Speicher und warum nutzt man ihn in GPUs und TPUs?
14. Was ist der Unterschied zwischen KI Training und Inferenz in Bezug auf Hardware?
15. Was bedeutet CUDA und warum ist es wichtig?
16. Was ist eine NPU und wofür wird sie verwendet?
17. Was ist der Unterschied zwischen NPU und GPU?
18. Was sind TOPS und wie unterscheiden sie sich von FLOPS?
19. Warum nutzen KI Modelle INT8 statt FP32?
20. Was ist ein Systolic Array in einer NPU?
21. Wie viel TOPS braucht man für KI Inferenz?
22. Was ist Quantisierung bei KI Modellen?
23. Welche Geräte haben NPUs?
24. Kann man eine NPU für KI Training nutzen?
25. Was ist der Vorteil von NPUs für Anwendungsentwickler?
Quellen
- NVIDIA CUDA Dokumentation
- Google Cloud TPU Dokumentation
- NVIDIA H100 Spezifikationen
- Astro Dokumentation



