Skip to content
IRC-CodingIRC-Coding
CPUGPUTPUNPUKünstliche IntelligenzHardwareDeep LearningRechnerarchitekturNVIDIATOPSFLOPS

CPU, GPU, TPU und NPU: Warum die GPU für KI so wichtig ist

CPU, GPU, TPU und NPU einfach erklärt: Was ist der Unterschied, warum braucht KI eine GPU und wie funktionieren diese Prozessoren? Mit TOPS, FLOPS und FAQ.

S

schutzgeist

15 min read
CPU, GPU, TPU und NPU: Warum die GPU für KI so wichtig ist

CPU, GPU und TPU: Warum die GPU für KI so wichtig ist

Einleitung

Wenn Du Dich mit Künstlicher Intelligenz beschäftigst, hörst Du ständig von GPU, CPU und manchmal auch TPU. Aber was ist eigentlich der Unterschied? Warum brauchte ChatGPT tausende NVIDIA GPUs und nicht einfach schnelle CPUs?

Die Antwort liegt in der Art, wie diese Prozessoren arbeiten. Eine CPU ist wie ein kluger Allrounder, der komplexe Aufgaben nacheinander löst. Eine GPU ist wie ein Heer von einfachen Arbeitern, die gleichzeitig Millionen einfacher Aufgaben erledigen. Und eine TPU ist ein Spezialist, der genau eine Sache kann, dafür aber extrem schnell.

In diesem Artikel lernst Du, wie CPU, GPU und TPU funktionieren, warum die GPU für KI so wichtig ist und wann welche Hardware die richtige Wahl ist.

CPU: Der Allrounder

In a Nutshell

Die CPU (Central Processing Unit) ist das Gehirn Deines Computers. Sie kann alles, aber nicht alles gleichzeitig. Eine CPU hat wenige, aber sehr schnelle Rechenkerne (meist 4 bis 16). Jeder Kern kann komplexe Aufgaben nacheinander ausführen, wie zum Beispiel eine Datenbank abfragen, ein Betriebssystem verwalten oder eine Benutzeroberfläche steuern.

Stell Dir vor, Du hast 4 sehr kluge Köche in einer Küche. Jeder Koch kann ein komplexes Gericht zubereiten, von der Planung bis zum Anrichten. Aber 4 Köche können gleichzeitig nur 4 Gerichte kochen, nicht mehr.

Kernkomponenten einer CPU

  • ALU (Arithmetic Logic Unit): Führt grundlegende Rechenoperationen aus, wie Addition, Subtraktion und logische Vergleiche.
  • Control Unit: Koordiniert die Ausführung von Befehlen, lädt Daten aus dem Cache und steuert den Datenfluss.
  • Register: Extrem schneller, aber winziger Speicher direkt im Prozessor. Hier liegen die aktuellen Werte, mit denen die CPU gerade arbeitet.
  • Cache (L1, L2, L3): Mehrstufiger Zwischenspeicher, der häufig genutzte Daten bereithält, um den langsamen Zugriff auf den Hauptspeicher zu vermeiden.

Wie wichtig ist dies wirklich in der Praxis

Als Anwendungsentwickler schreibst Du Code, der auf der CPU läuft. Dein Betriebssystem, Dein Browser, Dein IDE, Dein lokaler Dev Server, alles läuft auf der CPU. Wenn Du eine Webanwendung baust, verarbeitet die CPU die HTTP Requests, führt die Geschäftslogik aus und steuert die Datenbankzugriffe.

Die CPU ist und bleibt das Herzstück jedes Computers. Für KI ist sie nur nicht optimal, weil KI vor allem aus massenhaft einfachen Mathe-Aufgaben besteht.

GPU: Der Massenprozessor

In a Nutshell

Die GPU (Graphics Processing Unit) wurde ursprünglich für die Darstellung von 3D Grafiken entwickelt. Um ein Bild mit Millionen Pixeln zu berechnen, müssen viele einfache Mathe-Operationen gleichzeitig ausgeführt werden. Genau das kann eine GPU extrem gut.

Eine GPU hat nicht 4 oder 16 Kerne, sondern Tausende. NVIDIA’s H100 hat zum Beispiel 16.896 Kerne. Jeder einzelne Kern ist einfacher und langsamer als ein CPU Kern, aber zusammen sind sie unschlagbar bei Aufgaben, die sich parallelisieren lassen.

Stell Dir vor, Du hast 16.896 Hilfsköche in einer riesigen Küche. Jeder Koch kann nur eine Sache, zum Beispiel eine Zwiebel schneiden. Aber alle gleichzeitig. Wenn Du 16.896 Zwiebeln schneiden musst, sind diese Hilfsköche um ein Vielfaches schneller als die 4 klugen Köche der CPU.

Kernkomponenten einer GPU

  • CUDA Cores / Stream Processors: Die eigentlichen Recheneinheiten. Tausende einfache Kerne, die parallel arbeiten.
  • VRAM (Video RAM): Eigener Speicher auf der GPU, sehr schnell mit hoher Bandbreite. Eine NVIDIA H100 hat 80 GB HBM3 Speicher.
  • Tensor Cores: Spezielle Einheiten in modernen NVIDIA GPUs, die genau für KI Berechnungen (Matrix Multiplikationen) optimiert sind.
  • SM (Streaming Multiprocessors): Gruppen von Kernen, die gemeinsam auf Speicher und Rechenressourcen zugreifen.

Warum die GPU für KI so wichtig ist

KI Modelle, besonders neuronale Netze, bestehen aus einer riesigen Anzahl von Matrix Multiplikationen. Eine Matrix Multiplikation ist nichts anderes als viele einfache Multiplikationen und Additionen, die gleichzeitig ausgeführt werden können.

Hier ein einfaches Beispiel: Ein Bild mit 224x224 Pixeln hat 50.176 Pixel. Jeder Pixel hat 3 Farbwerte (Rot, Grün, Blau). Das sind 150.528 Zahlen. In einem neuronalen Netz wird jeder dieser Werte mit einem Gewicht multipliziert und aufaddiert. Das sind Hunderttausende einfacher Rechenoperationen, die alle gleichzeitig ausgeführt werden können.

# CPU: Berechnet eine Matrix Multiplikation nacheinander
import numpy as np

a = np.random.rand(1000, 1000)
b = np.random.rand(1000, 1000)

# Auf der CPU dauert das mehrere Sekunden
result = np.dot(a, b)  # Jede Zelle wird nacheinander berechnet
# GPU: Berechnet dieselbe Matrix Multiplikation parallel
import cupy as cp  # NVIDIA GPU Bibliothek

a_gpu = cp.random.rand(1000, 1000)
b_gpu = cp.random.rand(1000, 1000)

# Auf der GPU dauert das Millisekunden, da Tausende Kerne parallel rechnen
result_gpu = cp.dot(a_gpu, b_gpu)

Der Geschwindigkeitsunterschied ist massiv. Eine NVIDIA H100 GPU kann Matrix Multiplikationen etwa 10 bis 50 Mal schneller ausführen als eine High-End CPU, bei großen KI Modellen sogar 100 Mal schneller.

Wie wichtig ist dies wirklich in der Praxis

Wenn Du als Entwickler mit KI arbeitest, kommst Du um die GPU nicht herum. Ob Du ein lokales LLM mit Ollama betreibst, ein Modell mit PyTorch trainierst oder Bilder mit Stable Diffusion generierst, überall braucht es GPU Leistung.

Auch wenn Du Cloud KI Services nutzt, läuft im Hintergrund eine GPU. OpenAI nutzt tausende NVIDIA GPUs für ChatGPT. Google nutzt TPUs für Gemini. Ohne diese Hardware wäre moderne KI nicht möglich.

TPU: Der Spezialist

In a Nutshell

Die TPU (Tensor Processing Unit) ist ein Prozessor, den Google speziell für KI entwickelt hat. Während eine GPU ein Allrounder für parallele Berechnungen ist, ist die TPU ein reiner Spezialist für Tensor Operationen, also genau die Matrix Multiplikationen, die in neuronalen Netzen vorkommen.

Stell Dir vor, Du hast einen Automaten in der Küche, der nichts anderes kann als Zwiebeln schneiden. Aber er schneidet 100.000 Zwiebeln pro Sekunde. Nichts anderes kann er, aber dafür ist er unschlagbar.

Kernkomponenten einer TPU

  • MXU (Matrix Multiply Unit): Das Herz der TPU. Ein spezialisiertes Hardware Modul, das ausschließlich Matrix Multiplikationen ausführt, mit extrem hoher Geschwindigkeit.
  • Unified Buffer: Großer lokaler Pufferspeicher, der Zwischenergebnisse der Matrix Berechnungen speichert.
  • Activation Pipeline: Führt Aktivierungsfunktionen (wie ReLU oder Sigmoid) direkt in Hardware aus, ohne den Umweg über den Hauptspeicher.

TPU vs GPU: Was ist besser?

KriteriumGPUTPU
EntwicklerNVIDIA, AMDGoogle
VerfügbarkeitFrei käuflichNur Google Cloud
FlexibilitätHoch, für viele AufgabenNiedrig, nur KI Workloads
Geschwindigkeit bei KISehr hochExtrem hoch
PreisTeuer (H100 ca. 30.000 Euro)Cloud Miete, nicht käuflich
Framework SupportPyTorch, TensorFlow, JAXTensorFlow, JAX
CommunityRiesigKlein, Google fokussiert

Für die meisten Entwickler ist die GPU die beste Wahl. TPUs sind interessant, wenn Du大规模 Modelle in der Google Cloud trainierst und maximale Performance brauchst.

NPU: Der KI Spezialist im Alltag

In a Nutshell

Die NPU (Neural Processing Unit) ist ein KI Beschleuniger, der direkt in Consumer Hardware wie Laptops, Smartphones und Tablets integriert ist. Sie ist schwächer als eine GPU, aber extrem stromsparend und spezialisiert auf einfache KI Aufgaben wie Spracherkennung, Bilderkennung und kleine KI Modelle.

Stell Dir vor, Du hast einen Küchenroboter, der nur Salat schneiden kann. Er ist nicht so schnell wie die 16.896 Hilfsköche der GPU, aber er verbraucht kaum Strom, ist klein und immer da, wenn Du ihn brauchst.

Kernkomponenten einer NPU

  • Systolic Arrays: Spezialisierte Matrix Recheneinheiten, die für KI Inference optimiert sind.
  • Low Power Design: Entwickelt für minimalen Stromverbrauch, wichtig für mobile Geräte.
  • On-Chip Memory: Kleiner, aber schneller lokaler Speicher, um Datenübertragungen zu minimieren.
  • INT8 Unterstützung: Fokus auf 8-Bit Ganzzahlen statt 32-Bit Fließkommazahlen, was Rechenleistung und Stromverbrauch reduziert.

NPU vs GPU: Was ist besser?

KriteriumNPUGPU
EinsatzortLaptops, Smartphones, TabletsDesktop PCs, Server
StromverbrauchSehr gering (wenige Watt)Hoch (bis zu 700 Watt)
LeistungBis 50 TOPSBis zu 2000 TFLOPS
FlexibilitätNiedrig, nur KI InferenceHoch, Training und Inferenz
PreisIn Gerät integriertZusätzliche Hardware
Typische AufgabenSpracherkennung, BilderkennungKI Training, LLMs, Rendering

Wie wichtig ist dies wirklich in der Praxis

Als Anwendungsentwickler wirst Du NPUs zunehmend sehen. Intel, AMD und Apple integrieren NPUs in ihre CPUs. Microsoft Windows 11 hat spezielle NPU APIs. Für einfache KI Aufgaben wie lokale Spracherkennung oder Bildklassifizierung ist die NPU perfekt, weil sie stromsparend arbeitet und die CPU entlastet.

Für komplexes KI Training oder große LLMs reicht die NPU nicht aus. Hier brauchst Du weiterhin eine GPU.

TOPS und FLOPS: Wie misst man KI Leistung?

In a Nutshell

TOPS (Tera Operations Per Second) und FLOPS (Floating Point Operations Per Second) sind Maßeinheiten für die Rechenleistung von Prozessoren. FLOPS ist der Standard für allgemeine Rechenleistung, TOPS ist speziell für KI und misst Ganzzahl-Operationen (INT8), die in KI Modellen häufig verwendet werden.

Was ist FLOPS?

FLOPS steht für Floating Point Operations Per Second. Eine FLOP ist eine Fließkomma-Operation wie Addition oder Multiplikation. Eine NVIDIA H100 erreicht bis zu 4.000 TFLOPS (Tera FLOPS) bei 16-Bit Fließkommazahlen. Das entspricht 4 Billiarden Rechenoperationen pro Sekunde.

# FLOPS Beispiel: Eine Matrix Multiplikation mit Fließkommazahlen
import numpy as np

# 1000x1000 Matrix Multiplikation erfordert etwa 2.000.000.000 FLOPS
a = np.random.rand(1000, 1000).astype(np.float32)
b = np.random.rand(1000, 1000).astype(np.float32)
result = np.dot(a, b)  # 2 TFLOPS bei 1000x1000

Was ist TOPS?

TOPS steht für Tera Operations Per Second, aber speziell für Ganzzahl-Operationen (INT8). KI Modelle nutzen oft 8-Bit Ganzzahlen statt 32-Bit Fließkommazahlen, weil das schneller und stromsparender ist. Eine NPU mit 50 TOPS kann 50 Milliarden Ganzzahl-Operationen pro Sekunde ausführen.

# TOPS Beispiel: Eine Matrix Multiplikation mit Ganzzahlen
import numpy as np

# 1000x1000 Matrix Multiplikation mit INT8 erfordert etwa 2.000.000.000 TOPS
a = np.random.randint(0, 255, (1000, 1000)).astype(np.int8)
b = np.random.randint(0, 255, (1000, 1000)).astype(np.int8)
result = np.dot(a, b)  # 2 TOPS bei 1000x1000

Warum TOPS statt FLOPS für KI?

KI Modelle für Inferenz nutzen zunehmend Quantisierung, also die Reduzierung der Genauigkeit von 32-Bit auf 8-Bit. Das ist schneller, stromsparender und für die meisten Anwendungen präzise genug. TOPS ist daher das bessere Maß für KI Inference Hardware, während FLOPS für Training und allgemeine Rechenleistung relevant bleibt.

Vergleich: CPU, GPU, TPU und NPU in TOPS/FLOPS

ProzessorFLOPS (FP16)TOPS (INT8)Typische Nutzung
Intel Core i9-14900K1.500 TFLOPS50 TOPSDesktop, Gaming
NVIDIA RTX 40902.000 TFLOPS330 TOPSGaming, KI Inferenz
NVIDIA H1004.000 TFLOPS2.000 TOPSKI Training, LLMs
Apple M3 NPU0 TFLOPS18 TOPSMacBook, KI Inferenz
Intel Core Ultra NPU0 TFLOPS10 TOPSLaptop, KI Inferenz
Google TPU v5p0 TFLOPS4.700 TOPSKI Training bei Google

Wie wichtig ist dies wirklich in der Praxis

Als Entwickler solltest Du TOPS und FLOPS kennen, um Hardware für KI Projekte auszuwählen. Für lokale KI Inferenz auf einem Laptop ist eine NPU mit 10 bis 50 TOPS ausreichend. Für KI Training brauchst Du eine GPU mit Hunderten bis Tausenden TOPS.

Achte beim Hardware Kauf auf die TOPS Angabe, wenn Du KI Inferenz auf mobilen Geräten planst. Für Desktop KI Workloads ist die FLOPS Angabe der GPU wichtiger.

Vergleich: CPU, GPU, TPU und NPU

EigenschaftCPUGPUTPUNPU
Anzahl Kerne4 bis 16Tausende (bis 16.896)Spezialisierte Matrix EinheitenSystolic Arrays (bis 50 TOPS)
AufgabenartKomplex, sequenziellEinfach, parallelNur Tensor OperationenKI Inference (INT8)
StärkeLogik, Kontrolle, I/OParallele MatheKI spezifische MatheStromsparende KI Inferenz
Speicher32 bis 128 GB RAM8 bis 80 GB VRAM16 bis 128 GB HBMOn-Chip Memory
KI EignungGering, zu langsamSehr hochExtrem hochMittel, für Inferenz
Preis200 bis 5.000 Euro500 bis 30.000 EuroCloud MieteIn Gerät integriert
Typisches EinsatzgebietBetriebssystem, AppsKI Training, GrafikKI Training bei GoogleSpracherkennung, Bilderkennung

Welcher Prozessor für welchen Zweck?

  • CPU: Für alles, was nicht KI ist. Betriebssystem, Web Server, Datenbanken, normale Anwendungen.
  • GPU: Für KI Training und Inferenz, wenn Du Flexibilität brauchst. Die Standardwahl für die meisten KI Entwickler.
  • TPU: Für großskaliges KI Training in der Google Cloud, wenn Du maximale Performance für TensorFlow oder JAX Modelle brauchst.
  • NPU: Für lokale KI Inferenz auf Laptops und Smartphones. Spracherkennung, Bilderkennung, kleine KI Modelle mit minimalem Stromverbrauch.

Buchempfehlungen zum Thema

Künstliche Intelligenz

Bücher über KI, Machine Learning und Artificial Intelligence

Künstliche Intelligenz für Dummies

Künstliche Intelligenz für Dummies

Bei Amazon ansehen

Affiliate-Link: Bei einem Kauf erhalten wir möglicherweise eine Provision.

Zusammenfassung

  • CPU ist der Allrounder: Wenige, aber kluge Kerne. Perfekt für komplexe, sequenzielle Aufgaben wie Betriebssystem und Anwendungslogik.
  • GPU ist der Massenprozessor: Tausende einfache Kerne, die parallel arbeiten. Perfekt für KI, weil neuronale Netze aus Millionen einfacher Mathe-Aufgaben bestehen.
  • TPU ist der Spezialist: Von Google gebaut, nur für KI Tensor Operationen. Extrem schnell, aber unflexibel und nur in der Google Cloud verfügbar.
  • NPU ist der KI Beschleuniger im Alltag: Integriert in Laptops und Smartphones, extrem stromsparend für einfache KI Aufgaben wie Spracherkennung.
  • Warum GPU für KI: KI Modelle bestehen aus massenhaft Matrix Multiplikationen. Eine GPU kann diese parallel ausführen und ist dadurch 10 bis 100 Mal schneller als eine CPU.
  • TOPS vs FLOPS: FLOPS misst Fließkomma-Operationen (Training), TOPS misst Ganzzahl-Operationen (Inference). Für KI Inferenz ist TOPS das relevante Maß.
  • Praxis: Als KI Entwickler nutzt Du GPU für Training und Inferenz. NPU für lokale KI auf mobilen Geräten. TPU nur bei Google Cloud.

Verwandte Artikel:

FAQ CPU, GPU und TPU, Typische Prüfungsfragen

1. Was ist der Hauptunterschied zwischen CPU und GPU?

Eine CPU hat wenige, aber leistungsstarke Kerne (4 bis 16) für komplexe, sequenzielle Aufgaben. Eine GPU hat Tausende einfache Kerne für parallele Berechnungen. Die CPU ist der Allrounder, die GPU der Massenprozessor.

2. Warum ist eine GPU für KI besser als eine CPU?

Neuronale Netze bestehen aus massenhaft Matrix Multiplikationen. Diese lassen sich parallelisieren. Eine GPU mit Tausenden Kernen kann diese Berechnungen gleichzeitig ausführen und ist dadurch 10 bis 100 Mal schneller als eine CPU.

3. Was ist eine TPU und wer hat sie entwickelt?

Die TPU (Tensor Processing Unit) ist ein spezialisierter Prozessor, den Google ausschließlich für KI Tensor Operationen entwickelt hat. Sie ist extrem schnell für Matrix Multiplikationen, aber unflexibel und nur in der Google Cloud verfügbar.

4. Wie viele Kerne hat eine typische GPU?

Moderne GPUs haben Tausende Kerne. Eine NVIDIA H100 hat beispielsweise 16.896 CUDA Cores. Consumer GPUs wie die RTX 4090 haben etwa 16.384 Kerne. Jeder Kern ist einfacher als ein CPU Kern, aber zusammen sind sie extrem leistungsstark bei parallelen Aufgaben.

5. Was sind Tensor Cores in einer GPU?

Tensor Cores sind spezialisierte Recheneinheiten in modernen NVIDIA GPUs, die genau für Matrix Multiplikationen optimiert sind, wie sie in neuronalen Netzen vorkommen. Sie beschleunigen KI Berechnungen zusätzlich zu den normalen CUDA Cores.

6. Kann man eine TPU kaufen?

Nein, TPUs sind nicht frei käuflich. Sie sind nur über die Google Cloud Platform als gemietete Instanzen verfügbar. GPUs von NVIDIA und AMD kann man hingegen im Handel kaufen.

7. Was ist VRAM und warum ist es wichtig für KI?

VRAM (Video RAM) ist der dedizierte Speicher auf der GPU. Für KI ist er wichtig, weil das gesamte Modell und die verarbeiteten Daten in den VRAM passen müssen. Ist der VRAM zu klein, kann das Modell nicht auf der GPU ausgeführt werden. Eine NVIDIA H100 hat 80 GB HBM3 VRAM.

8. Was bedeutet parallele Datenverarbeitung?

Parallele Datenverarbeitung bedeutet, dass mehrere Berechnungen gleichzeitig ausgeführt werden, anstatt nacheinander. Eine GPU führt Tausende Berechnungen parallel aus, während eine CPU Aufgaben meist sequenziell abarbeitet. Das ist der Grund, warum GPUs bei KI so viel schneller sind.

9. Kann KI auch auf einer CPU laufen?

Ja, aber sehr langsam. Kleine Modelle wie ein einfaches neuronales Netz können auf einer CPU laufen. Bei großen Modellen wie LLMs dauert die Inferenz auf einer CPU jedoch Minuten statt Sekunden. Für ernsthaftes KI Training ist eine CPU nicht praktikabel.

10. Was ist der Unterschied zwischen CUDA Cores und Stream Processors?

CUDA Cores sind die Recheneinheiten in NVIDIA GPUs. Stream Processors sind das Äquivalent in AMD GPUs. Beide dienen dem gleichen Zweck, parallele Berechnungen auszuführen, haben aber unterschiedliche Architekturen und Programmierschnittstellen.

11. Warum hat OpenAI tausende GPUs für ChatGPT gebraucht?

ChatGPT basiert auf einem großen Sprachmodell mit Milliarden von Parametern. Das Training erfordert das gleichzeitige Ausführen von extrem vielen Matrix Multiplikationen. Tausende GPUs arbeiten parallel, um das Modell in akzeptabler Zeit zu trainieren. Auf CPUs würde das Jahre dauern.

12. Was ist eine Matrix Multiplikation und warum ist sie wichtig für KI?

Eine Matrix Multiplikation ist die Multiplikation zweier Zahlenmatrizen, wobei jedes Element durch die Multiplikation und Aufsummierung von Zeilen und Spalten entsteht. In neuronalen Netzen werden so die Eingabedaten mit den Gewichten des Modells verrechnet. Das ist die Kernoperation jedes KI Modells.

13. Was ist HBM Speicher und warum nutzt man ihn in GPUs und TPUs?

HBM (High Bandwidth Memory) ist ein Speichertyp mit extrem hoher Bandbreite, der direkt neben dem Prozessor platziert wird. Er ist viel schneller als normaler RAM. GPUs und TPUs nutzen HBM, weil KI Berechnungen riesige Datenmengen in kürzester Zeit zwischen Speicher und Rechenkernen bewegen müssen.

14. Was ist der Unterschied zwischen KI Training und Inferenz in Bezug auf Hardware?

Beim Training wird ein Modell mit großen Datenmengen trainiert, was extrem viel Rechenleistung und VRAM erfordert. Bei der Inferenz wendet das trainierte Modell auf neue Daten an, was weniger Ressourcen braucht. Für Training nutzt man High-End GPUs wie H100, für Inferenz reichen oft kleinere GPUs oder sogar CPUs.

15. Was bedeutet CUDA und warum ist es wichtig?

CUDA (Compute Unified Device Architecture) ist NVIDIA’s Programmierplattform für GPUs. Sie ermöglicht Entwicklern, die GPU für allgemeine Berechnungen zu nutzen, nicht nur für Grafik. Ohne CUDA wäre die Nutzung von GPUs für KI wesentlich komplizierter. Frameworks wie PyTorch und TensorFlow bauen auf CUDA auf.

16. Was ist eine NPU und wofür wird sie verwendet?

Die NPU (Neural Processing Unit) ist ein KI Beschleuniger, der in Consumer Hardware wie Laptops und Smartphones integriert ist. Sie ist spezialisiert auf einfache KI Aufgaben wie Spracherkennung, Bilderkennung und kleine KI Modelle. Sie ist extrem stromsparend, aber nicht für komplexes KI Training geeignet.

17. Was ist der Unterschied zwischen NPU und GPU?

Eine NPU ist in Consumer Geräte integriert, extrem stromsparend und für einfache KI Inferenz optimiert. Eine GPU ist leistungsstärker, verbraucht mehr Strom und eignet sich für KI Training und komplexe Modelle. Die NPU ist für mobile Geräte, die GPU für Desktop und Server.

18. Was sind TOPS und wie unterscheiden sie sich von FLOPS?

TOPS (Tera Operations Per Second) misst Ganzzahl-Operationen (INT8), die für KI Inferenz wichtig sind. FLOPS (Floating Point Operations Per Second) misst Fließkomma-Operationen, die für KI Training wichtig sind. TOPS ist das relevante Maß für NPU und KI Inferenz, FLOPS für GPU und KI Training.

19. Warum nutzen KI Modelle INT8 statt FP32?

INT8 (8-Bit Ganzzahlen) verbraucht weniger Speicher und Strom als FP32 (32-Bit Fließkommazahlen). Die Genauigkeitsverluste sind für viele KI Anwendungen akzeptabel. Quantisierung auf INT8 beschleunigt die Inferenz und ermöglicht KI auf mobilen Geräten mit NPUs.

20. Was ist ein Systolic Array in einer NPU?

Ein Systolic Array ist eine spezialisierte Hardware Architektur für Matrix Multiplikationen. Sie besteht aus einem Raster von Recheneinheiten, die Daten in einem regelmäßigen Takt weitergeben. Das ist extrem effizient für die Matrix Operationen, die in neuronalen Netzen vorkommen.

21. Wie viel TOPS braucht man für KI Inferenz?

Für einfache KI Aufgaben wie Spracherkennung reichen 10 bis 50 TOPS (typisch für NPUs in Laptops). Für komplexe LLMs brauchst Du Hunderte bis Tausende TOPS (typisch für GPUs wie RTX 4090 mit 330 TOPS oder H100 mit 2.000 TOPS).

22. Was ist Quantisierung bei KI Modellen?

Quantisierung ist die Reduzierung der Genauigkeit von Modellparametern, zum Beispiel von FP32 auf INT8. Das reduziert Speicherbedarf und beschleunigt die Inferenz, mit minimalen Genauigkeitsverlusten. Quantisierung ist wichtig, um KI Modelle auf NPUs und mobilen Geräten auszuführen.

23. Welche Geräte haben NPUs?

Moderne Laptops mit Intel Core Ultra oder AMD Ryzen AI CPUs haben NPUs. Apple M3 Chips haben NPUs. Smartphones wie iPhone 15 Pro und Samsung Galaxy S24 haben NPUs. Die NPU ist oft Teil der CPU oder SoC (System on Chip).

24. Kann man eine NPU für KI Training nutzen?

Nein, NPUs sind nicht für KI Training geeignet. Sie sind zu schwach und nicht flexibel genug für das Training großer Modelle. NPUs sind ausschließlich für KI Inferenz optimiert, also das Anwenden bereits trainierter Modelle auf neue Daten.

25. Was ist der Vorteil von NPUs für Anwendungsentwickler?

NPUs ermöglichen KI Features in Anwendungen ohne externe GPU. Spracherkennung, Bilderkennung und kleine KI Modelle können lokal auf dem Laptop laufen, ohne Cloud Services zu nutzen. Das ist schneller, privater und stromsparender.

Quellen

Zurück zum Blog
Share:

Ähnliche Beiträge