Eine Neural Processing Unit (NPU) – manchmal auch als KI-Beschleuniger oder Tensor Processing Unit (TPU) bezeichnet – ist eine spezialisierte Klasse von Mikroprozessorarchitekturen. Im Gegensatz zu Allzweck-CPUs, die für sequenzielle Logik und starke Verzweigungen optimiert sind, werden NPUs von Grund auf auf Siliziumebene für eine einzige Aufgabe entwickelt, die sie außergewöhnlich gut beherrschen: hochgradig parallelisierte Vektormathematik, insbesondere Multiply-Accumulate-Operationen (MAC).
MAC-Operationen (a * b + c) sind die grundlegenden mathematischen Bausteine künstlicher neuronaler Netze (KNN).
Warum CPUs und GPUs bei der KI-Inferenz an ihre Grenzen stoßen
- CPUs: Eine herkömmliche MCU oder MPU (wie ein Cortex-A oder Cortex-M) verarbeitet Daten sequenziell. Selbst mit SIMD-Erweiterungen (Single Instruction, Multiple Data) erfordert die Berechnung von einer Million MAC-Operationen für einen einzigen Inferenz-Frame eines Bildes das millionenfache Durchlaufen des Befehlszyklus (Fetch-Decode-Execute) der CPU, was enorm viel Zeit und Akkuleistung beansprucht.
- GPUs: Grafikprozessoren eignen sich hervorragend für parallele Mathematik, weshalb sie der Standard für das Training von KI-Modellen in der Cloud sind. GPUs sind jedoch extrem leistungshungrig, groß und teuer. Sie können nicht in einem batteriebetriebenen 5-Dollar-IoT-Sensor im Feld platziert werden.
Der Vorteil von NPUs am Edge
Eine NPU schließt diese Lücke und ermöglicht so die Revolution von Edge AI (KI am Rande des Netzwerks) und TinyML.
Indem Siliziumfläche speziell für massive MAC-Arrays und stark lokalisierten SRAM reserviert wird (um Energieverluste durch das Abrufen von Gewichten aus externem RAM zu vermeiden), kann eine NPU eine Inferenzaufgabe (wie Weckworterkennung oder visuelle Anomalieerkennung) in einem Bruchteil der Zeit und mit einem Bruchteil der Energie eines Universalprozessors ausführen.
Wichtige NPU-Metriken:
- TOPS (Tera Operations Per Second): Eine gängige (obwohl im Marketing oft irreführend verwendete) Metrik für den reinen Durchsatz. Für Edge AI wird typischerweise in GOPS (Giga Operations) gemessen.
- TOPS/Watt: Die wirklich entscheidende Metrik für die Entwicklung eingebetteter Systeme. Sie misst die Energieeffizienz der Inferenz. Ein hohes TOPS/Watt-Verhältnis ermöglicht den Betrieb komplexer KI-Modelle mit Knopfzellen.
- Unterstützung für Quantisierung: Moderne NPUs unterstützen nativ INT8- oder sogar INT4-Ganzzahlmathematik. Durch die Quantisierung eines neuronalen Netzes (Umwandlung von 32-Bit-Gleitkommazahlen (FP32) in 8-Bit-Ganzzahlen) kann die NPU das Modell bis zu 4-mal schneller und mit deutlich geringerem Speicherbedarf verarbeiten, oft bei einem vernachlässigbaren Genauigkeitsverlust.