Inhalt
1. Warum wird so viel Arbeitsspeicher benötigt?
Wenn man von „Speicher“ bei LLMs spricht, muss man zwischen zwei Arten von Speicherbedarf unterscheiden: dem statischen (das Modell an sich) und dem dynamischen (die Arbeit während der Antwortgenerierung).
1. Der statische Speicher: Die Modell-Gewichte
Ein LLM besteht aus Milliarden von Parametern (Gewichten). Jeder dieser Parameter ist eine Zahl.
- Die einfache Rechnung: Wenn ein Modell 70 Milliarden Parameter hat und jeder Parameter als 16-Bit-Fließkommazahl (FP16 = 2 Byte) gespeichert wird, benötigt allein das „Laden“ des Modells in den Speicher: 70 Milliarden×2 Byte=140 GB
- Das Modell muss komplett im Speicher liegen. Man kann es nicht wie eine App stückweise von der Festplatte laden, da für die Berechnung eines einzigen Tokens fast alle Gewichte des gesamten Modells einmal „angesehen“ werden müssen.
2. Der dynamische Speicher: Aktivierungen und KV-Cache
Wenn die KI antwortet, entstehen riesige Mengen an temporären Daten:
- Aktivierungen: In jeder der vielen Schichten (Layers) des Modells werden Zwischenergebnisse berechnet. Diese müssen kurzzeitig gespeichert werden, bevor sie an die nächste Schicht weitergegeben werden.
- Der KV-Cache (Key-Value Cache): Das ist der wichtigste Punkt für die Kontextlänge. Damit das Modell nicht bei jedem neuen Wort den gesamten bisherigen Text von vorne berechnen muss, speichert es die mathematischen Repräsentationen der vorangegangenen Tokens in einem Cache.
- Das Problem: Je länger dein Prompt und die Antwort werden, desto mehr wächst dieser Cache. Bei sehr langen Texten kann der Cache allein mehrere Gigabyte Speicher fressen.
2. Warum VRAM/GPU statt RAM/CPU?
Man könnte sich fragen: „Ich habe 128 GB RAM in meinem PC, warum brauche ich dann eine teure Grafikkarte mit nur 24 GB VRAM?“ Die Antwort liegt nicht in der Menge, sondern in der Art und Geschwindigkeit des Zugriffs.
1. Parallelität: Tausende Arbeiter vs. wenige Genies
- Die CPU (Central Processing Unit) ist wie ein hochqualifizierter Professor. Sie kann extrem komplexe Aufgaben nacheinander (sequenziell) lösen. Sie hat aber nur wenige Kerne (z.B. 8 bis 32).
- Die GPU (Graphics Processing Unit) ist wie eine Armee von 10.000 Hilfsarbeitern. Einzeln sind sie nicht so schlau wie der Professor, aber sie können alle gleichzeitig dieselbe einfache Aufgabe erledigen.
Warum ist das wichtig? Ein LLM macht im Grunde nur eine Sache: Matrix‑Multiplikationen. Das bedeutet, Milliarden von kleinen Multiplikationen gleichzeitig. Die GPU kann tausende dieser Rechnungen in einem einzigen Takt durchführen, während die CPU sie mühsam in kleinen Gruppen abarbeiten müsste.
2. Die Speicherbandbreite: Die Autobahn-Analogie
Das ist der entscheidende technische Engpass.
- System-RAM ist wie eine Landstraße. Die Daten müssen einen relativ weiten Weg über das Mainboard zur CPU zurücklegen. Die Bandbreite ist gering (z.B. 50‑100 GB/s).
- VRAM (Video-RAM) ist wie eine 100-spurige Autobahn, die direkt neben den Rechenkernen der GPU liegt. Die Bandbreite ist gigantisch (z.B. 1.000 GB/s oder mehr).
Das Problem der CPU: Selbst wenn du genug RAM hättest, wäre die CPU ständig „ausgehungert“. Sie würde schneller rechnen können, als der RAM die Daten liefern kann. Die GPU hingegen kann die riesigen Datenmengen der Modell-Gewichte fast augenblicklich in ihre Rechenkerne schaufeln.
3. Spezialisierte Hardware: Tensor Cores
Moderne GPUs haben zusätzlich sogenannte Tensor Cores. Das sind Hardware-Einheiten, die nur für eine einzige Sache gebaut wurden: Matrizen extrem schnell zu multiplizieren. Eine CPU muss diese Operationen über allgemeine Rechenbefehle simulieren, was massiv ineffizienter ist.
📚 Zusammenfassung
| Feature | CPU + RAM | GPU + VRAM | Warum für LLMs wichtig? |
|---|---|---|---|
| Rechenstil | Sequenziell (nacheinander) | Parallel (gleichzeitig) | Matrizen-Rechnung erfordert Parallelität. |
| Bandbreite | Gering (Landstraße) | Extrem hoch (Autobahn) | Gewichte müssen blitzschnell geladen werden. |
| Spezialisierung | Generalist (Alleskönner) | Spezialist (Matrix-Profi) | Tensor Cores beschleunigen KI-Operationen. |
| Latenz | Höher (längerer Weg) | Niedriger (direkt am Kern) | Bestimmt, wie viele Tokens pro Sekunde erscheinen. |
Fazit: Wir nutzen GPUs nicht, weil CPUs „zu dumm“ sind, sondern weil die Architektur von LLMs eine massive Datenbewegung und parallele Rechenkraft erfordert, die nur VRAM und GPU-Kerne in dieser Geschwindigkeit leisten können.
Alle Antworten sind von der KI erstellt. Sie wurden von mir nochmal durchgelesen und nach meinem Wissensstand kontrolliert.
Zur Hauptseite: Wie funktionieren eigentlich LLMs?
Vorherige Seite: 📉 Quantisierung bei LLMs
Nächste Seite: ⚡ NPUs – Die Spezialisten für lokale KI
Pingback: Wie funktionieren eigentlich LLMs? | LierschIT
Pingback: 📉 Quantisierung bei LLMs | LierschIT