Inhalt
1. Was ist Quantisierung eigentlich?
Stell dir vor, ein LLM ist wie ein riesiges mathematisches Rezeptbuch. Jedes „Gewicht“ (Parameter) in diesem Buch ist eine Zahl, die extrem präzise geschrieben ist – zum Beispiel als FP32 (32-Bit-Fließkommazahl).
Eine solche Zahl sieht etwa so aus: 3,141592653589793
Das Problem: Wenn ein Modell 70 Milliarden solcher Zahlen hat, verbraucht das gigantische Mengen an Arbeitsspeicher (VRAM der Grafikkarte). Quantisierung ist der Prozess, diese hochpräzisen Zahlen in ein einfacheres, kürzeres Format umzuwandeln, zum Beispiel in INT8 (8-Bit-Ganzzahl) oder INT4 (4-Bit).
Anstatt der präzisen Zahl 3,141592653589793 speichert das Modell dann nur noch eine gerundete Version, wie etwa 3.
2. Warum macht man das? (Die Vorteile)
Ohne Quantisierung wären moderne KI-Modelle für die meisten Menschen unzugänglich. Die Vorteile sind:
- 🚀 Enorme Speicherersparnis: Ein Modell mit 70 Milliarden Parametern in FP32 wĂĽrde ca. 280 GB VRAM benötigen (das ist mehr als fast jede einzelne Consumer-Grafikkarte besitzt). Durch eine Quantisierung auf 4-Bit sinkt dieser Bedarf auf etwa 35–40 GB. Plötzlich passt das Modell auf zwei starke Gaming-Grafikkarten oder einen Mac mit viel gemeinsamem Speicher.
- ⚡ Höhere Geschwindigkeit (Inferenz): Computer können mit kleinen Ganzzahlen (Integers) viel schneller rechnen als mit langen FlieĂźkommazahlen. Die Antworten der KI werden dadurch schneller generiert (mehr Tokens pro Sekunde).
- 📱 Edge-Computing: Erst durch Quantisierung können LLMs lokal auf Smartphones oder Tablets laufen, da diese nur sehr begrenzten RAM haben.
3. Wie funktioniert die Umwandlung technisch?
Man kann es sich wie ein Skalieren und Runden vorstellen:
- Analyse: Die KI schaut sich eine Gruppe von Gewichten an und findet den höchsten und niedrigsten Wert (den Bereich).
- Mapping: Dieser Bereich wird auf eine kleine Anzahl von Stufen projiziert. Bei 4-Bit gibt es nur 16 mögliche Werte.
- Rundung: Jede präzise Zahl wird dem nächstgelegenen dieser 16 Werte zugeordnet.
- Dequantisierung: Wenn die KI rechnet, wird der kleine Wert intern kurzzeitig wieder „hochgerechnet“, um die Berechnung durchzuführen, aber gespeichert bleibt er kompakt.
4. Der Preis: Was geht verloren? (Die Nachteile)
Man kann nicht einfach Zahlen wegkürzen, ohne dass etwas passiert. Die Quantisierung führt zu einem Präzisionsverlust:
- Qualitätsverlust: Das Modell wird „ungenauer“. Es kann Nuancen in der Sprache verlieren oder in komplexen logischen Aufgaben häufiger Fehler machen.
- Halluzinationen: Da die Gewichte nur noch „ungefähre“ Werte sind, steigt die Wahrscheinlichkeit, dass das Modell Fakten falsch kombiniert oder Dinge erfindet.
- Kritische Schichten: Nicht alle Teile des Modells vertragen Quantisierung gleich gut. Die „Attention-Layer“ (die entscheiden, worauf die KI achtet) sind oft empfindlicher als andere Schichten.
Die gängigsten Formate im Überblick:
| Format | Präzision | Speicherbedarf | Qualitätsverlust | Einsatzgebiet |
|---|---|---|---|---|
| FP32 | Sehr Hoch (32-Bit) | Sehr Hoch | Gegen Null | Wissenschaftliche Anwendungen & Training |
| FP16 / BF16 | Hoch (16-Bit) | Mittel | Fast Null | Standard fĂĽr Training & Cloud |
| INT8 | Mittel (8-Bit) | Gering | Sehr gering | Professionelle Deployments |
| INT4 | Niedrig (4-Bit) | Sehr gering | SpĂĽrbar, aber oft okay | Lokale Nutzung (Home-PC) |
💡 Die Analogy: Das Wörterbuch
Stell dir vor, du hast ein wissenschaftliches Lexikon (das originale FP32-Modell). Jedes Wort ist mit einer 10-seitigen, extrem präzisen Definition erklärt. Es ist fachlich perfekt, aber das Buch ist so schwer, dass es nicht in deinen Rucksack passt.
Die Quantisierung ist so, als würdest du dieses Lexikon in ein Taschenwörterbuch umschreiben. Du kürzt die 10-seitigen Definitionen auf einen einzigen Satz zusammen.
- Das Ergebnis: Das Buch passt jetzt in deine Hosentasche (Speicherersparnis) und du findest Wörter viel schneller (Geschwindigkeit).
- Der Haken: Wenn du eine sehr spezifische, wissenschaftliche Detailfrage hast, reicht der eine Satz im Taschenbuch vielleicht nicht mehr aus, um die Antwort präzise zu geben (Qualitätsverlust).
Alle Antworten sind von der KI erstellt. Sie wurden von mir nochmal durchgelesen und nach meinem Wissensstand kontrolliert.
Zur Hauptseite: Wie funktionieren eigentlich LLMs?
Vorherige Seite: 📘 Wie funktionieren Large Language Models (LLMs)?
Nächste Seite: 🧠 Speicherbedarf und Hardware bei LLMs
Pingback: Wie funktionieren eigentlich LLMs? | LierschIT
Pingback: 📘 Wie funktionieren Large Language Models (LLMs)? | LierschIT
Pingback: 🧠 Speicherbedarf und Hardware bei LLMs | LierschIT