Inhalt
Einleitung: Was ist ein LLM eigentlich?
Ein Large Language Model (LLM) ist ein KI-System, das darauf trainiert wurde, menschliche Sprache zu verstehen und zu generieren. Das „Large“ bezieht sich dabei auf zwei Dinge: die riesige Menge an Trainingsdaten (fast das gesamte öffentliche Internet) und die Milliarden von Parametern (internen „Stellschrauben“), die das Modell wĂ€hrend des Lernens optimiert hat.
Das wichtigste Grundprinzip: Ein LLM ist im Kern ein extrem fortschrittliches System zur Vorhersage des nĂ€chsten Tokens. Man kann es sich wie eine hochintelligente âAutovervollstĂ€ndigungâ vorstellen.
1. Die Grundbausteine: Tokens, Prompts und KontextlÀnge
Bevor wir uns die Mathematik ansehen, mĂŒssen wir verstehen, wie die KI Daten „sieht“.
🧩 Was sind Tokens?
KI-Modelle lesen keinen Text in Buchstaben oder ganzen Wörtern, sondern in Tokens. Ein Token ist die kleinste Einheit, die ein Modell verarbeiten kann.
- Warum nicht Wörter? Manche Wörter sind sehr selten, andere sehr hĂ€ufig. WĂŒrde man jedes Wort einzeln speichern, wĂ€re das Vokabular zu riesig.
- Warum nicht Buchstaben? Buchstaben allein tragen kaum Bedeutung.
- Die Lösung: Sub-Word-Tokenisierung. HÀufige Wörter sind ein einzelner Token (z.B.
"Haus"), seltene Wörter werden in Teile zerlegt (z.B."Donaudampfschifffahrt"â"Donau","dampf","schiff","fahrt").
Faustregel: 1.000 Tokens entsprechen im Englischen/Deutschen etwa 750 Wörtern.
✍️ Was ist ein Prompt?
Ein Prompt ist die Eingabe des Nutzers. Er dient als âStartsignalâ und Kontext fĂŒr die Vorhersage.
- Zero-Shot Prompting: Man stellt eine Frage ohne Beispiele (âSchreibe ein Gedicht ĂŒber Katzen.â).
- Few-Shot Prompting: Man gibt dem Modell erst ein paar Beispiele, um den gewĂŒnschten Stil zu etablieren (âHund â Bellt; Katze â Miaut; Kuh â …â).
📏 Was ist die KontextlĂ€nge (Context Window)?
Die KontextlĂ€nge ist das âKurzzeitgedĂ€chtnisâ des Modells. Sie gibt an, wie viele Tokens das Modell gleichzeitig âim Kopf behaltenâ kann, wĂ€hrend es eine Antwort generiert.
- Die Grenze: Wenn ein GesprĂ€ch die maximale KontextlĂ€nge ĂŒberschreitet, âvergisstâ das Modell die ersten Teile der Konversation.
- Rechenaufwand: Je lÀnger der Kontext, desto mehr Rechenleistung wird benötigt, da das Modell jedes neue Wort in Beziehung zu allen vorherigen Wörtern setzen muss.
2. Die Funktionsweise: Wie wird das nÀchste Wort gewÀhlt?
Wenn du eine Frage stellst, passiert im Hintergrund ein komplexer statistischer Prozess. Das Modell âweiĂâ nicht, was wahr ist, sondern berechnet, was wahrscheinlich ist.
Schritt 1: Embedding (Ăbersetzung in Zahlen)
Da Computer nicht mit Wörtern rechnen können, wird jeder Token in einen Vektor (eine lange Liste von Zahlen) umgewandelt. Diese Zahlen reprĂ€sentieren die âBedeutungâ des Wortes in einem mehrdimensionalen Raum. Beispiel: Die Vektoren fĂŒr âKönigâ und âKöniginâ liegen im mathematischen Raum sehr nah beieinander, wĂ€hrend âKönigâ und âToasterâ weit voneinander entfernt liegen.
Schritt 2: Attention (Die Aufmerksamkeit)
Hier kommt die Transformer-Architektur ins Spiel. Durch den sogenannten Attention-Mechanismus entscheidet das Modell, welche Tokens im Prompt gerade wichtig sind.
- Satz: âDie Bank am Flussufer war nass.â
- Das Modell erkennt durch die Attention, dass das Wort âFlussuferâ die Bedeutung von âBankâ bestimmt (Sitzgelegenheit, nicht Finanzinstitut).
Schritt 3: Die Wahrscheinlichkeitsverteilung
Nachdem das Modell den Kontext analysiert hat, erstellt es fĂŒr alle Tokens in seinem Vokabular (oft 50.000 bis 100.000 verschiedene Tokens) eine Liste mit Wahrscheinlichkeiten.
Beispiel-Satz: âDer Himmel ist heute …â Das Modell berechnet nun:
blau: 85%bewölkt: 10%grĂŒn: 0.1%Pizza: 0.0001%
Schritt 4: Sampling (Die Auswahl)
Das Modell wÀhlt nun einen Token aus dieser Liste aus. Hier gibt es verschiedene Strategien:
- Greedy Search: Es wird immer das Wort mit der höchsten Wahrscheinlichkeit gewÀhlt (
blau). Das fĂŒhrt oft zu sehr repetitiven, langweiligen Texten. - Temperature (Temperatur): Ein Regler, der die KreativitĂ€t steuert.
- Niedrige Temperatur (z.B. 0.2): Das Modell bleibt sicher und wĂ€hlt fast nur die Top-Kandidaten. Ideal fĂŒr Fakten und Code.
- Hohe Temperatur (z.B. 0.8): Das Modell gibt auch unwahrscheinlicheren Tokens eine Chance. Das macht den Text âkreativerâ, erhöht aber das Risiko fĂŒr Fehler (Halluzinationen).
📚 Zusammenfassung
| Begriff | Einfache ErklÀrung | Analogie |
|---|---|---|
| Token | Die kleinsten Textbausteine (Wortteile). | Legosteine aus denen Wörter gebaut werden. |
| Prompt | Die Anweisung des Nutzers. | Das Steuerrad, das die Richtung vorgibt. |
| KontextlĂ€nge | Die Menge an Text, die gleichzeitig verarbeitet wird. | Die GröĂe des Schreibtischs, auf dem alle Notizen liegen. |
| Attention | Gewichtung der Relevanz einzelner Wörter. | Ein Textmarker, der wichtige Wörter hervorhebt. |
| Wahrscheinlichkeit | Vorhersage des wahrscheinlichsten nÀchsten Tokens. | Ein extrem schlaues Ratespiel. |
⚠️ Wichtiger Hinweis zum Schluss: Halluzinationen
Da LLMs auf Wahrscheinlichkeiten und nicht auf einer Datenbank mit Fakten basieren, âerfindenâ sie manchmal Informationen, die statistisch plausibel klingen, aber faktisch falsch sind. Das nennt man Halluzination. Das Modell versucht nicht zu lĂŒgen, es berechnet lediglich eine Sequenz von Wörtern, die ârichtig aussiehtâ.
Alle Antworten sind von der KI erstellt. Sie wurden von mir nochmal durchgelesen und nach meinem Wissensstand kontrolliert.
Zur Hauptseite: Wie funktionieren eigentlich LLMs?
NĂ€chste Seite: 📉 Quantisierung bei LLMs
Pingback: 📉 Quantisierung bei LLMs | LierschIT
Pingback: Wie funktionieren eigentlich LLMs? | LierschIT