📘 Wie funktionieren Large Language Models (LLMs)?

Einleitung: Was ist ein LLM eigentlich?

Ein Large Language Model (LLM) ist ein KI-System, das darauf trainiert wurde, menschliche Sprache zu verstehen und zu generieren. Das „Large“ bezieht sich dabei auf zwei Dinge: die riesige Menge an Trainingsdaten (fast das gesamte öffentliche Internet) und die Milliarden von Parametern (internen „Stellschrauben“), die das Modell wĂ€hrend des Lernens optimiert hat.

Das wichtigste Grundprinzip: Ein LLM ist im Kern ein extrem fortschrittliches System zur Vorhersage des nĂ€chsten Tokens. Man kann es sich wie eine hochintelligente „AutovervollstĂ€ndigung“ vorstellen.

1. Die Grundbausteine: Tokens, Prompts und KontextlÀnge

Bevor wir uns die Mathematik ansehen, mĂŒssen wir verstehen, wie die KI Daten „sieht“.

🧩 Was sind Tokens?

KI-Modelle lesen keinen Text in Buchstaben oder ganzen Wörtern, sondern in Tokens. Ein Token ist die kleinste Einheit, die ein Modell verarbeiten kann.

  • Warum nicht Wörter? Manche Wörter sind sehr selten, andere sehr hĂ€ufig. WĂŒrde man jedes Wort einzeln speichern, wĂ€re das Vokabular zu riesig.
  • Warum nicht Buchstaben? Buchstaben allein tragen kaum Bedeutung.
  • Die Lösung: Sub-Word-Tokenisierung. HĂ€ufige Wörter sind ein einzelner Token (z.B. "Haus"), seltene Wörter werden in Teile zerlegt (z.B. "Donaudampfschifffahrt" → "Donau", "dampf", "schiff", "fahrt").

Faustregel: 1.000 Tokens entsprechen im Englischen/Deutschen etwa 750 Wörtern.

✍️ Was ist ein Prompt?

Ein Prompt ist die Eingabe des Nutzers. Er dient als „Startsignal“ und Kontext fĂŒr die Vorhersage.

  • Zero-Shot Prompting: Man stellt eine Frage ohne Beispiele („Schreibe ein Gedicht ĂŒber Katzen.“).
  • Few-Shot Prompting: Man gibt dem Modell erst ein paar Beispiele, um den gewĂŒnschten Stil zu etablieren („Hund → Bellt; Katze → Miaut; Kuh → …“).

📏 Was ist die KontextlĂ€nge (Context Window)?

Die KontextlĂ€nge ist das „KurzzeitgedĂ€chtnis“ des Modells. Sie gibt an, wie viele Tokens das Modell gleichzeitig „im Kopf behalten“ kann, wĂ€hrend es eine Antwort generiert.

  • Die Grenze: Wenn ein GesprĂ€ch die maximale KontextlĂ€nge ĂŒberschreitet, „vergisst“ das Modell die ersten Teile der Konversation.
  • Rechenaufwand: Je lĂ€nger der Kontext, desto mehr Rechenleistung wird benötigt, da das Modell jedes neue Wort in Beziehung zu allen vorherigen Wörtern setzen muss.

2. Die Funktionsweise: Wie wird das nÀchste Wort gewÀhlt?

Wenn du eine Frage stellst, passiert im Hintergrund ein komplexer statistischer Prozess. Das Modell „weiß“ nicht, was wahr ist, sondern berechnet, was wahrscheinlich ist.

Schritt 1: Embedding (Übersetzung in Zahlen)

Da Computer nicht mit Wörtern rechnen können, wird jeder Token in einen Vektor (eine lange Liste von Zahlen) umgewandelt. Diese Zahlen reprĂ€sentieren die „Bedeutung“ des Wortes in einem mehrdimensionalen Raum. Beispiel: Die Vektoren fĂŒr „König“ und „Königin“ liegen im mathematischen Raum sehr nah beieinander, wĂ€hrend „König“ und „Toaster“ weit voneinander entfernt liegen.

Schritt 2: Attention (Die Aufmerksamkeit)

Hier kommt die Transformer-Architektur ins Spiel. Durch den sogenannten Attention-Mechanismus entscheidet das Modell, welche Tokens im Prompt gerade wichtig sind.

  • Satz: „Die Bank am Flussufer war nass.“
  • Das Modell erkennt durch die Attention, dass das Wort „Flussufer“ die Bedeutung von „Bank“ bestimmt (Sitzgelegenheit, nicht Finanzinstitut).

Schritt 3: Die Wahrscheinlichkeitsverteilung

Nachdem das Modell den Kontext analysiert hat, erstellt es fĂŒr alle Tokens in seinem Vokabular (oft 50.000 bis 100.000 verschiedene Tokens) eine Liste mit Wahrscheinlichkeiten.

Beispiel-Satz: „Der Himmel ist heute …“ Das Modell berechnet nun:

  • blau: 85%
  • bewölkt: 10%
  • grĂŒn: 0.1%
  • Pizza: 0.0001%

Schritt 4: Sampling (Die Auswahl)

Das Modell wÀhlt nun einen Token aus dieser Liste aus. Hier gibt es verschiedene Strategien:

  1. Greedy Search: Es wird immer das Wort mit der höchsten Wahrscheinlichkeit gewĂ€hlt (blau). Das fĂŒhrt oft zu sehr repetitiven, langweiligen Texten.
  2. Temperature (Temperatur): Ein Regler, der die KreativitÀt steuert.
    • Niedrige Temperatur (z.B. 0.2): Das Modell bleibt sicher und wĂ€hlt fast nur die Top-Kandidaten. Ideal fĂŒr Fakten und Code.
    • Hohe Temperatur (z.B. 0.8): Das Modell gibt auch unwahrscheinlicheren Tokens eine Chance. Das macht den Text „kreativer“, erhöht aber das Risiko fĂŒr Fehler (Halluzinationen).

📚 Zusammenfassung

BegriffEinfache ErklÀrungAnalogie
TokenDie kleinsten Textbausteine (Wortteile).Legosteine aus denen Wörter gebaut werden.
PromptDie Anweisung des Nutzers.Das Steuerrad, das die Richtung vorgibt.
KontextlĂ€ngeDie Menge an Text, die gleichzeitig verarbeitet wird.Die GrĂ¶ĂŸe des Schreibtischs, auf dem alle Notizen liegen.
AttentionGewichtung der Relevanz einzelner Wörter.Ein Textmarker, der wichtige Wörter hervorhebt.
WahrscheinlichkeitVorhersage des wahrscheinlichsten nÀchsten Tokens.Ein extrem schlaues Ratespiel.

⚠️ Wichtiger Hinweis zum Schluss: Halluzinationen

Da LLMs auf Wahrscheinlichkeiten und nicht auf einer Datenbank mit Fakten basieren, „erfinden“ sie manchmal Informationen, die statistisch plausibel klingen, aber faktisch falsch sind. Das nennt man Halluzination. Das Modell versucht nicht zu lĂŒgen, es berechnet lediglich eine Sequenz von Wörtern, die „richtig aussieht“.

Alle Antworten sind von der KI erstellt. Sie wurden von mir nochmal durchgelesen und nach meinem Wissensstand kontrolliert.
Zur Hauptseite: Wie funktionieren eigentlich LLMs?
NĂ€chste Seite: 📉 Quantisierung bei LLMs

2 Gedanken zu “📘 Wie funktionieren Large Language Models (LLMs)?

  1. Pingback: 📉 Quantisierung bei LLMs | LierschIT

  2. Pingback: Wie funktionieren eigentlich LLMs? | LierschIT

Schreibe einen Kommentar

Deine E-Mail-Adresse wird nicht veröffentlicht. Erforderliche Felder sind mit * markiert