Viele Nutzer behandeln einen KI-Chat wie eine endlose Unterhaltung. Technisch gesehen ist das jedoch oft kontraproduktiv. Um die beste Qualität aus einem LLM herauszuholen, muss man den Kontext aktiv steuern.
Inhalt
1. Warum ein neuer Chat bei Fehlern sinnvoll ist
Wenn ein LLM eine falsche Antwort gibt und du versuchst, es durch bloßes „Widerlegen“ zu korrigieren, kämpfst du gegen die Mathematik des Modells.
Das Problem: Die Kontext-Verschmutzung
Wie wir im Kapitel über die „sture KI“ gelernt haben, strebt das Modell nach Kohärenz. Ein einmal geschriebener Fehler steht als Fakt im bisherigen Gesprächsverlauf (dem Kontext).
- Wenn du sagst: „Das ist falsch, korrigiere dich!“, steht im Kontext nun: [Falsche Behauptung] → [Korrektur-Versuch].
- Das Modell versucht nun, eine Antwort zu finden, die zu beiden passt. Oft führt das dazu, dass die KI zwar höflich entschuldigt, aber in der Logik verharrt oder neue, noch seltsamere Fehler einbaut, um den Widerspruch aufzulösen.
Die Lösung: Der „Hard Reset“ Ein neuer Chat löscht das gesamte Kontextfenster. Die „gedanklichen Leichen“ der Fehlantworten sind weg. Das Modell startet ohne Vorurteile und ohne den Zwang, zu einem früheren Fehler passen zu müssen.
Wann du einen neuen Chat starten solltest:
- Bei schweren Halluzinationen: Wenn die KI Fakten komplett erfindet.
- Bei Logik-Schleifen: Wenn die KI anfängt, sich zu wiederholen oder im Kreis zu argumentieren.
- Bei Themenwechseln: Wenn du von „Quantenphysik“ zu „Backrezepten“ wechselst, stören die Physik-Tokens nur die Berechnung der Back-Tokens.
2. Warum ein kleiner Kontext oft bessere Ergebnisse liefert
Es ist ein verbreiteter Irrglaube, dass „mehr Information immer besser ist“. In der Welt der LLMs gilt oft: Weniger ist mehr (Präzision).
A. Das Signal-Rausch-Verhältnis (Signal-to-Noise Ratio)
Jedes Token im Kontext ist ein Gewicht, das die Aufmerksamkeit (Attention) des Modells beansprucht.
- Kurzer Kontext: Das Modell hat ein sehr klares Signal. Es weiß genau, worum es geht.
- Langer Kontext: Es gibt viel „Rauschen“. Irrelevante Nebenbemerkungen, alte Fehler oder lange Einleitungen lenken die Aufmerksamkeit von der eigentlichen Kernfrage ab. Das Modell kann wichtige Details „übersehen“, obwohl sie im Text stehen.
B. Die Grenze des Kontextfensters
Jedes Modell hat eine maximale Kontextlänge (z.B. 128k Tokens).
- Wenn dieser Speicher voll ist, beginnt das Modell, die ältesten Informationen zu löschen, um Platz für neue zu machen.
- Das führt zu dem Effekt, dass die KI plötzlich vergisst, was ihr am Anfang des Chats gesagt wurde (z.B. eine wichtige Vorgabe wie „Antworte immer auf Englisch“).
C. Rechenlast und Latenz
Je länger der Kontext, desto mehr muss die GPU bei jedem einzelnen neuen Wort berechnen. Das macht die Antwortzeit länger und erhöht (bei kommerziellen APIs) die Kosten.
💡 Praxistipp: Die „Destillations-Methode“
Wenn ein Chat zu lang geworden ist, du aber wichtige Informationen behalten willst, nutze die Destillation:
- Lass die KI eine Zusammenfassung der bisherigen wichtigsten Ergebnisse schreiben: „Fasse alle bisherigen Entscheidungen und Fakten dieses Projekts in einer kompakten Liste zusammen.“
- Kopiere diese Liste.
- Starte einen neuen Chat.
- Füge die Liste als Start-Prompt ein: „Hier ist der aktuelle Stand meines Projekts: [Liste]. Basierend darauf, lass uns nun mit Schritt X weitermachen.“
Ergebnis: Du hast das Wissen behalten, aber den „Müll“ (das Rauschen und die Fehler) des alten Chats weggeworfen. Du hast dein Signal wieder optimiert!
📚 Zusammenfassung
| Szenario | Kontext-Strategie | Warum? |
|---|---|---|
| Fakten-Check / Definition | ⚡ Sehr kurz (Neuer Chat) | Maximale Präzision, kein Rauschen, keine Altlasten. |
| Kreatives Schreiben / Story | 📖 Lang | Die KI muss wissen, welche Charaktere es gibt und was vorher passiert ist. |
| Komplexes Coding‑Projekt | 🛠️ Medium / Gesteuert | Nur die relevanten Code-Snippets einfügen, nicht die ganze Datei-Historie. |
| Fehlerkorrektur | 🔄 Reset → Neuer Prompt | Unterbricht die „Kohärenz-Falle“ der Fehlantwort. |
Alle Antworten sind von der KI erstellt. Sie wurden von mir nochmal durchgelesen und nach meinem Wissensstand kontrolliert.
Zur Hauptseite: Wie funktionieren eigentlich LLMs?
Vorherige Seite: 🎭 Das Paradoxon des höflichen KI-Assistenten
Nächste Seite: 🤖 KI-Agenten – Von der Antwort zur Aktion
Pingback: Wie funktionieren eigentlich LLMs? | LierschIT
Pingback: 🤖 KI-Agenten – Von der Antwort zur Aktion | LierschIT
Pingback: 🎭 Das Paradoxon des höflichen KI-Assistenten | LierschIT