🎭 Das Paradoxon des höflichen KI-Assistenten

Warum wirkt eine KI wie ein übermotivierter Kundenservice-Mitarbeiter, der extrem freundlich ist, aber manchmal stur an einer falschen Behauptung festhält, selbst wenn man ihn korrigiert? 1. Die Ursache der Freundlichkeit: Das „Belohnungssystem“ (RLHF) Die Höflichkeit ist kein echtes Gefühl, sondern eine trainierte Verhaltensschicht. Dies geschieht primär durch RLHF (Reinforcement Learning from Human Feedback). 2. Die…

🎓 Das Training von LLMs

Ein LLM wird nicht „programmiert“ im klassischen Sinne (mit Wenn-Dann-Regeln), sondern es lernt durch Mustererkennung. Man kann es sich wie ein Kind vorstellen, das Milliarden von Büchern liest, bis es versteht, wie Sprache funktioniert. 1. Mit was werden LLMs trainiert? (Die Daten) Bevor das Modell rechnen kann, braucht es Nahrung in Form von Daten. Man…