🎨 Bonus: Generative KI für Bilder & Videos

Wenn du eine KI bittest, ein Bild zu erstellen, „zeichnet“ sie nicht im klassischen Sinne. Sie betreibt eine Form von mathematischer Bildhauerei. Anstatt Striche auf ein weißes Blatt zu setzen, beginnt sie mit einem Chaos aus Rauschen und schält daraus ein Bild heraus.

1. Das Grundprinzip: Die Diffusion (Das Entrauschen)

Die meisten modernen Bild-KIs (wie Midjourney, DALL-E 3 oder Stable Diffusion) basieren auf dem sogenannten Diffusion-Modell.

Wie funktioniert Diffusion?

Stell dir vor, du hast ein Foto von einem Hund. Nun fügst du Schritt für Schritt digitales Rauschen (wie das „Schneegestöber“ bei einem alten Fernseher) hinzu, bis das Bild nur noch aus zufälligen Pixeln besteht. Das nennt man Forward Diffusion.

Die KI wird nun darauf trainiert, diesen Prozess umzukehren (Reverse Diffusion). Sie lernt: „Wenn ein Bild so und so aussieht, welches Rauschen muss ich entfernen, damit es wieder wie ein Hund aussieht?“

Der Prozess bei der Generierung:

  1. Start: Die KI beginnt mit einem Bild, das zu 100 % aus zufälligem Rauschen besteht.
  2. Iteration: Die KI schaut sich das Rauschen an und fragt sich: „Welche Pixel muss ich minimal verändern, damit es ein bisschen mehr wie der gewünschte Prompt (z.B. ein Hund) aussieht?“
  3. Verfeinerung: In 25 bis 50 Schritten entfernt sie das Rauschen immer weiter, bis aus dem Chaos eine scharfe, detaillierte Form entsteht.

2. Die Brücke zwischen Text und Bild: CLIP

Damit die KI weiß, welches Bild aus dem Rauschen entstehen soll, braucht sie einen Übersetzer. Hier kommt ein System namens CLIP (Contrastive Language-Image Pre-training) ins Spiel.

CLIP wurde mit Millionen von Bild-Text-Paaren aus dem Internet trainiert. Es hat gelernt, dass das Wort „Hund“ und ein Foto eines Hundes denselben „Bedeutungspunkt“ (Vektor) in einem mathematischen Raum beschreiben.

Der Ablauf:

  • Dein Prompt → wird durch CLIP in einen Konzept-Vektor umgewandelt.
  • Dieser Vektor dient als Kompass für den Entrauschungsprozess. Er sagt dem Modell: „Entferne das Rauschen so, dass das Ergebnis in Richtung des Punktes ‚Hund‘ wandert.“

3. Effizienz-Trick: Der latente Raum (Latent Space)

Ein hochauflösendes Bild hat Millionen von Pixeln. Würde die KI jedes einzelne Pixel berechnen, bräuchte sie extrem viel VRAM und Zeit. Die Lösung ist der Latent Space.

  • Kompression: Das Bild wird in eine mathematisch komprimierte Version (einen „Latenten Vektor“) übersetzt. Das Bild ist dann nicht mehr als Pixel-Raster gespeichert, sondern als eine Art „Essenz“ oder „Bauplan“.
  • Berechnung: Das Entrauschen findet in diesem kleinen, effizienten Raum statt.
  • Dekodierung: Erst ganz am Ende wird dieser kompakte Bauplan durch einen Decoder wieder in ein echtes RGB-Pixelbild für unsere Augen umgewandelt.

4. Von Bildern zu Videos: Die Zeit-Dimension

Ein Video ist im Grunde eine schnelle Folge von Bildern (Frames). Aber wenn man einfach 30 einzelne Bilder generiert, würde das Video extrem flackern, da die KI in jedem Bild den Hund minimal anders zeichnet.

Um dies zu lösen, nutzen Video-KIs (wie Sora oder Runway) Temporale Konsistenz:

  1. Zeitliche Verbindung: Das Modell berechnet nicht nur den Raum (Pixel), sondern auch die Zeit. Es lernt, wie sich ein Objekt über die Zeit bewegen muss.
  2. Konsistenz-Wächter: Die KI stellt sicher, dass der „Vektor“ des Hundes in Frame 1 fast identisch ist mit dem in Frame 2.
  3. Interpolation: Zwischen den Haupt-Frames werden oft Zwischenbilder berechnet, um die Bewegung flüssig zu machen.

💡 Die Analogy: Der Bildhauer im Nebel

Stell dir vor, ein Bildhauer steht in einem Raum, der komplett mit dichtem, weißem Nebel gefüllt ist. Er kann nichts sehen, aber er hat einen Funkspruch (den Prompt) erhalten: „Hier steht eine Statue eines Löwen.“

  1. Der Start: Der Bildhauer sieht nur weißen Nebel (das Rauschen).
  2. Das Arbeiten: Er beginnt, den Nebel an Stellen wegzuwischen, an denen er vermutet, dass sich ein Löwe befinden könnte.
  3. Die Verfeinerung: Mit jedem Wischen wird die Form klarer. Er korrigiert die Ohren, verfeinert die Mähne, bis der Nebel verschwunden ist und die Statue perfekt sichtbar wird.
  4. Das Video: Wenn er einen Film drehen will, muss er sicherstellen, dass der Löwe in der nächsten Szene nicht plötzlich zu einer Katze wird, sondern dass die Statue in einer logischen Bewegung bleibt.

📚 Zusammenfassung

FeatureText-KI (LLM)Bild-KI (Diffusion)
GrundprinzipVorhersage des nächsten TokensIteratives Entfernen von Rauschen
Input-VerarbeitungTokenisierung → Text-VektorPrompt → CLIP → Konzept‑Vektor
ProzessLinear (Wort für Wort)Global (das ganze Bild wird gleichzeitig verfeinert)
ZielStatistische Wahrscheinlichkeit der SpracheStatistische Rekonstruktion eines Bildes
HauptherausforderungHalluzinationen (Fakten)Artefakte (z.B. zu viele Finger)

Alle Antworten sind von der KI erstellt. Sie wurden von mir nochmal durchgelesen und nach meinem Wissensstand kontrolliert.
Zur Hauptseite: Wie funktionieren eigentlich LLMs?
Vorherige Seite: 🌍 Gesellschaftliche Folgen von LLMs

2 Gedanken zu “🎨 Bonus: Generative KI für Bilder & Videos

  1. Pingback: Wie funktionieren eigentlich LLMs? | LierschIT

  2. Pingback: 🌍 Gesellschaftliche Folgen von LLMs | LierschIT

Schreibe einen Kommentar

Deine E-Mail-Adresse wird nicht veröffentlicht. Erforderliche Felder sind mit * markiert