Wie LLMs wirklich funktionieren — Eine animierte Tour
Die meisten Erklärungen zu großen Sprachmodellen springen direkt zu Gleichungen. Diese hier beginnt mit einem laufenden Bild: Drücken Sie Play und verfolgen Sie, wie der Satz „The cat sat on the mat because it was" von rohem Text bis zum vorhergesagten nächsten Token wandert. Danach bekommt jede Stufe unter der Animation eine kurze, ehrliche Erklärung — was tatsächlich passiert und wo beliebte Metaphern täuschen.
Wahrscheinlichkeit des nächsten Tokens
1 · Ein Job: das nächste Token vorhersagen
Ein LLM ist eine Funktion über Text. Man gibt ihr alles Bisherige — sie antwortet mit einer Wahrscheinlichkeit für jedes mögliche nächste Token. Nichts weiter. Alles, was wir als „Verstehen“ erkennen, entsteht daraus, genau das extrem gut zu tun: Token für Token.
Die Version in einem Satz
Ein großes Sprachmodell ist eine Funktion, die eine Folge von Tokens nimmt und eine Wahrscheinlichkeitsverteilung über das nächste Token zurückgibt. Das ist das gesamte Produkt. Alles andere — das scheinbare Reasoning, der Stil, die Fakten, die es aufsagt — ist das, was entsteht, wenn man genau diese eine Funktion auf genug Text mit genug Parametern anpasst und dann immer wieder daraus sampelt.
Wer diesen Satz verinnerlicht hat, für den ist der Rest dieser Seite nur noch Maschinendetail darüber, wie die Funktion gebaut ist.
Stufe für Stufe
Von Buchstaben zu IDs
Das Modell arbeitet nie mit Zeichen oder Wörtern — es arbeitet mit Tokens, den Einheiten eines Tokenizers. Moderne Modelle (GPT-Stil, Qwen, Llama) nutzen Byte-level BPE: häufige Strings wie " cat" bleiben ein Token, seltene Komposita werden in Stücke gesplittet, die das Vokabular tatsächlich enthält. Der Tokenizer selbst wird aus dem Trainingskorpus gelernt — deshalb kosten nicht-englische Texte oft mehr Tokens pro Wort als englische.
Eine Konsequenz, die überrascht: Das Modell hat keinen eingebauten Begriff von „Wort". Rechtschreibtricks, Homoglyphen oder ungewöhnliche Leerzeichen können den Token-Strom ändern — und damit die Berechnung — selbst wenn die Bedeutung für Menschen identisch bleibt.
Von IDs zu Geometrie
Jede Token-ID indiziert eine Zeile der Embedding-Matrix: einen Vektor aus tausenden Zahlen. Nach dem Training tragen die Abstände zwischen diesen Vektoren Struktur — "cat" und "dog" sitzen näher beieinander als "cat" und "invoice", weil der Trainingsprozess sie dorthin geschoben hat, um ihre geteilten Kontexte besser vorherzusagen.
Auch die Position wird kodiert (modelle nutzen Rotary-Embeddings, RoPE), denn „Hund beißt Mann" und „Mann beißt Hund" müssen unterschiedlich berechnet werden, obwohl sie dieselben Tokens enthalten.
Attention: die eigentliche Idee
Attention ist das tragende Konzept. Für jedes Token berechnet das Modell drei Projektionen seines Vektors — eine Query, einen Key und einen Value — und dann:
- die Query von Token i wird gegen die Keys aller Tokens dotiert, die es sehen darf (im Decoder alle früheren),
- die Scores werden skaliert und per Softmax auf Gewichte gebracht, die sich zu 1 summieren,
- die Ausgabe ist die gewichtete Mischung der Values.
Das ist wörtlich eine weiche Lookup-Tabelle: „Angesichts dessen, wonach ich frage (Query) — wie relevant ist jedes frühere Token (Key), und was soll ich von den relevanten mitbringen (Value)?" In der Animation geht die dickste Linie von „it" zu „cat" — genau dieses Pronomen aufzulösen ist die Art Aufgabe, die Attention-Gewichte umsetzen.
Die quadratische Kostenlast von Schritt 1 — jedes Token gegen jedes frühere — ist der Grund, warum langer Kontext teuer ist, und warum Techniken wie Grouped-Query-Attention (GQA), gleitende Fenster und KV-Cache-Quantisierung existieren: Sie greifen alle diesen Term an.
Warum Tiefe schlägt Breite
Eine Attention-Schicht plus ein Feed-Forward-Netz ist ein Block. 30–90 davon zu stapeln ist, was Mustererkennung in etwas komponierbares verwandelt. Empirisch lernen flache Blocks Syntax und lokale Muster; tiefere Blocks bauen Abhängigkeiten über große Distanzen, faktisches Abrufen, sogar In-Context-Algorithmen wie Induction Heads. Jeder Block bekommt dazu eine Residual-Verbindung — eine direkte Autobahn für den ursprünglichen Vektor — sodass der Stack Repräsentationen progressiv bearbeitet, statt sie zu ersetzen.
Hier liegen auch die Parameter: Die Matrizen des Blocks skalieren mit dem Quadrat der Versteckten Größe, weshalb der Sprung von 4B auf 70B Modell der Gewichtsspeicher ungefähr 17× wird, nicht linear. Der Leitfaden zur LLM-Inferenz-Mathematik behandelt die resultierenden Speicher- und Compute-Budgets, und die Qwen3-Next-Notizen zeigen, wie sparse MoE-Aktivierung die Regel biegt.
Sampling: wo die „Kreativität" steckt
Der finale versteckte Vektor der letzten Position wird auf das Vokabular projiziert (eine Zahl pro möglicher Token), und Softmax wandelt Scores in Wahrscheinlichkeiten. Das Modell selbst ist bei gegebenem Seed vollständig deterministisch; die scheinbare Varianz kommt vom Sampling aus dieser Verteilung:
- Temperatur skaliert die Logits vor dem Softmax. Niedrig (0,2) → fast greedy, repetitiv, aber sicher. Hoch (1,2) → flachere Verteilung, überraschendere — und falschere — Entscheidungen.
- Top-p / Top-k schneiden die Verteilung vor dem Sampling ab und kappen den langen Schwanz unsinniger Tokens.
Stufe 6 der Animation zeigt genau das: derselbe Kontext, eine Verteilung über Kandidaten-Tokens, ein gesampelter Gewinner.
Training: vorhersagen, korrigieren, wiederholen
Vor-Training ist im Kern peinlich einfach: Man zeigt dem Modell einen Textausschnitt, bittet es, jedes nächste Token vorherzusagen, misst, wie falsch es lag (Cross-Entropy), und stellt alle Matrizen einen winzigen Schritt in Richtung weniger Fehler nach (Backpropagation + Optimierer). Billionenfach wiederholen. Es gibt keinen Lehrer, der warum erklärt — nur den rohen Druck des nächsten Tokens.
Was moderne Labore oben drauf setzen: überwachtes Fein-Training auf kuratierten Instruktion/Antwort-Paaren, dann Präferenz-Training (RLHF oder DPO), damit die Ausgaben des Modells der Verteilung hilfreicher, menschenbevorzugter Fortsetzungen folgen statt nur wahrscheinlicher. Das post-trainierte Modell beantwortet Fragen; das Basismodel setzt nur Text fort.
Was die Animation auslässt
Ehrlichkeits-Runde — die Teile, die die schöne Version überspringt:
- KV-Cache & Decode-Mechanik. Echte Generierung cached Keys und Values, damit jedes neue Token den Prompt nicht komplett neu verarbeitet; der Cache dominiert den Serving-Speicher bei langem Kontext. Der Inferenz-Rechner lässt ihn berechnen.
- MoE-Routing. Viele aktuelle Modelle (auch Qwen3-Next) leiten jedes Token durch eine Teilmenge von Experten; die sechs Stufen bleiben identisch, nur der Feed-Forward-Schritt wird dünnbesetzt.
- Multimodalität. Bilder, Audio und Video kommen als weitere Tokens herein; ab Stufe 3 ist die Pipeline dieselbe.
- Reasoning-Modelle. „Denk"-Tokens sind derselbe nächste-Token-Loop — nur länger laufen, bevor geantwortet wird. Die Maschinerie dieses Artikels ändert sich nicht.
Wer die Leistungsseite will — wie sich das alles auf FLOPS, Bandbreite und Euro abbildet —, fährt mit der Seite zur Inferenz-Ökonomie fort, die auf derselben Pipeline aus Sicht der Hardware aufbaut.