Ein Knoten hat eine feste Menge HBM. Die Gewichte nehmen ihren Anteil, und was bleibt, ist der KV-Pool — der Speicher, den Ihre laufenden Agenten für ihren Kontext mieten. Wie hoch diese Miete ausfällt, entscheidet sich allein darin, was ein Modell pro Token an Aufmerksamkeitszustand speichert.
Der Explorer unten zeigt genau dieses Rennen. Wählen Sie GPU und Knotenbreite, wählen Sie die Gewichts-Präzision, und ziehen Sie dann den Kontext-Regler: Jede Aufmerksamkeitsfamilie (GQA, MLA, hybride lineare Aufmerksamkeit) frisst sich mit sehr unterschiedlicher Geschwindigkeit durch den Pool. Jede Zeile nimmt an: ein Modell pro Knoten — seine Gewichte sind bereits resident, seine Agenten teilen sich den Rest.
Alle Zahlen sind theoretische Obergrenzen aus Hersteller-Specs und derselben kvPerToken()-Mathematik wie im Inferenzrechner — Modell- und GPU-Konstanten stammen aus derselben Datenquelle, die beiden Tools können sich also nie widersprechen.
Interaktiver Rechner
KV-Cache-Speicherwachstums-Explorer
Sehen Sie, wie der KV-Cache eines Agenten den freien HBM-Speicher des Knotens füllt, während sein Kontext wächst — über Attention-Familien hinweg (GQA, MLA, hybride lineare Aufmerksamkeit). Dieselben Modell- und GPU-Daten wie im Inferenzrechner, damit jede Zahl konsistent bleibt.
Modelle
Qwen dense
Qwen MoE
Qwen3.8 / Qwen4-exp
Llama / open
DeepSeek
GLM / Z.ai (Zhipu)
Qwen3.5 / 3.6
NVIDIA
KV-Bytes pro Token = 2 · KV-Köpfe · Kopf-Dimension · Präzision · KV-Ebenen (GQA) bzw. (Latent- + RoPE-Dimension) · Präzision · KV-Ebenen (MLA); Hybridmodelle zählen nur Full-Attention-Ebenen. MTP-Draft-Ebenen und Aktivierungsspeicher sind ausgenommen. Formel folgt kvPerToken() des Inferenzrechners.
Warum die Familien so stark auseinanderlaufen
Drei architektonische Entscheidungen bestimmen die Steigung jeder Kurve:
- GQA speichert die vollen K und V für seine KV-Gruppen.
Llama-3.3-70Bhält 8 KV-Köpfe × 128 Kopf-Dim über 80 Ebenen — 320 KiB pro Token in BF16. - MLA speichert ein komprimiertes Latent. GLM-Stil
kv_lora_rank 512 + 64 RoPE-Dimkomprimiert auf ~88 KiB/Token — eine hypothetische GQA-Version desselben Modells mit gleicher Kopfzahl bräuchte ~3,7 MiB pro Token (rund 43-mal mehr), was kein einzelner Knoten bei langem Kontext überlebt. - Hybride lineare Aufmerksamkeit (Qwen3-Next) hält KV nur in jeder 4. Ebene (2 KV-Köpfe × 256 Kopf-Dim), die anderen 36 Ebenen tragen einen winzigen rekurrenten Zustand fester Größe — ~24 KiB/Token plus eine kleine Konstante.
Die praktische Lehre für die Fleet-Planung: Auf einem 8×B300-Knoten mit residenten GLM-5.2-fp8-Gewichten kostet ein Agent mit 128K Kontext rund 11 GiB Pool (KV in BF16) — es bleiben ~116 gleichzeitige Agenten bei diesem Kontext (roh, ohne Laufzeit-Marge). Bei 1M Kontext kostet derselbe Agent 88 GiB und auf den Knoten passen ~14 davon — Long Context ist keine bloße „Qualitäts"-Achse, sondern die dominante Kapazitätsachse.
Was der Explorer bewusst ausklammert
Um ehrlich zu bleiben, vernachlässigt die Schätzung Prefill-Aktivierungsspitzen, Präfix-Wiederverwendung im Stil von RadixAttention, MTP-Draft-KV und Offloading — jedes einzelne davon verschiebt echte Deployments, und jedes einzelne bestraft naïve Planung. Betrachten Sie die Zahlen als Obergrenze für Kapazität, nicht als Durchsatz-Versprechen.
Wo es weitergeht
- Der Inferenzrechner beantwortet, welche Batch-/Präzisions-Kombination eine gewählte GPU sättigt.
- Die Wirtschaftlichkeitsseite verwandelt denselben Knoten in Stundenkosten pro Million Token.