Ein Paper von Salesforce AI Research landete im September 2026 mit einer Behauptung der besten Sorte — einem negativen Resultat mit Belegen: Über vier Reasoning-Modelle und sechs Reasoning-Tasks hinweg hält eine KV-Cache-Eviction-Policy, die den Trace im Wortsinn per Münzwurf verarbeitet, den stärksten gelernten Evictor der Literatur stand, und liefert dabei 32–43 % höheren Durchsatz in vLLM — weil sie überhaupt keinen Score berechnet12. Wer Serving-Infrastruktur baut, für den ist das keine Kuriosität. Es ist eine direkte Prüfung dessen, was die Forschung der letzten drei Jahre zum Thema „welcher gecachte Token wird später wichtig" tatsächlich gekauft hat — und die Antwort lautet: fast nichts, auf Reasoning-Trace-Workloads — den langen selbstgenerierten Traces, auf die Agenten die meisten ihrer Tokens verschwenden — wobei das Paper agentic Traces selbst nie testet.
Dieser Guide nimmt die Behauptung auf der Ebene auseinander, die uns interessiert: was die outlier-zentrierte Eviction-Literatur zu optimieren behauptet, was das Paper tatsächlich gemessen hat, warum eine zufällige Policy einer gelernten gleichziehen kann (und in welchen Settings sie es nachweislich nicht kann), was die gesamte Lesart widerlegen würde, und wann man trotzdem für einen gelernten Evictor zahlen sollte. Provenienz zuerst, wie immer: Das ist Salesforce Research plus UIUC, unter der Führung von Heng Wang und Kollegen, mit Autoren wie Shelby Heinecke (Salesforce AI Research) sowie Jiawei Han und Heng Ji (UIUC)1. Ein Hersteller-Forschungslabor, das über eine Komponente, die es selbst nicht verkauft, veröffentlicht „Eure ausgeklügelte Scoring-Passe ist nichts wert", hat eine ordentliche Anreizstruktur — aber die Durchsatzversprechen des Papers hängen daran, dass seine vLLM-Integration der faire Vergleich ist, und Salesforce liefert Serving-Stacks. Den Effizienzabschnitt also mit der üblichen Vorsicht lesen.
1. Was outlier-zentrierte KV-Eviction zu lösen behauptet
Jede Methode dieser Familie teilt eine Prämisse: Die zukünftige Wichtigkeit eines gecachten Tokens ist aus Statistiken des Caches selbst schätzbar, und wer unter hartem Budget die top-gescorten Tokens behält, stellt den Großteil der Genauigkeit von Full Attention wieder her. Die Familien trennt das Scoring-Signal, und jede Paper-Generation ist ein streng besserer Score — der Mechanismus hier präzise benannt, weil der ganze Artikel darauf beruht, was jedes Signal tatsächlich misst:
| Methode (Jahr) | Signal | Distributionelle Prämisse | Regelbasierter Schutz |
|---|---|---|---|
| H2O (2023)3 | Akkumulierte Attention seit Cache-Eintritt | Heavy Hitter tragen künftige Wichtigkeit | Nichts (der Score entscheidet) |
| StreamingLLM (2023)4 | Keines | Frühe Positionen sind Attention Sinks | Erste Positionen + Recency-Fenster |
| SnapKV (2024)5 | Attention aus recentem Query-Fenster, über Nachbarn gepoolt | Recent Queries sagen künftige voraus | Nur Sink-Tokens |
| R-KV (2025)6 | SnapKV-Score + Key-Cosine-Redundanz-Strafe | Wiederholter Inhalt ist redundant | Nur Sink-Tokens |
| VaSE (2026)7 | Value-Magnitude + stochastische Füllung | Der Value-Norm-Rand ist tragend | Nur Sink-Tokens |
| TriAttention (2026)8 | Trigonometrischer Q/K-Positionsabstand + Normen | Pre-RoPE-Q/K-Konzentration sagt Key-Nutzung voraus | Ganzer Prompt per Voreinstellung |
In Prosa:
- H2O (2023) — akkumulierte Aufmerksamkeit: behalte die Tokens, die seit ihrem Eintritt in den Cache die meiste Attention-Masse erhalten haben; die „Heavy Hitter" sollen die tragenden sein3.
- StreamingLLM (2023) — gar kein Score, aber das strukturelle Prior, das alle kopiert haben: die ersten paar Attention-Sink-Positionen plus ein zusammenhängendes Recency-Fenster4.
- SnapKV (2024) — Attention aus einem recenten Fenster von Queries, max-gepoolt über Nachbarpositionen: Was die letzten Queries angeschaut haben, sagt voraus, was künftige anschauen werden5.
- R-KV (2025) — SnapKV-Score gemischt mit einer Redundanz-Strafe (mittlere Cosine-Ähnlichkeit eines Keys zu allen anderen gecachten Keys), damit ein wiederholter Gedanke nicht doppelt behalten wird6.
- VaSE (2026) — bewertet Values statt Keys: Ein kleiner Bruchteil der Value-Zustände hat abnormal große Magnituden, und VaSEs eigene Ablation zeigt: Verwirft man die größten Magnituden, kollabiert GSM8K auf 14,3 % — 38,9 Punkte unter zufälliger Eviction — weil das Modell in repetitive Reasoning-Schleifen fällt7. Das ist das reinste Outlier-Schutzargument der Familie: Die Verteilung hat schwere Ränder, und die Ränder sind tragend.
- TriAttention (2026) — positionsabhängige Key-Statistiken: Pre-RoPE Query-/Key-Vektoren konzentrieren sich um feste Nicht-Null-Zentren, Key-Wichtigkeit ist also eine kalibrierte trigonometrische Funktion des Q/K-Abstands, plus Q/K-Normen8.
Von außen sieht diese Progression so aus: Quantilen-Logik („behalte den Attention-/Heavy-Hitter-Rand"), spektrale Argumente (Cosine-Redundanz ≈ Unterraum-Abdeckung; die CurDKV-Linie, auf der VaSE aufbaut, nutzt buchstäblich Random-Projection-Leverage-Scores — eine SVD-artige Statistik) und Outlier-Magnitude-Argumente („Der schiefe Rand der Value-Normen muss erhalten bleiben"). Die Rahmung ist distributionell: Der Cache enthält wenige hochinformative Outlier in einem Meer aus Rauschen, und Eviction ist ein Feature-Selection-Problem — Tokens nach Wichtigkeit ranken, den Rand behalten.
Drei Jahre inkrementeller Benchmarks wurden auf dieser Rahmung gebaut. Das Salesforce-Resultat ist das kontrollierteste bislang, das alles andere konstant hält und fragt: Wie viel trägt das Ranking selbst — der eigentliche Output dieser Maschinerie — bei?
2. Das Gegenargument: auf Reasoning-Traces kauft das Ranking nichts
Die getestete Methode ist fast schon provokant einfach. Random Attention tut genau zwei Dinge:
- Die Frage schützen. Jede Prefill-Position — System-Prompt, Chat-Template, die Frage selbst — wird nie verworfen.
- Den Rest streuen, pro Head. Jede verbleibende Position bekommt einen i.i.d. gleichverteilten Zufallsscore; jeder KV-Head behält unabhängig sein Top-K. Keine Statistiken, keine Kalibrierung, keine Scoring-Passe — ein RNG-Wurf und ein Top-K pro Eviction-Runde2.
Der Evaluationsraster: Qwen3-4B/14B/32B und Phi-4-reasoning über MATH500, GPQA-Diamond, AIME 2025/2026, HMMT und LiveCodeBench-v6, bei einem festen Cache-Budget um 4×-Kompression (~3× bei LiveCodeBench), jede Zelle abgesichert mit gepaarten, Problem-geclusterten Bootstrap-Konfidenzintervallen und Sign-Tests2. Die Kernaussagen, hier aus Tabelle 1 des Papers nachgerechnet:
- Random Attention schlägt SnapKV um 4,3–35,3 Punkte je nach Modell und Task (z. B. Phi-4-reasoning LiveCodeBench: 0,667 gegen 0,314 — ein Abstand von 35,3 Punkten).
- Es liegt statistisch gleichauf oder vor VaSE und R-KV auf Mathe- und Wissenschafts-Tasks in den drei Modellen des Hauptrasters — Ausnahme: im Qwen3-14B-Anhangsraster bleibt VaSE auf AIME signifikant vorn — und liegt „signifikant vorn in 31 der 60 Basisvergleiche" des Hauptrasters1.
- Gegen TriAttention — die stärkste Baseline — Gleichstand auf den meisten Zellen; TriAttentions einziger signifikanter Sieg im ganzen Hauptraster ist Code-Reasoning auf Qwen3-32B, mit etwa drei Punkten, was das Paper auf die Prompt-Länge zurückführt, nicht auf die Auswahlqualität2.
- Full Attention bleibt die Decke (z. B. Qwen3-4B MATH500: 0,939 voll gegen 0,874 zufällig bei 4×) — Eviction kostet also weiterhin Genauigkeit; die Behauptung des Papers ist, dass kein Selektor mehr davon zurückholt als ein Münzwurf, sobald der Prompt geschützt ist.
Dann die kontrollierten Experimente, in denen das Paper seinen Lohn verdient:
Der Prompt ist der fragile Teil. Frühere Methoden sind sich uneinig, ob der Prompt überlebt: TriAttention pinnt ihn per Regel; SnapKV, R-KV und VaSE überlassen ihn dem Score und behalten nur Attention Sinks. Gibt man jeder Methode dieselbe Behalte-den-Prompt-Regel, verschwindet der Großteil der Abstände zwischen den Methoden. Der Gewinn der Regel ordnet sich exakt nach der Menge an Prompt, die jeder Score zuvor still verloren hatte: SnapKV, der am wenigsten von der Frage behält, gewinnt bis zu +22,5 Punkte (Phi-4 GPQA-D); R-KV, der ohnehin das Meiste behielt, bewegt sich um höchstens ~2 Punkte. Und die signal-freien Zeilen machen den Punkt brutal deutlich: Ein Recency-Fenster ohne Prompt-Schutz erzielt 0,246 auf Qwen3-4B MATH500; mit der Regel 0,843 — ein Swing von +59,7 Punkten, der jeden Selektor-Unterschied der Tabelle dwarf2. Derselbe Confound, so das Paper, erklärt, warum frühere Arbeiten zufällige Baselines weit hinter der gescorten Auswahl sahen: Ihre zufälligen Baselines verloren den Prompt2.
Der Trace schützt sich selbst. Reasoning-Traces sind auf zwei Ebenen redundant. Im Text formuliert das Modell um, was es gerade verwendet. Und über Heads: Jeder KV-Head hält seine eigene Kopie jedes Tokens, und Eviction entscheidet pro Head, welche Kopien sterben. Ein Planted-Fact-Experiment quantifiziert das Pooling über Heads: Der beste einzelne Retrieval-Head von Qwen3-4B liefert einen gepflanzten Wert allein nur in einem kleinen Teil der Versuche; mehrere Heads zusammen fast immer; das Pooling ist superadditiv — Form und Ort der überlebenden Kopien spielen keine Rolle, nur ob irgendwo eine brauchbare Kopie überlebt2. Unabhängige Zufallsziehungen pro Head sind exakt die Policy, die „mindestens eine überlebende Kopie" maximiert — Rechnung in Abschnitt 3.
Needle-Finding ist die eine echte Fähigkeit — und sie transferiert nicht. Ein Passwortsperiment (einmal genannt, nie wiederholt): Random Attention reproduziert das Passwort nie; R-KV, der beste Needle-Finder, findet es meistens. Aber R-KV führt nur eine Spalte des Hauptrasters an, während TriAttention, die stärkste Gesamt-Baseline, beim Needle fast nichts zurückholt. Aggregierte Stärke und Needle-Finding sind dissociiert — und Reasoning-Traces formulieren eine tragende Tatsache selten genau einmal2.
Unabhängige Konvergenz: VestigeKV. Eine andere Gruppe, in derselben Woche publizierend (arXiv:2609.03949, 3. Sept. 2026), erreichte ein komplementäres Negativresultat aus der Gegenrichtung: Auf einem NoPE-MLA-Modell kollabiert Auswahl nach beobachteter Attention — der H2O/SnapKV-Mechanismus in seiner reinsten Form — auf 0,00–0,33 Needle-Retrieval bei lang gehaltenen Caches, weil die Wichtigkeit eines Tokens zum Eviction-Zeitpunkt noch nicht beobachtet wurde9. Ihre Lösung ist kein besserer Score, sondern eine andere Topologie: Die Top-m-Zeilen bleiben in einem attendierten Tier, alles andere wandert — exakt, nie gelöscht — in ein GPU-residentes Archiv. Die konvergente Lektion beider Papers: Der interessante Designraum ist nicht „bessere Wichtigkeitsschätzungen", sondern was strukturell nie verloren geht (Random Attention: der Prompt; VestigeKV: alles, nur eben womöglich abseits des Tiers) plus was die Wiederfindbarkeit tatsächlich bestimmt (Abdeckung und Redundanz, nicht Rang).
Die Durchsatz-Deltas. In vLLM auf einer H200 (1k-Token-Prompts, 32k-Generierungen, 128 Anfragen — Qwen3-32B auf 96 gedeckelt) liefert Random Attention: 2.046 gegen 1.494 Tok/s (Qwen3-4B), 1.737 gegen 1.212 (Phi-4-reasoning), 1.819 gegen 1.303 (Qwen3-14B), 923 gegen 700 (Qwen3-32B) — also 32–43 % über TriAttention bei identischer Genauigkeit und Budget (nachgerechnet: +37/+43/+40/+32 %) und das 1,6-fache bis 2,7-fache Full-Attention-Durchsatz2. Der Mechanismus ist profan und wichtig: Bei 32k Tokens pro Anfrage begrenzt der KV-Cache, nicht die Rechenleistung, wie viele Anfragen gleichzeitig laufen — jedes Verdoppeln des Cache-Gewinns ist geteilt und langweilig. Die Rest-Reihenfolge macht die Scoring-Passe. Jede Eviction-Runde kostet unter Random Attention laut Paper gemessene 0,30 ms (es verdichtet nur), unter TriAttention aber 1,47–1,64 ms (es bewertet zuerst, Kandidaten-Keys durch vLLMs Blocktabellen, Schicht für Schicht); bei 128 parallelen Anfragen, die jeweils etwa alle 64 Tokens verdichtet werden, wird bei nahezu jedem Decode-Schritt irgendeine Anfrage verdichtet — und vLLM verdichtet an einem Synchronisationspunkt, heißt: Der ganze Batch wartet, während eine Anfrage bewertet. Ein paar Millisekunden mal Zehntausende Verdichtungseignisse — die Scoring-Passe frisst ein Drittel des Durchsatzes2.
3. Die Mathematik: Warum kann eine Zufalls-Policy einer gelernten gleichziehen?
Dass eine Zufalls-Policy mit einer gelernten gleichzieht, sollte sich falsch anfühlen. Man schreibe aus, wann das nicht geht — und das Agenten-Setting beginnt zu ergeben.
Das Setting, in dem Zufall schlecht verliert: Niedrigrang- / Starke-Outlier-Verteilungen. Angenommen, die Nützlichkeitsmasse des Caches ist konzentriert: Ein Bruchteil der Positionen trägt fast die gesamte zukünftige Attention-Masse (Nadeln, gepflanzte Fakten, seltene Key-Statistiken im Sinne von VaSE), und der Rest ist austauschbares Rauschen. Ein gelernter Selektor, der Wichtigkeit ranken kann, erfasst Masse ≈ sein wahres Top-K; eine zufällige K-Auswahl erfasst die Basisrate. Bei Needle-Experimenten passiert exakt das — Random Attention liegt beim Passwort-Experiment bei null, weil ein einmal genannter Wert pro Head Überlebenswahrscheinlichkeit K/T hat (Budget K über T Kandidaten) und bei per-Kopf-Kopie-Überleben p die Wahrscheinlichkeit, dass alle H KV-Heads ihn verlieren, (1−p)^H beträgt. Das Paper zitiert ein Begleitresultat (Wang, 2026), das beweist, dass zufällige Caches beim Pointer-Chasing verlieren müssen, wenn nichts redundant ist2. Wenn der Workload (a) genuin niedranger ist — tragender Inhalt, genau einmal in langem Kontext genannt — hat ein gelerntes Signal echten Spielraum — und Needle-in-Haystack-RAG lebt genau hier. Das ist das Regime, an das die outlier-zentrierte Literatur glaubt.
Warum das Reasoning-/Agenten-Setting nicht dieses Regime ist. Der Zielterm, den Outlier-Methoden optimieren (Hit-Rate auf dem hochinformativen Rand), ist orthogonal zu dem, was die Endgenauigkeit auf Reasoning-Traces tatsächlich vorhersagt: das Behalten von (i) dem Prompt, (ii) mindestens einer wiederholten Kopie jedes Arbeitswerts. Arithmetik der Head-Redundanz für ein GQA-Modell mit H KV-Heads (Qwen3-4B: H = 8) und pro Head Behaltensquote p über den Trace:
| Pro-Head-Behaltensquote p | P(mindestens ein Head behält Token i) = 1−(1−p)^H, H = 8 | Erwartete überlebende Kopien |
|---|---|---|
| 0,25 (4×-Kompression) | 90,0 % | 2,0 |
| 0,50 | 99,6 % | 4,0 |
| 0,75 | ~100 % | 6,0 |
(Nachgerechnet: 0,75^8 = 0,100; 0,5^8 = 0,0039.) Bei 4×-Kompression überlebt jeder Trace-Token irgendwo mit Wahrscheinlichkeit 1 − 0,75^8 ≈ 0,900 — bevor die Text-Redundanz überhaupt eingeht; hinzu kommt, dass Reasoning-Traces Arbeitswerte im Text wiederholen (R-KVs eigene Redundanzanalyse motivierte seine Cosine-Strafe genau dadurch6). Die effektive Behaltensquote von allem, was das Modell gerade nutzt, liegt also nahe 1 — egal, wie die behaltenen Mengen gewählt sind, sofern die Ziehungen über Heads unabhängig sind, was Zufall garantiert und ein gemeinsamer deterministischer Score nicht. Das ist der schärfste mechanistische Punkt des Papers: Ein deterministischer Top-K-Score, identisch über Heads angewendet, erzeugt korrelierte Überlebende — liegt der Score bei einem Token falsch, liegt er überall gleichzeitig falsch. Zufällige Ziehungen de-korrelieren den Ausfall. Das gelernte Signal muss über Rank richtig sein, das Zufallssignal nur über Abdeckung.
Ein durchgerechnetes Beispiel macht den Korrelationsfehler konkret. Man nehme VaSEs stochastische Füllung (Positionen werden mit ihrer Wahrscheinlichkeit proportional zum SnapKV-Score gezogen, unabhängig pro Slot) gegen ein deterministisches Top-K. Für einen Token, den der Score unterschätzt — ein Arbeitswert, den die Recent-Window-Attention noch nicht besucht hat —, setzt die deterministische Policy ihn in allen 8 Heads unter die Cutoff-Grenze derselben Eviction-Runde: Sterbewahrscheinlichkeit 1. Bei unabhängigen Ziehungen ist das Überleben pro Head p ≥ (1 − (1 − ᾱ/Z))^K, strikt positiv — jeder Token behält über jede Runde hinweg eine Chance ungleich null. Die VaSE-Autoren haben diese Eigenschaft in ihrem eigenen Paper bewiesen7 — was still amüsant ist: Die stochastische Hälfte von VaSE ähnelt Random Attention mehr als ihrer eigenen deterministischen Scoring-Hälfte. Umgekehrt der Fehlerfall für Zufall: Eine einmal genannte, nie wiederholte Nadel bräuchte konzentriertes Behalten (ein Head, der den ganzen Span hält, schlägt verstreute Fragmente in allen Heads — außer das Experiment zeigte, dass selbst das falsch ist: Verstreute Kopien poolen über Heads fein). Was Zufall nicht kann: das Behalten eines konkreten Spans über die Basisrate hinaus garantieren. Was deterministisches Scoring nicht kann: seine Fehler streuen. Reasoning-Traces sind so gebaut, dass der erste Fehlerfall nicht eintritt (Wiederholung) und der zweite fatal ist, wenn er eintritt (der verworfene Prompt). Diese Asymmetrie, nicht die Scoring-Qualität, ist das Resultat des Papers.
Zu den absoluten Zahlen — warum Eviction auf diesen Workloads in Bytes von „nutzlos" bis „zwingend" reicht: Ein Qwen3-4B-Token kostet 2 · 2 Bytes · 8 KV-Heads · 128 Dims · 36 Schichten = 147.456 Bytes ≈ 144 KiB in fp16 (Qwen3-32B: 256 KiB pro Token). Ein 32.768-Token-Trace ist also 4,5 GiB (32B: 8,0 GiB) KV pro Sequenz — auf einer 141-GB-H200 ist das die Begrenzung der parallelen Anfragen, weshalb 4×-Kompression die Batch-Kapazität grob vervierfacht — ein Gewinn, den jede Evictor-Methode einheimst; wie viel davon am Ende in Durchsatz ankommt, entscheidet der Scorer (bei Random Attention: 1,6- bis 2,7-facher Full-Attention-Durchsatz). Die Bytes-Rechnung macht die Scoring-Passe zum einzigen Unterschied zwischen Evictors — und die Scoring-Passe ist die einzige Komponente, die Zufall löscht.
Nun das Argument, ausdrücklich als Argument und nicht als Fakt: Die Outlier-zentrierte Linie (H2O-Heavy-Hitter, VaSE-Value-Ränder, CurDKV-Leverage-Scores, TriAttention-Positions-Statistiken) hat ihre Evaluationsmethodik vom langen Kontext geerbt (Perplexity-artige und Long-Input-Benchmarks), wo die Nadel-Rahmung wörtlich ist — ein Fakt, einmal genannt, in einem langen Heuhaufen. Reasoning- und Agenten-Traces invertieren die Datenlage: kurzer Prompt, lange selbst generierte Ausgabe, der Cache füllt sich mit dem Restaten und Kopf-Duplizieren des Modells. Es ist eine plausible Hypothese — gestützt auf Tabellen 1 und 2 des Papers, das Planted-Fact-Experiment und konvergent auf VestigeKVs unabhängigen Befund, dass Auswahl nach beobachteter Attention (H2O, SnapKV) auf einem NoPE-MLA-Modell auf 0,00–0,33 Needle-Retrieval kollabiert, weil Wichtigkeit noch nicht beobachtet wurde9 —, dass ein erheblicher Teil der Eviction-Literatur auf eine Trace-Verteilung überindiziert ist, für die ihre Signale nie gebaut waren, und dass die Benchmark-Auswahl, nicht die Signalqualität, die berichteten Lücken trieb. Der letzte Satz ist unsere Schlussfolgerung, nicht die Behauptung des Papers; das Paper beweist sie nur für seinen Raster.
4. Was würde „Zufall genügt" widerlegen
Die ehrlichen Fehlermodi, in absteigender Sorge:
- Workload-Scope. Alles oben gilt für Reasoning-Traces: kurzer Prompt, lange selbst generierte Ausgabe, Budget bei 2–4×-Kompression. Ein Needle-in-Haystack-RAG-Workload — lange Eingabe, viele Dokumente, einmal genannte Fakten — ist exakt das Niedrigrang-Regime, in dem Abschnitt 3 sagt, dass Zufall verlieren muss; das Passwort-Experiment in §5.3 des Papers ist eine Miniatur davon, und Zufall erzielt dort null. Wer „zufällige Eviction genügt" als Universalanspruch liest, liest das Paper über.
- Der Prompt-Pinning-Confound ist das ganze Paper. Reduziert sich das Resultat auf „der Prompt zählt, frühere Baseline warfen ihn weg", ist das Delta ein Benchmark-Konstruktionsartefakt, und ein gelernter Scorer mit Prompt-Schutz könnte Zufall auf Workloads mit langen, teilweise nützlichen Prompts schlagen. Das Paper antizipiert das: Unter gematchtem Schutz liegen die geschützten Baselines auf mehreren Zellen dennoch 1–3 Punkte hinter Zufall — ein kleines, aber real existierendes Restdelta zugunsten von Zufall, das die stärkste Version der Behauptung ist. Aber TriAttentions Code-Sieg auf Qwen3-32B zeigt: Gelernte Signale sind nicht buchstäblich wertlos.
- Ein-Framework-Deployment. Die 32–43 %- Durchsatzmarge ist in einer einzigen vLLM-Integration gemessen, und das Paper räumt ein, dass TriAttentions In-Framework-Scorer nicht gefused war („der dreifache Abstand zu TriAttention hier spiegelt eine ungefusste Neuimplementierung seines Scorers"). Ein gefuster Scorer-Kernel könnte große Teile der Effizienzmarge zurückholen; die Genauigkeits-Parität allerdings ist kernel-unabhängig.
- Trace-Bias. Die sechs Tasks sind Mathe, Wissenschaft, Code — Domänen, in denen Modelle stark wiederholen. Agenten-Traces mit Tool-Call-Ausgaben (JSON-Payloads, Stacktraces, veraltete abgerufene Dokumente) enthalten weit mehr einmal-genannten, nie wiederholten Inhalt als Mathe; das Passwort-Experiment legt nahe, dass Zufall ihn verwirft. Tool-Call-Lücken sind zudem temporal strukturiert (Interaktionsgrenzen) — ein gelerntes Signal könnte sie nahezu kostenlos ausnutzen.
- Replikation allgemein. Ein Paper, ein Labor, v1 bei Einreichung, vier Qwen-Familien-Modelle plus Phi-4 — die Modellvielfalt ist dünner als die Taskvielfalt. SGLang-Replikation, GPT-OSS-/Llama-Familien-Modelle und die Agenten-Trace-Benchmarks 2027 sind allesamt offen.
5. Praktische Anleitung: Wann gelernte Eviction das Geld wert ist
Wo die Hit-Rate pro Byte aufhört zu zählen, sollte man aufhören, dafür zu zahlen. Die Entscheidung als Matrix über die zwei Arbeitslast-Achsen, die Abschnitt 3 als die eigentlich entscheidenden gezeigt hat:
| Workload | Prompt-Länge | Inhalts-Redundanz | Einmal genannte Fakten | Empfehlung |
|---|---|---|---|---|
| Mathe-/Wissenschafts-Reasoning-Serving | Kurz (~100 Tokens) | Hoch (wiederholt, Head-dupliziert) | Selten | Prompt pinnen, Trace zufällig verwerfen2 |
| Code-Reasoning | Lang (6× Mathe-Prompts) | Mittel | Einige | Prompt pinnen; Budgetieren mit Bedacht — der Prompt allein frisst bis zur Hälfte des Caches2 |
| Needle-artige Long-Context-QA | Lang (Dokumente) | Niedrig | Der ganze Punkt | Gelerntes Signal verdient seinen Score (R-KV-Klasse)2 |
| Agenten-Traces, viele Tool-Call-Schleifen | Wächst mit Frontier | Hoch für Pläne, niedrig für Tool-Payloads | Ja — Zahlen in Payloads | Zufalls-Basis + periodischer gelernter Durchgang, oder Archiv-Tier9 |
| Keine Eviction (passt in HBM) | — | — | — | Unterlassen; jede Methode kostet Genauigkeit2 |
In Prosa:
- Reasoning-Model-Serving unter Memory-Budget, hohe Trace-Redundanz, kurze Prompts: Prompt (und Sinks) pinnen, den Trace pro Head gleichverteilt zufällig verwerfen. Keine Kalibrierung, kein Tuning, keine Scoring-Passe — und es ist der Boden, den jedes neue Selektionssignal bei gematchtem Budget und gematchtem Prompt-Schutz schlagen muss2. Die 32–43 %-Durchsatzmarge ist heute in vLLM real.
- Long-Context-Retrieval-Workloads (lange Eingabe, kurze Ausgabe): Das Nadel-Regime ist real, gelernte Signale verdienen dort ihren Score, und VestigeKV-artiges, query-unabhängiges Archiv-Tiering zeigt einen dritten Weg — in ein Tier auslagern statt löschen —, der auf Needle-Tasks sowohl Zufall als auch gescortes Verwerfen schlägt9. Der Scoping-Satz des Papers selbst: Sein Setting unterscheidet sich, weil „einem kurzen Prompt eine lange Generierung folgt, sodass der eigene Trace des Modells den Cache füllt"2.
- Memory-Bandbreiten-gebundenes Decoding mit wenig Prefix-Sharing: Pro Sequenz begrenzt die Eviction-Qualität weiterhin die Genauigkeit pro Byte; ohne geteilte Präfixe und mit kurzen Sequenzen bringt Eviction wenig und riskiert OOM — wer aber verdichtet, für den ist der Scoring-Passe-Overhead, den das Paper quantifiziert (wenige ms pro Eviction-Runde × eine Verdichtung alle paar Decode-Schritte × Ganz-Batch-Synchronisations-Stalls), eine Serving-Durchsatz-Posten im Kostenschlüssel — einplanen.
- Agenten-Traces in Produktion: Der Schuh passt — hohe Prompt-/System-Präfix-Wiederverwendung, Tool-Call-Grenzen, wiederholte Pläne — überwiegend das zufallsfreundliche Regime, aber die Tool-Result-Payloads sind das Nadel-Risiko. Liest Ihr Agent fünfzehn Züge später eine Zahl aus einer Tool-Antwort, wurde dieser Wert genau einmal genannt; ein inhaltsabhängiges Signal (R-KV-artige akkumulierte Attention) ist der bekannte Weg, ihn zu behalten. Erst die eigenen Traces charakterisieren, dann wählen.
Die übertragbare Lektion ist nicht „Zufall gewinnt." Sie ist, dass das Paper das Problem neu rahmt: Die Eviction-Genauigkeit entscheidet sich daran, was man schützt, nicht daran, wie man den Rest rankt. Die offenen Fragen, die es hinterlässt — lange, teilweise Gerüst-Prompts budgetieren (Code-Prompts allein liefen 6× die Tokens von MATH500 unter demselben Tokenizer, bis zur Hälfte des Budgets2) und seltene einmal genannte Fakten zurückgewinnen — sind exakt dort, wo die nächste Runde echter Selektionsarbeit hin sollte. Und wer heute keine Zufall-mit-Prompt-Baseline im Eviction-Pipeline hat, weiß nicht, wie viel Genauigkeit der eigene Scorer kauft. Wahrscheinlich fast nichts. Nachmessen.
Quellen
Footnotes
-
Wang, H., Qiu, J., Zhao, W., Qian, C., Yang, L., Han, J., Ji, H., Savarese, S., Heinecke, S., Wang, H. — Random Attention: Rethinking KV Cache Eviction for Efficient Reasoning, arXiv:2609.03430, 3. Sept. 2026 (Abstract-Seite, „vergleichbar mit der stärksten Baseline … 32–43 % höherer Durchsatz"): https://arxiv.org/abs/2609.03430 ↩ ↩2 ↩3
-
Dasselbe Paper, HTML-Volltext — Tabelle 1 (Genauigkeitsraster), Tabelle 2 (gematchter Prompt-Schutz: SnapKV +22,5, Recency-Fenster +59,7 Punkte-Swings), Tabelle 4 (Durchsatz: 2.046/1.737/1.819/923 gegen TriAttentions 1.494/1.212/1.303/700 Tok/s), §5.2 Planted-Fact-Experiment, §5.3 Passwort-Experiment, §6 Effizienz-Zerlegung: https://arxiv.org/html/2609.03430v1 ↩ ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8 ↩9 ↩10 ↩11 ↩12 ↩13 ↩14 ↩15 ↩16 ↩17 ↩18
-
Zhang, Z. et al. — H2O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models, NeurIPS 2023, akkumulierte-Attention-Scoring: https://arxiv.org/abs/2306.14048 ↩ ↩2
-
Xiao, G. et al. — Efficient Streaming Language Models with Attention Sinks, ICLR 2024, Sink- plus Recency-Fenster-Struktur: https://arxiv.org/abs/2309.17453 ↩ ↩2
-
Li, Y. et al. — SnapKV: LLM Knows What You are Looking for Before Generation, NeurIPS 2024, Recent-Window-Attention über Nachbarpositionen gepoolt: https://arxiv.org/abs/2404.14469 ↩ ↩2
-
Cai, Z. et al. — R-KV: Redundancy-aware KV Cache Compression for Reasoning Models, 2025, SnapKV-Score + Key-Cosine-Redundanz-Strafe: https://arxiv.org/abs/2505.24133 ↩ ↩2 ↩3
-
Chang, T.-Y. et al. — Value-Aware Stochastic KV Cache Eviction for Reasoning Models (VaSE), arXiv:2606.03928, 2026 — Value-Magnitude-Outlier; das Verwerfen der größten Magnituden senkt GSM8K auf 14,3 %, 38,9 Punkte unter Zufalls-Eviction: https://arxiv.org/abs/2606.03928 ↩ ↩2 ↩3
-
Mao, W. et al. — TriAttention: Efficient Long Reasoning with Trigonometric KV Compression, arXiv:2604.04921, 2026, Pre-RoPE-Q/K-Konzentration, trigonometrische Positions-Bewertung: https://arxiv.org/abs/2604.04921 ↩ ↩2
-
VestigeKV: The NoPE-MLA KV Cache Carries Its Own Eviction Signal in a Vestigial Branch, arXiv:2609.03949, Sept. 2026 — Auswahl nach beobachteter Attention (H2O, SnapKV) kollabiert auf 0,00–0,33 Needle-Retrieval auf NoPE-MLA; Archiv-Tiering als Alternative zum Löschen: https://arxiv.org/abs/2609.03949 ↩ ↩2 ↩3 ↩4