Zum Inhalt springen
Kurzer Hinweis: flozi00 TechHub ist ein Solo-Nebenprojekt neben einem Vollzeitjob — persönliche Lernnotizen, keine offiziellen Aussagen. Kritische Schritte selbst prüfen.

Risikokontrollierte KV-Eviction: Der Zuverlässigkeitsvertrag — und der Full-KV-Fallback, den niemand ausliefert

Ein Paper der Korea University aus dem September 2026 (arXiv:2609.27981) dreht KV-Cache-Eviction vom Budget-first zum Risk-first: Man legt fest, wie oft ein Request material degradieren darf, und eine Learn-then-Test-Kalibrierung wählt das Retention-Level — oder fällt auf Full KV zurück, wenn nichts zertifiziert wird. Dieser Guide zerlegt die Finite-Sample-Maschinerie, reproduziert die Zertifizierungs-Cutoffs in Python und beziffert die ehrlichen Teile: den Kalibrierungspopulations-Geltungsbereich, den RULER-32K-Full-KV-Fallback und die 5-10 Prozentpunkte zusätzliche Retention, die die Garantie kostet.

14 Min. Lesezeitflozi00
aimachine-learningllminferencekv-cacheevictionstatistikzuverlaessigkeitlong-context

Ein Paper der Korea University aus dem September 2026 greift eine Gewohnheit an, die im KV-Cache-Eviction-Betrieb so etabliert ist, dass die meisten Serving-Teams nicht mehr bemerken, dass sie sie haben: erst ein Memory-Budget wählen, dann die durchschnittliche Qualität prüfen1. Risk-Controlled KV-Cache Eviction: From Memory Budgets to Risk Targets (Kang, Yun, Kim und Seo, arXiv:2609.27981, 14 Seiten, cs.CL und cs.LG, eingereicht am 23. September 2026) kehrt die Reihenfolge um. Man formuliert zuerst einen Zuverlässigkeitsvertrag — einen tolerierten Utility-Verlust und wie oft dieser überschritten werden darf — und ein statistisches Zertifizierungsverfahren auf Kalibrierungsdaten sagt einem dann, wie aggressiv die eigene Eviction sein darf, mit Fallback auf Full KV, wenn die Antwort „gar nicht" lautet1.

Das Unbequeme ist, was das Verfahren an seinen Rändern tatsächlich zurückgibt. Auf Llama-3.1-8B zertifiziert es SnapKV bei 75% Retention auf LongBench, aber auf RULER-32K zertifiziert es keine getestete komprimierte SnapKV-Policy und liefert Full KV zurück — exakt die Speicherkonfiguration, deren Abschaffung der Sinn von Eviction ist1. Und auf dem Benchmark, auf dem die Zertifizierung gelingt, wählt sie 5 bis 10 Prozentpunkte höhere Retention als die naive „akzeptiere alles unter dem Ziel"-Regel, weil Finite-Sample-Statistik keine Policen zertifiziert, deren beobachtete Degradierung lediglich gut aussieht1. Beide Fakten sind der Punkt, kein Defekt: Das Paper verkauft einen Vertrag, dessen ehrliche Outputs „gib mehr Speicher aus" und „ich kann nicht beweisen, dass das sicher ist" einschließen.

Dieser Guide zerlegt die Maschinerie, die diese Outputs erzeugt, reproduziert die Zertifizierungs-Cutoffs und ihre Konservativität in Python (illustrative Implementation — wir bauen die exakte Schranke des Papers nach, unten ausdrücklich so gekennzeichnet) und markiert, wo der ehrliche Geltungsbereich der Garantie endet: Sie ist eine Aussage über eine Kalibrierungspopulation, und Distributionsdrift hebt sie auf. Den Kapazitäts- und Kostenkontext liefert unser KV-Cache-Glossar, den Eviction-Politik-Zoo Random Attention vs. SnapKV, die Working-Set-Seite der Speicherfrage KVSET Prefix-Cache-Sizing und den Speicherpreis, der den Fallback teuer macht, HBM4-Knappheitsökonomie.

1. Das Problem: Mittelwerte verstecken Tail-Fehler

Die Eviction-Forschung berichtet überwiegend average Quality-Memory-Trade-offs: eine Kurve des mittleren Benchmark-Scores gegen die Retention und irgendwo darauf ein operating point. Die zentrale Beobachtung des Papers ist, dass dies das falsche Funktional der Daten für eine Deployment-Entscheidung ist. Eine kleine mittlere Degradierung sagt nichts darüber, wie oft Eviction einen einzelnen Request schwer beschädigt. Formal impliziert eine kleine erwartete Degradierung keine kleine Wahrscheinlichkeit einer großen Degradierung — der Mittelwert ist ein Aggregat, die Überschreitungswahrscheinlichkeit eine Tail-Aussage1.

Das Reframing des Papers ist ein Zwei-Parameter-Vertrag auf dem Tail:

  • Materialle Degradierung: Bei einem einzelnen Request senkt Eviction die Task-Utility um mehr als eine Toleranz τ relativ zur Full-KV-Inferenz auf dem selben Request, mit demselben Modell, Prompt, denselben Generierungs- und Evaluierungseinstellungen. Utilities werden auf 0 bis 1 normalisiert, τ ist also ein Anteil der Gesamtnutzheit. Die Haupteinstellung des Papers ist τ = 0,10 — ein Verlust von zehn Punkten auf einer 0-100-Skala1.
  • Deployment-Risiko: die Populationsfrequenz solcher Ereignisse, begrenzt im Vertrag auf ϵ = 0,05 — höchstens 5% der Requests dürfen material degradieren1.
  • Konfidenz: Das Zertifizierungsverfahren darf diese Grenze mit Wahrscheinlichkeit von höchstens δ = 0,05 über das Kalibrierungs-Sampling hinweg verfehlen1.

Zwei Details verdienen Nachdruck, weil jede Zusammenfassung sie fallen lässt. Erstens: Das Risiko ist relativ zu Full KV definiert, nicht relativ zur Aufgabenkorrektheit. Ein Request, dessen Full-KV-Utility bereits null ist, kann nicht degradieren — ein niedriges zertifiziertes Risiko bedeutet also keine hohe absolute Qualität; genau so steht es im Paper1. Zweitens: Utility-Verbesserungen bei manchen Requests gleichen materialle Degradierungen bei anderen nicht aus; es gibt keine Verrechnung, nur ein Zählen1. Der Tail ist das Produkt.

Warum der Tail in heutiger Praxis unsichtbar bleibt: Eine Produktions-Eviction-Policy wird gegen durchschnittliche Benchmark-Scores oder Stichproben-Ausgaben getunt, und reales Populationsrisiko konzentriert sich in bestimmten Tasks. Die eigene Tabelle 4 des Papers ist der Beweis — Llama mit Layer-DefensiveKV bei 35% Retention mittelt über LongBench 53,5 Punkte, praktisch gleichauf mit dem Full-KV-Wert von 53,6 aus derselben Tabelle — mean-neutral. Dennoch verlieren 4% der Requests mehr als zehn Punkte, und die per-Task-Spanne reicht von 0% (PassageRetrieval-en) bis 10% (SAMSum)1. Mean-neutral, tail-lastig: exakt das Profil, das eine mittelwertbasierte Abnahme durchwinkt.

2. Die Maschine: Learn-then-Test auf Kalibrierungsdaten

Die Zertifizierung ist ein Wrapper, kein neuer Kompressor. Sie modifiziert den Eviction-Algorithmus nicht; sie wählt aus einer vorab festgelegten Sequenz von Kandidaten-Policen — SnapKV auf einem Retention-Raster, AdaKV auf demselben Raster, selbst den request-adaptiven ReFreeKV auf einem Schwellwert-Raster1. Für Fixed-Budget-Methoden ist das Raster geteilt: Retention 0,80, 0,75, 0,70 bis hinunter zu 0,20, konservativ zu aggressiv geordnet und fixiert, bevor ein Kalibrierungsergebnis angesehen wird1. Diese Vorab-Festlegung ist keine Formalie; sie ist eine tragende Annahme der Garantie (Abschnitt 4).

Das Verfahren von Ende zu Ende:

  1. Kalibrierung. Auf LongBench 100 Kalibrierungs-Requests pro Task über 12 Tasks — 1.200 gepaarte (Full-KV, komprimiert)-Evaluierungen pro Kandidaten-Policy. Auf RULER-32K 100 pro Task über 13 Tasks — 1.300 Paare1.
  2. Verletzungszählung. Pro Kandidat wird gezählt, wie viele Kalibrierungs-Requests eine gepaarte Degradierung über τ haben. Die Zahl heißt K, das empirische Risiko K/n1.
  3. Hypothesentest. Jeder Kandidat wird getestet als H: „Populationsrisiko ≥ 5%" gegen „strikt unter 5%", mit dem exakten binomialen unteren Tail als gültigem p-Wert: Unter der Nullhypothese wird die Wahrscheinlichkeit, höchstens K Verletzungen zu sehen, gegen δ = 0,05 verglichen. Das ist die tatsächliche Maschinerie des Papers — nicht die Hoeffding-Ungleichung (die Chernoff-artige Schranke), sondern der exakte Binomial-Tail, der für task-stratifizierte Kalibrierung durch Hoeffdings Vergleichstheorem von 1956 validiert wird, die heterogene Bernoulli-Wahrscheinlichkeiten pro Task durch ein einziges Binomial auf der Mischungsrate dominiert12.
  4. Fixed-Sequence-Selektion. Kandidaten werden in der vorab festgelegten konservativ-zu-aggressiv Ordnung getestet, und das Verfahren stoppt bei der ersten Nicht-Ablehnung und liefert den letzten zertifizierten Kandidaten zurück — oder Full KV, wenn schon der erste Kandidat scheitert. Fixed-Sequence-Testing braucht keine Monotonieannahme und keine Korrektur über die Kandidaten: Die Wahrscheinlichkeit einer Falsch-Zertifizierung ist durch δ begrenzt, weil jede Falsch-Zertifizierung die erste wahre Nullhypothese in der Sequenz fälschlich ablehnen muss13.

Der Full-KV-Fallback ist kein angeboltzter Spezialfall; er ist eine Policy in der Sequenz mit Degradierung 0 und Risiko 0 per Definition1. Wenn kein komprimierter Kandidat besteht, liefert der Vertrag stillschweigend das Memory-Budget zurück, das man verkleinern wollte — deshalb ist Abschnitt 3 kommerziell relevant, nicht nur akademisch.

Die Garantie in voller, bedingter Form: Mit Wahrscheinlichkeit von mindestens 1 − δ = 95% über das Kalibrierungs-Sampling hat die selektierte Policy ein Populations-Risiko materialler Degradierung von höchstens 5% auf der erklärten task-balancierten Population — vorausgesetzt, Vertrag, Kandidatenraster und ihre Ordnung waren vor der Kalibrierungs-Inspektion fixiert, und die Kalibrierungs-Requests sind unabhängige Ziehungen aus den Task-Verteilungen1. Jeder Qualifikator in diesem Satz leistet echte Arbeit, und Abschnitt 4 beziffert jeden einzelnen.

3. Die Ergebnisse, Fallback inbegriffen

Evaluiert wurden zwei offene Modelle — Llama-3.1-8B-Instruct und Mistral-7B-Instruct-v0.3 — vier Fixed-Budget-Evictoren (SnapKV, AdaKV, DefensiveKV, Layer-DefensiveKV) plus der request-adaptive ReFreeKV (nur Llama, nur LongBench), auf LongBench (Llama und Mistral) und RULER-32K (Llama)1. Hardware-Notiz für Reproduzierbarkeit: RTX A6000 mit 48 GB, FlashAttention-2 für Fixed-Budget-Läufe, Eager-Attention für ReFreeKV1.

Die Headline, zerlegt — derselbe Vertrag, völlig andere operating points:

LongBench, Llama-3.1-8B. Zertifizierte Retention bei (τ, ϵ, δ) = (0,10, 0,05, 0,05): SnapKV 0,75, AdaKV 0,65, DefensiveKV 0,40, Layer-DefensiveKV 0,35. Die Held-out-Testrisiken aller vier liegen bei 2,5% bis 4,1%, unter dem 5%-Ziel1.

LongBench, Mistral-7B. Gleicher Vertrag, andere Antworten: SnapKV 0,70, AdaKV 0,70, DefensiveKV 0,40, Layer-DefensiveKV 0,45 — und DefensiveKV und Layer-DefensiveKV tauschen zwischen den Modellen die Plätze (0,40/0,35 auf Llama, 0,40/0,45 auf Mistral), genau das nicht-motone, modellspezifische Verhalten, für das das kompressor-agnostische Design gebaut ist1.

RULER-32K, Llama. Layer-DefensiveKV zertifiziert bei 0,35, DefensiveKV bei 0,45, AdaKV bei 0,70. SnapKVs erster, konservativster Kandidat — 80% Retention — sammelt 135 von 1.300 Kalibrierungsverletzungen (10,38%), scheitert an der Zertifizierung, und Fixed-Sequence-Testing testet nichts Aggressiveres mehr: Das Verfahren liefert Full KV zurück1. Das Paper scope-beschränkt das sorgfältig: Retention-Anteile zwischen den Rasterpunkten wurden nicht getestet, die Aussage ist also nicht „jede komprimierte SnapKV-Policy auf RULER ist unzertifizierbar", sondern „keine getestete"1. Präzision zählt — genau dieser Satz wäre auf einer Vendor-Folie abgeschnitten.

ReFreeKV (request-adaptiv, Llama LongBench). Ein Schwellwert-Raster zertifiziert den ersten Schwellwert (3,25% Kalibrierungsrisiko) und lehnt den nächsten bei 4,42% empirisch ab — dasselbe konservative Verhalten, angewandt auf einen Kompressor ohne feste Retention. Mittlere Retention: 87,5%1.

Zwei Ehrlichkeits-Checks, die das Paper selbst durchführt und veröffentlicht, beide als Methode zitierenswert:

  • Auf Held-out-Testdaten landen sieben der acht LongBench-Modell-Kompressor-Paare unter 5% empirischem Risiko. Das achte — Mistral DefensiveKV — zeigt 61/1.200 = 5,08%, ein Ereignis über der Quote. Das Paper stellt nüchtern klar: Das invalidiert das Kalibrierungszertifikat nicht und belegt auch nicht, dass das Populationsrisiko über 5% liegt — die Garantie war eine 95%-Wahrscheinlichkeitsaussage über das Verfahren, keine Behauptung, dass die Test-Rate immer unter der Linie bleibt1. Eine mittelwertbasierte Methode könnte hier gar nichts sagen.
  • Auf RULER-32K landen alle drei zertifizierten komprimierten Policen unter dem nominalen Ziel auf dem Test — aber das Testrisiko konzentriert sich heftig in einem Task: Common-Word-Extraction erreicht 9% (AdaKV), 15% (DefensiveKV) und 29% (Layer-DefensiveKV)1. Eine Post-hoc-Clopper-Pearson-Analyse mit Bonferroni-Korrektur über 147 Policy-Task-Kombinationen findet untere Konfidenzgrenzen über 5% für RULER-CWE unter beiden DefensiveKV-Varianten und für LongBench-TriviaQA unter ReFreeKV1. Das Zertifikat deckt eine task-balancierte Mischung; pro Task verspricht es nichts — und das Paper zeigt den per-Task-Schaden, statt ihn zu verstecken.

Die Sensitivitätstabelle (Abschnitt 6 des Papers) beweist, dass der Regler tatsächlich regelt: τ von 0,10 auf 0,05 zu straffen hebt Layer-DefensiveKV-Retention von 0,35 auf 0,65 und schiebt SnapKV von 0,75 auf Full KV; ϵ auf 0,20 gelockert lässt sechs von acht Modell-Kompressor-Zeilen auf den Raster-Boden von 0,20 fallen1. Der Vertrag, nicht das Memory-Budget, ist der Regelknopf.

4. Die Konservativität, bepreist

Hier kommt der Teil, der jeden Effizienz-Ingenieur ärgern sollte — und trotzdem verstanden werden muss. Empirisches Thresholding — die naive Regel „akzeptiere jeden Kandidaten, dessen beobachtetes Kalibrierungsrisiko unter 5% liegt" — hätte bei 1.200 Kalibrierungs-Requests höchstens 60 Verletzungen akzeptiert und auf Llama LongBench für jeden einzelnen Kompressor den nächsten Kandidaten akzeptiert1:

  • SnapKV bei 70% Retention: 50 Verletzungen, 4,17% empirisch.
  • AdaKV bei 60%: 49 Verletzungen, 4,08%.
  • DefensiveKV bei 35%: 58 Verletzungen, 4,83%.
  • Layer-DefensiveKV bei 30%: 48 Verletzungen, 4,00%.

Alle vier liegen unter dem nominalen 5%-Ziel. Alle vier scheitern am Finite-Sample-Test, weil der Test eine härtere Frage stellt: nicht „war die beobachtete Rate unter 5%", sondern „gibt es statistische Evidenz, dass die Populations-Rate strikt unter 5% liegt, bei 95% Konfidenz". Bei n = 1.200 verlangt das eine beobachtete Zahl von höchstens 47 — eine effektive geprüfte Schwelle von 3,92%, nicht 5%1. Über die vier Llama-Kompressoren wählt die Zertifizierung folglich 0,05 bis 0,10 höhere Retention als die empirische Selektion1. Im konkreten Layer-DefensiveKV-Vergleich: Die Plug-in-Regel wählt 0,30 Retention, die Zertifizierung 0,35, und auf Held-out-Daten zeigt die 0,30-Policy 5,33% Testrisiko gegenüber 4,00% bei der zertifizierten — die naive Regel hat hier eine genuinely riskantere Policy gewählt, und dieses eine Mal hat sich die Vorschrift bezahlt gemacht1.

Diese Lücke ist der Preis der Garantie, und sie ist dauerhaft, keine Einmalkosten: Sie bleibt bestehen, solange Kalibrierungsmengen endlich sind. Der nächste Abschnitt macht den Mechanismus konkret, indem er ihn ausführt.

5. Der Zertifizierungskern, ausgeführt

Alles Folgende ist unsere Illustration — sie implementiert die exakte Maschinerie des Papers (den exakten binomialen unteren Tail bei den Paper-Parametern, keine Chernoff/Hoeffding-artige Ungleichung), sodass die Cutoffs die Zahlen des Papers reproduzieren; die Zertifizierungswahrscheinlichkeits- und Stichprobengrößen-Sweeps sind aber unsere Illustrationen derselben Schranke, keine Abbildungen aus dem Paper.

python
import math
 
def binom_cdf(k, n, p):
    """P[Bin(n,p) <= k], stabil für große n: Akkumulation im Log-Raum.
    Fall k < Modus: unteren Tail direkt summieren. Fall k >= Modus:
    1 - P(X >= k+1) berechnen. Keine Fakultäten, kein Overflow."""
    if k < 0: return 0.0
    if k >= n: return 1.0
    def pmf_log(i):
        return (math.lgamma(n+1) - math.lgamma(i+1) - math.lgamma(n-i+1)
                + i*math.log(p) + (n-i)*math.log1p(-p))
    def logaddexp(a, b):
        if abs(a-b) >= 700: return max(a, b)
        m = max(a, b); return m + math.log1p(math.exp(-abs(a-b)))
    mode = math.floor((n+1)*p)
    if k < mode:
        total = term = pmf_log(k)
        for i in range(k, 0, -1):
            term += math.log(i/(n-i+1)) + math.log((1-p)/p)
            total = logaddexp(total, term)
        return min(math.exp(total), 1.0)
    total = term = pmf_log(k+1)
    for i in range(k+1, n):
        term += math.log((n-i)/(i+1)) + math.log(p/(1-p))
        total = logaddexp(total, term)
    return max(1.0 - math.exp(total), 0.0)
 
def k_max(n, eps=0.05, delta=0.05):
    """Größte CAL-Verletzungszahl, die der Fixed-Sequence-Test des Papers
    zertifiziert: der exakte binomiale untere Tail am Zielrisiko muss
    <= delta bleiben."""
    for k in range(0, n+1):
        if binom_cdf(k, n, eps) > delta:
            return k - 1
    return n
 
# --- Zertifizierungs-Cutoffs des Papers reproduzieren ---------------------
for n, note in ((1200, 'LongBench: 12 tasks x 100 CAL requests'),
                (1300, 'RULER-32K: 13 tasks x 100 CAL requests')):
    k = k_max(n)
    print(f'n={n} ({note}): K_max={k}, certifiable empirical risk {k/n:.2%}')
# n=1200: K_max=47 -> certifiable empirical risk 3.92%  (Paper: 47, 3.92%)
# n=1300: K_max=51 -> certifiable empirical risk 3.92%  (Paper: 51, 3.92%)
# Die naive Plug-in-Regel hätte bei n=1200 bis zu 60 Ereignisse akzeptiert
# (60/1200 = 5.00%); der Test akzeptiert 47. Diese 13-Ereignisse-Lücke IST
# der Preis der Garantie — und der Grund, warum SnapKV@70% (50 Ereignisse)
# trotz 4.17% < 5% scheitert.
 
# --- Die geprüfte Schwelle strafft sich nur mit Daten ---------------------
print()
for n in (1200, 2600, 5200, 10400, 26000, 104000):
    k = k_max(n)
    print(f'n={n:>6}: K_max={k:>5} -> screened threshold {k/n:.3%} vs 5.000% nominal')
# n=  1200: K_max=   47 -> screened threshold 3.917% vs 5.000% nominal
# n=  2600: K_max=  111 -> screened threshold 4.269% vs 5.000% nominal
# n=  5200: K_max=  233 -> screened threshold 4.481% vs 5.000% nominal
# n= 10400: K_max=  483 -> screened threshold 4.644% vs 5.000% nominal
# n= 26000: K_max= 1241 -> screened threshold 4.773% vs 5.000% nominal
# n=104000: K_max= 5084 -> screened threshold 4.888% vs 5.000% nominal
# Die geprüfte Rate konvergiert nur mit O(1/sqrt(n)) gegen das nominale
# Ziel: eine Vervierfachung von n halbiert grob den Sicherheitsabstand.
# Konservativität ist keine fixe Steuer — sie ist eine Funktion davon,
# wie viele gepaarte Kalibrierungsdaten man bezahlt (jeder CAL-Request =
# eine Full-KV- plus eine komprimierte Generation, gierig dekodiert, pro
# Kandidat auf demselben Raster).
 
# --- Warum Grenzfall-Policen scheitern: P(certify) vs. WAHRER Rate ----------
print()
for p in (0.030, 0.035, 0.040, 0.045, 0.050):
    print(f'true degradation rate p={p:.1%}: expected CAL events {p*1200:.0f}, '
          f'P(certify at n=1200) = {binom_cdf(47, 1200, p):.2f}')
# true degradation rate p=3.0%: expected CAL events 36, P(certify) = 0.97
# true degradation rate p=3.5%: expected CAL events 42, P(certify) = 0.81
# true degradation rate p=4.0%: expected CAL events 48, P(certify) = 0.48
# true degradation rate p=4.5%: expected CAL events 54, P(certify) = 0.18
# true degradation rate p=5.0%: expected CAL events 60, P(certify) = 0.05
# Das ist die RULER-Story in einer Kurve. Eine Policy, die den Vertrag mit
# 10% Kopfroom wahrhaft erfüllt (4% vs 5% Ziel), zertifiziert sich bei
# n=1200 nur in ~der Hälfte der Fälle — eine wirklich SICHERE Policy hängt
# in der Zertifizierungsschlange fest. Und P(certify) bei p=5% ist 0.05,
# nicht 0: das eigene Delta-Leak des Tests, die 5% der Kalibrierungs-
# ziehungen, in denen eine verletzende Policy durchrutscht.
 
# --- Konservativität mit Kalibrierungsdaten zurückkaufen -------------------
lo, hi = 1200, 400000
while lo < hi:                       # kleinstes n, bei dem eine echte
    mid = (lo + hi) // 2             # 4%-Policy mit Wahrscheinlichkeit
    if binom_cdf(k_max(mid), mid, 0.04) >= 0.90: hi = mid   # >= 0.90 zertifiziert
    else: lo = mid + 1
n4, k4 = lo, k_max(lo)
print(f'\ntrue-4% policy, P(certify) >= 0.90 needs n ~ {n4} '
      f'({n4/1200:.0f}x the calibration set used in the paper); '
      f'screened threshold there: {k4/n4:.3%}')
# true-4% policy, P(certify) >= 0.90 needs n ~ 3808 (3x the paper's
# calibration set); screened threshold there: 4.412%

Vier Dinge, die man dieser Ausgabe ablesen kann, weil sie das ganze Argument des Papers in ausführbarer Form sind:

  • Die Cutoffs matchen das Paper exakt. K_max = 47 bei n = 1.200 und 51 bei n = 1.300 — dieselben Zahlen wie in Abschnitt 3.2 und 4.2 des Papers, hier unabhängig aus dem Binomial-Tail hergeleitet. Reproduziert, nicht abgeschrieben.
  • Konservativität ist eine Datenkauf-Entscheidung. Die geprüfte Schwelle liegt bei den Kalibrierungsgrößen des Papers bei 3,92% und kriecht selbst bei 100.000 gepaarten Samples nur auf 4,89%. Jede Stufe Richtung 5% kostet gepaarte Full-KV-plus-komprimiert-Generationen über das ganze Kandidatenraster — die Konvergenz ist O(1/√n), das letzte Quentchen Konservativität ist immer das teuerste.
  • Die Mäßigkeits-Falle ist real. Eine Policy mit wahrem 4%-Risiko —innerhalb des Vertrags mit Spielraum — zertifiziert bei der Kalibrierungsgröße des Papers mit Wahrscheinlichkeit 0,48. Münzwurf über den eigenen Memory-Operating-Point. Der Mechanismus, konkret gemacht: Bei n = 1.200 verlangt der Test von einer merely-guten Policy Nahezu-Perfektion, und kein noch so vernünftiges Kalibrierungsbudget behebt das billig (0,90 Zertifizierungswahrscheinlichkeit für eine echte 4%-Policy braucht grob das Dreifache des Kalibrierungssatzes des Papers).
  • Das Delta ist bepreist, nicht versteckt. P(certify) bei wahrem 5% ist 0,05 — exakt das δ, das der Vertrag ausgegeben hat. Die Garantie sagt: Das Verfahren scheitert höchstens 5% der Kalibrierungsziehungen. Die Simulation zeigt genau diesen Restleck. Nichts am Zertifikat ist absolut; es ist eine 95%-Aussage über ein Verfahren, und der Code zeigt die 5%.

Eine Randnotiz zur Illustration: Die Zertifizierungswahrscheinlichkeit ist für einen einzelnen Kandidaten berechnet. Fixed-Sequence-Testing über ein Raster verschiebt das Bild nur geringfügig — der erste getestete (konservativste) Kandidat sieht im Wesentlichen den Einzeltest, und spätere Kandidaten werden nur erreicht, wenn die früheren bestanden haben.

6. Ehrlicher Geltungsbereich: Was die Garantie nicht sagt

Der Limitations-Abschnitt des Papers ist ungewöhnlich vollständig, und jede Klausel darin ist eine Deployment-Grenze, die es als operating assumption zu restaten lohnt:

Die Garantie ist an der Kalibrierungspopulation verankert. Der Vertrag deckt die task-balancierte Mischung: 12 LongBench-Tasks (bzw. 13 RULER-Tasks) uniform gemischt, mit unabhängig pro Task gezogenen Kalibrierungs-Requests. Sie ist keine per-Task-Garantie — die RULER-Common-Word-Extraction-Raten (bis 29%) leben innerhalb einer zertifizierten 3,5%-Mischung — und keine Garantie unter Distributionsdrift. Serve einen Traffic-Mix, der nicht dem Kalibrierungsmix gleicht, oder lasse den Mix driften, und das Zertifikat beschreibt das Deployment nicht mehr. Nachkalibrierung nach Drift ist kein optionaler Härungsschritt; sie ist das Einzige, was die Garantie wahr hält1.

Der Fallback ist Full KV, und Full KV ist der Kostenposten, dessentwegen man kam. Wenn nichts zertifiziert — wie bei SnapKV auf RULER-32K —, liefert das Verfahren nicht „den besten verfügbaren Kompressor" zurück, sondern die gepaarte Full-KV-Referenz, bei 100% des Speichers, dessen Einsparung das Projekt ursprünglich begründete. Der Vertrag tauscht Speicher gegen Sicherheit — und im schlechtesten Fall tauscht er alles.

Post-hoc-Wahlen entwerten das Zertifikat. Die Garantie verlangt, dass Toleranz, Ziel, Konfidenz, Kandidatenraster und ihre Ordnung vor der Inspektion der Kalibrierungsergebnisse fixiert sind. τ oder ϵ nach dem Ansehen der Ergebnisse zu ändern — oder zwischen mehreren Sequenz-Outputs anhand ihrer Kalibrierungsergebnisse zu wählen — verlangt Multiplizitätskontrolle oder frische Kalibrierungsdaten. Das Paper wendet die Regel auf sich selbst an: Seine Sensitivitätstabelle über (τ, ϵ)-Paare in Abschnitt 6 ist ausdrücklich als exploratorisch, abseits des eingefrorenen Pfads, gekennzeichnet1.

Relativ ≠ absolut. Risiko wird gegen gepaarte Full-KV-Inferenz gemessen. Ein Modell mit niedriger Full-KV-Utility zertifiziert sich genauso leicht wie ein gutes; ein niedriges zertifiziertes Risiko sagt nichts über die Serving-Qualität, nur darüber, dass sie materially nicht schlechter wird, als Full KV sie geliefert hätte. Ebenso erstreckt sich die Garantie nicht auf End-to-End-Serving-Metriken — Latenz- oder Throughput-Aussagen gibt es nicht; das Objekt ist die retinierte KV-Fraktion und das Utility-Risiko1.

Evidenz-Geltungsbereich. Zwei 7-8B-Modelle, fünf Eviction-Methoden, zwei Benchmarks, diskrete Raster. Ob derselbe Vertrag auf Grenzwert-Maßstäben von Modellen, auf anderen Serving-Stacks oder unter Produktions-Traffic-Verteilungen dieselben Operating-Points zertifiziert, ist schlicht nicht getestet1.

7. Fazit

Der Beitrag des Papers ist kein Kompressor — es baut bewusst keinen —, sondern ein Entscheidungsverfahren, das eine Zuverlässigkeitsanforderung in einen Memory-Operating-Point übersetzt, mit falsifizierbaren Outputs an jedem Schritt. Das ist die korrekte Primitive: Eviction-Aggressivität ist eine Wette über das Tail-Verhalten einer Population, und die Population, nicht der Mittelwert, ist es, was ein Deployment tatsächlich serviert. Die zwei ehrlichen Outputs — ein Full-KV-Fallback, der die gesamte Ersparnis kostet, und ein Konservativitätszuschlag von 5-10 Retentionspunkten, der so lange bestehen bleibt, wie Kalibrierungsmengen endlich sind — sind keine Schwächen des Frameworks; sie sind die ersten Zahlen, die irgendjemand tatsächlich gedruckt hat für das, was ein Zuverlässigkeitsvertrag über KV-Eviction kostet.

Der zu beobachtende Failure-Mode ist ein Erkennungsproblem, kein Implementierungsproblem: Ein Vendor, der „risikokontrollierte Kompression" bewirbt, ohne den (τ, ϵ, δ)-Vertrag, die Kalibrierungspopulation und das Fallback-Verhalten auf dem eigenen Produktionsmix zu benennen, verkauft wieder den Mittelwert — mit neuem Etikett. Das Zertifikat ist nur so gut wie die Population, auf der es kalibriert wurde — und der Fallback ist nur billig, solange man ihn nie trifft. Diese zwei Fragen gestellt, trennen sich die ehrlichen Artikel schnell vom Rest.

Footnotes

Footnotes

  1. Kang, Beomgu; Yun, SoJin; Kim, Hojoon; Seo, Hyunseok — Risk-Controlled KV-Cache Eviction: From Memory Budgets to Risk Targets, arXiv:2609.27981, Korea University, eingereicht am 23. September 2026, 14 Seiten, cs.CL + cs.LG (Abstract-Seite und vollständiges HTML/PDF verifiziert: Risikformulierung mit Toleranz τ = 0,10 und Ziel ϵ = 0,05, Konfidenz δ = 0,05, Garantie Pr_CAL ≤ δ; task-stratifizierte Kalibrierung, exakter binomialer unterer Tail als p-Wert, validiert durch Hoeffdings Vergleichstheorem von 1956; Fixed-Sequence-LTT-Selektion mit Full-KV-Fallback; K_max = 47 bei n=1200 bzw. 51 bei n=1300; Retentions-Raster 0,80-0,20; LongBench CAL/TEST 100 pro Task über 12 Tasks; RULER-32K 13 Tasks, SnapKVs erster Kandidat 0,80 mit 135/1300 = 10,38% CAL-Ereignissen scheitert und liefert Full KV; zertifizierte Retentionstabellen 1 und 2 pro Methode; ReFreeKV-Schwellwertraster .0005-.03, zertifiziert bei 3,25% CAL-Risiko, 87,5% mittlere Retention; Empirisch-vs-zertifiziert-Lücke: SnapKV 70% mit 50 Ereignissen / 4,17%, AdaKV 60% mit 49 / 4,08%, DefensiveKV 35% mit 58 / 4,83%, Layer-DefensiveKV 30% mit 48 / 4,00%, alle unter 5% und dennoch unzertifiziert, die Zertifizierung wählt 0,05-0,10 höhere Retention, Layer-DefensiveKV 0,30 Plug-in mit 5,33% TEST-Risiko gegenüber 0,35 zertifiziert mit 4,00%; Mistral DefensiveKV TEST 61/1200 = 5,08%; RULER-CWE-Task-Raten 9/15/29%; Clopper-Pearson- plus Bonferroni-Analyse über 147 Kombinationen; Sensitivitätstabelle τ = .10 auf .05 hebt Layer-DefensiveKV von 0,35 auf 0,65 und SnapKV von 0,75 auf Full KV: https://arxiv.org/abs/2609.27981 ↩ ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8 ↩9 ↩10 ↩11 ↩12 ↩13 ↩14 ↩15 ↩16 ↩17 ↩18 ↩19 ↩20 ↩21 ↩22 ↩23 ↩24 ↩25 ↩26 ↩27 ↩28 ↩29 ↩30 ↩31 ↩32 ↩33 ↩34 ↩35 ↩36 ↩37 ↩38

  2. Hoeffding, Wassily — On the Distribution of the Number of Successes in Independent Trials, The Annals of Mathematical Statistics 27(3), 1956, S. 713-721 — das Vergleichstheorem, das zeigt, dass eine Summe unabhängiger, nicht identisch verteilter Bernoulli-Ziehungen vom Binomial mit der mittleren Erfolgswahrscheinlichkeit stochastisch dominiert wird; genau das legitimiert den exakten Binomial-Tail als gültigen p-Wert unter task-stratifizierter Kalibrierung (vom Paper für seine Gleichung 13 zitiert): https://doi.org/10.1214/aoms/1177728178 ↩

  3. Angelopoulos, Anastasios N.; Bates, Stephen; Fisch, Adam; Lei, Jitendra; Schuster, Tal — Learn then Test: Calibrating Predictive Algorithms to Achieve Risk Control, The Annals of Applied Statistics 19(2), 2025, S. 1641-1662 — das Fixed-Sequence-Multiplikations-Testframework, das das Paper instanziiert: Kandidatenkonfigurationen als Hypothesen, gültige p-Werte aus Kalibrierungsergebnissen und Fixed-Sequence-Testing, dessen Falsch-Zertifizierungswahrscheinlichkeit durch δ begrenzt ist, ohne Korrektur über die Sequenz: https://doi.org/10.1214/24-AOAS1998 ↩