Irgendwo zwischen dem 21. und 22. September 2026 beschloss die Tech-Presse, dass ein Preiskrieg ausgebrochen sei. „Drei Frontier-Labs haben innerhalb von 48 Stunden neu bepreist", lautete die Aggregation: Anthropic senkte die Opus-Preise, OpenAI senkte die GPT-6-Preise, und Google — nun, Google stand auch im Satz. Manche Versionen ergänzten xAIs Grok 4.7 und bekamen eine vollständige Vier-Parteien-Erzählung.
Dieser Artikel existiert, weil jeder der drei tragenden Nebensätze dieses Satzes falsch ist — und die Art, wie er falsch ist, ist interessanter als der Krieg, den er erfunden hat. Bis zur Preislisten-Arithmetik zerlegt — der einzigen Ebene, die sich live gegen Vendor-Dokus verifizieren lässt — enthielt das Zeitfenster: eine echte Neubepreisung mit einem strukturellen Cache-Read-Eingriff (Anthropic), einen neuen SKU-Launch, dessen Cache-Multiplizierer sich überhaupt nicht bewegte (OpenAI), und ein Nicht-Ereignis (Google). Kein Vendor sagte „Preiskrieg". Diese Rahmung ist Presse-Interpretation und ist überall unten als solche zu lesen12.
Die Ökonomie, die dieses Fenster zur Nachricht machte, ist dieselbe, die unser Agenten-Flotten-Cache-Elastizitäts-Guide zerlegt hat: Agentische Workloads dominieren Prefix-Wiedervorlesen, also ist die Cache-Read-Position — nicht der Listenpreis — das, was eine Flotte tatsächlich zahlt. Wenn ein Anbieter diese Position bewegt, zielt die Bewegung auf Flotten. Prüfen wir, wer sie wirklich bewegt hat.
Was die Preislisten sagen, Zeile für Zeile
Die Verifikation ist trivial, und jeder, der das ehrlich macht, sollte sie selbst durchführen: die Vendor-Preisseiten öffnen, die vier Zahlen pro Modell lesen — Basiseingabe, gecachte Eingabe, Cache-Write, Ausgabe — und die Verhältnisse ausrechnen. Das ergibt für das Fenster 21./22. September:
Anthropic, 22. September 2026 — die einzige echte Neubepreisung1. Opus 5.5 startete gegen Opus 5 mit jeder Position gesenkt und einer Position weit stärker als alle anderen:
| Preislistenposition | Opus 5 | Opus 5.5 | Delta |
|---|---|---|---|
| Basiseingabe | \$5 /MTok | \$4 /MTok | −20% |
| Basisausgabe | \$25 /MTok | \$20 /MTok | −20% |
| Cache-Write (5 Min.) | \$6,25 /MTok (1,25x) | \$5 /MTok (1,25x) | −20% |
| Cache-Write (1 Std.) | \$10 /MTok (2x) | \$8 /MTok (2x) | −20% |
| Cache-Read | \$0,50 /MTok (0,10x) | \$0,20 /MTok (0,05x) | −60% |
Das Kontextfenster bleibt unverändert bei 1M Tokens, und eine Fast-Mode-Stufe läuft bei \40 mit bis zu 2,5x Geschwindigkeit. Beachtet die letzte Zeile genau: Anthropics Plattform-Doku bepreist Cache-Reads standardmäßig mit „0,1x Basiseingabe" über die Modelllinie hinweg — Opus 5.5 bricht das ausdrücklich auf 0,05x seiner \$4-Basis herunter. Das ist die strukturelle Geschichte des gesamten Fensters, und sie ist die Bewegung eines einzigen Anbieters, nicht dreier.
OpenAI, 22. September 2026 — ein Launch, keine Neubepreisung2. GPT-6 Sol (\10) und GPT-6 Luna (\0,50) sind neue SKUs, bepreist gegen die GPT-5.6-Promo-Karten:
| Preislistenposition | GPT-5.6 Sol (Promo) | GPT-6 Sol | Delta |
|---|---|---|---|
| Basiseingabe | \$4,00 /MTok | \$2,00 /MTok | −50% |
| Basisausgabe | \$20,00 /MTok | \$10,00 /MTok | −50% |
| Gecachte Eingabe | \$0,40 /MTok | \$0,20 /MTok | −50%, bei 0,10x flach |
Die gecachte Eingabe sank um 50% nur, weil sie als 0,10x der Basiseingabe definiert ist — und die Basis um 50% fiel. Der Multiplizierer selbst ist unangetastet: Er war 0,10x davor und ist 0,10x danach. OpenAIs eigentlicher Cache-Schritt an diesem Tag war Performance: ein separater Post, „Better prompt caching for GPT-6", kündigte höhere Standard-Hit-Raten, Cache-Rabatte für gemeinsame Prefixe mit Wiederverwendung innerhalb eines 30-Minuten-Fensters, explizite Cache-Breakpoints, ein Caching-Dashboard und Miss-Diagnostik an3. All das ändert, wie oft der 0,10x-Satz greift. Nichts davon ändert den Satz. Und auch die Schlagzeile „50% günstiger" ist auf einer Position ungenau: Lunas Ausgabe ging von \0,50, was −58,3% ergibt — die Marketing-Zahl ist die Sol-und-Eingabe-Figur, quer über die Tabelle kopiert2.
Google, 21./22. September 2026 — es ist nichts passiert4. Die neuesten preisrelevanten Einträge im Gemini-API-Changelog sind auf den 13.–24. August und den 2. September 2026 datiert (Flash-Tier-Launches zu Intro-Raten, geplant zur Verdopplung am 1. Januar 2027). Es gibt keinen Eintrag vom 21./22. September, weil es keine Preisänderung gab. Jede Story, die Google ins Neubepreisungsfenster setzt, hat die Flash-Intro-Raten-Geschichte in ein Fenster gemischt, in das sie nicht gehört. Und der verführerische vierte Spieler — xAIs Grok 4.7, gestartet am 21. September — startete zu unveränderten Preisen, „geserved zum gleichen Preis und mit gleicher Geschwindigkeit wie Grok 4.6", in den Worten des Anbieters5. Ein Release ist keine Neubepreisung.
Die akkurate Zusammenfassung des Fensters, an den Primärquellen verifiziert: eine Neubepreisung, ein Launch, ein Schweigen. Die Zeile „drei Labs senken Preise" scheiterte bei jedem Vendor über einen anderen Mechanismus — genau das ist die Art von Aggregations-Artefakt, die man verstehen sollte.
Warum die Cache-Read-Position das Schlachtfeld ist
Die Flotten-Ökonomie macht die Zielausrichtung offensichtlich. Ein Agenten-Loop sendet bei jedem Tool-Call seinen eigenen Gesprächs-Prefix erneut mit; am selbstberichteteten Anker-Tag, den wir zuvor seziert haben — rund 4B Tokens für ~44 Agenten —, waren etwa 75% der Tokens Cache-Reads des eigenen Kontexts der Flotte, keine frische Arbeit6. Ein Anbieter, der die Cache-Read-Position um 60% senkt, senkt die dominierende Position genau einer Kundenklasse: Leute, die Agenten-Flotten betreiben. Ein Anbieter, der den Listenpreis pauschal um 50% senkt, senkt diese Position auch — aber eine gecachtete Eingabe zu discounten ist keine flottenspezifische Waffe; es ist schlicht Arithmetik, die dem Listenpreis hinterherläuft.
Rechnet den tatsächlichen Tag auf jeder Preiskarte durch. Kanonische Form aus der Anker-Zerlegung6: 3,0B Cache-Read-Tokens, 0,9B frische Eingabe-Tokens, 0,1B Ausgabe-Tokens:
M = 1e6
shape = dict(cache_reads=3.0e9, fresh_in=0.9e9, output=0.1e9) # 4B total, 75% loop share
cards = {
"Anthropic Opus 5 (old)": dict(i=5.00, c=0.50, o=25.00),
"Anthropic Opus 5.5": dict(i=4.00, c=0.20, o=20.00),
"OpenAI GPT-5.6 Sol (promo)": dict(i=4.00, c=0.40, o=20.00),
"OpenAI GPT-6 Sol": dict(i=2.00, c=0.20, o=10.00),
"OpenAI GPT-6 Luna": dict(i=0.10, c=0.01, o=0.50),
"Google Gemini 3.8 Flash (intro)": dict(i=0.75, c=0.075, o=3.75),
}
for name, p in cards.items():
day = (shape["cache_reads"] / M * p["c"]
+ shape["fresh_in"] / M * p["i"]
+ shape["output"] / M * p["o"])
cr = shape["cache_reads"] / M * p["c"]
print(f"{name:34s} day=${day:,.0f} cache-read line=${cr:,.0f} ({cr/day:.1%})")Das druckt, live gegen die Karten oben:
| Preiskarte | Barrie-förmiger Tag | davon Cache-Reads |
|---|---|---|
| Anthropic Opus 5 (alt) | \$8.500 | \$1.500 |
| Anthropic Opus 5.5 | \$6.200 | \$600 |
| OpenAI GPT-5.6 Sol (Promo) | \$6.800 | \$1.200 |
| OpenAI GPT-6 Sol | \$3.400 | \$600 |
| OpenAI GPT-6 Luna | \$170 | \$30 |
| Google Gemini 3.8 Flash (Intro) | \$1.275 | \$225 |
Drei Preislisten-Fakten fallen aus dieser Tabelle heraus, und keine davon ist „dreiseitiger Krieg":
- Gleichform-Deltas: Opus 5 → Opus 5.5 auf die identische Workload ergibt −27,1% für den Tag (\6.200), tiefer als der −20%-Listenpreisschnitt, weil Cache-Reads auf der größten Einzelmengen-Position um 60% fielen. GPT-5.6 Sol → GPT-6 Sol ergibt exakt −50% für den Tag, weil jede Position um 50% fiel. Die 60%-Asymmetrie ist Anthropic-spezifisch.
- Anbieterübergreifend sind die Karten nicht vergleichbar, solange man Qualität ignoriert: Opus 5.5s Tag ist 1,82x der von GPT-6 Sol, und jeder Anbieter bepreist Fähigkeitsfamilien, keine fungiblen Tokens. Jede „Paritäts"-Behauptung jenseits der Karten selbst ist Marketing oder Presse.
- Der Cache-Read-Anteil ist auf dieser Form karteninvariant: auf jeder Karte landet die Cache-Read-Position bei einem festen Anteil des Tages, weil das Verhältnis von gecachten zu frischen Mengen eine Eigenschaft der Workload ist, nicht des Anbieters. Genau deshalb ist der Flottenmarkt — die 75%-Looping-Kundenklasse — der Ort, an dem Cache-Read-Entscheidungen am härtesten einschlagen, und ein 0,05x-Multiplizierer ist flotten-gezielte Preispolitik.
Die 0,05x-Abweichung, quantifiziert
Anthropics eigene Preis-Doku bepreist Cache-Reads mit „0,1x Basis-Eingabepreis" mit modellspezifischen Ausnahmen (0,025x bei Fable 5.1 und Mythos 5.1, und nun 5% bei Opus 5.5)1. Opus 5.5 ist also nicht „um 20% günstigeres Opus mit 0,10x-Multiplizierer" — die naive Lesart —, sondern eine bewusste Halbierung des Anteils, den Opus-förmige agentische Arbeit auf ihr eigenes Echo zahlt:
# effektiver Eingabe-Multiplizierer bei Hit-Rate h: Frisches zahlt 1,0x, Hits zahlen m
# effektiv = (1 - h) * 1.0 + h * m
for h in (0.50, 0.75, 0.90):
m05 = 1 - h + h * 0.05 # Opus 5.5
m10 = 1 - h + h * 0.10 # Standard-Anthropic / OpenAI-Multiplizierer
print(f"h={h:.2f}: 0.05x -> {m05:.3f} vs 0.10x -> {m10:.3f}, "
f"Cache-Position {(m05/m10 - 1):+.1%}")- h = 0,50 → 4,5% tiefere Senkung auf der Eingabe-Position, als eine 0,10x-Karte sie gäbe
- h = 0,75 → 11,5% tiefer
- h = 0,90 → 23,7% tiefer — bei hohen Hit-Raten wirken halber Preis auf eine Menge und ein Satzsprung gleichzeitig
Die Abweichung verstärkt sich mit der Hit-Rate: Bei den Looping-Anteilen, die Agenten-Flotten tatsächlich fahren (0,75+), ist der 0,05x-Multiplizierer zusätzlich ~12% Rabatt auf die gesamte Eingabe-Position — auf dem 20%-Listenschnitt obendrauf. Flache 0,10x-Karten — jeder SKU in dieser OpenAI-Story und der Rest von Anthropics eigener Linie — können das nicht kopieren, ohne den Multiplizierer selbst neu zu bepreisen.
Vendor-Rationale vs. Presse-Krieg
Die letzte Zerlegungsschicht ist, wer was gesagt hat. Die Vendor-Statements handeln von Server-Kosten; der Krieg steht in den Schlagzeilen.
Anthropics genannte Begründung, wörtlich: Opus 5.5 „benötigt weniger Compute zum Serven als Opus 5, und seine Preise spiegeln das wider. Unsere Tests zeigen, dass es bei Standardeinstellungen auf typischen Workloads 40% weniger als Opus 5 kosten wird."1 Das ist ein Cost-to-Serve-Argument — und beachtet: Die 40% sind eine Workload-Schätzung (günstigere Tokens × weniger Tokens × schnellere Ausgabe), kein Preislisten-Delta. Die ehrlichen Preislisten-Zahlen sind −20/−20/−20/−60, und die Gleichform-Arithmetik oben ergibt −27% auf einen Standard-Agenten-Tag, nicht 40. Beides kann wahr sein; nur eines steht auf der Preisliste.
OpenAIs genannte Begründung, wörtlich: „Verbesserungen bei Caching und Inferenz erlauben es uns, diese Modelle günstiger zu serven, und wir geben diese Einsparungen direkt an Nutzer und Kunden weiter, indem wir die API-Preise für Sol und Luna um 50% gegenüber ihren GPT-5.6-Promo-Preisen senken."2 Ebenfalls ein Kosten-Argument — neue Modelle, günstiger zu serven, entsprechend bepreist — angehängt an neue SKUs, nicht an bestehende.
Google sagte im Fenster nichts, weil es nichts zu sagen gab4. xAI sagte, die Preise seien unverändert5.
Kein Vendor hat einen Preiskrieg behauptet. Der „Krieg" ist Presse-Interpretation — Redaktions-Rahmung wie „Preiskriege heizen sich auf" und „Druck auf ihre Fähigkeit, Gewinne zu machen", plus Aggregator-Zeitstrahlen, die zusammenhanglose Ereignisse stapeln. Und er verdient die Skepsis, die jeder Erzählung zukommt, die ihre eigene Faktenprüfung überlebt: Die Kriegserzählung braucht drei Kriegsparteien, und die Preislisten liefern eine aggressive Bewegung, einen Produkt-Launch und einen leeren Stuhl.
Fazit, mit ehrlichem Kontrafaktisch
Was am 21./22. September 2026 tatsächlich geschah, zerlegt:
- Eine Neubepreisung. Anthropic senkte jede Opus-5.5-Position um 20% und die Cache-Read-Position um 60%, mit dem Multiplizierer auf 0,05x — eine strukturelle, flotten-gezielte Änderung des Preises, den die größte Tokenmenge agentischer Arbeit zahlt.
- Ein Launch. OpenAI brachte GPT-6 Sol und Luna, 50% unter den GPT-5.6-Promo-Karten (Luna-Ausgabe −58,3%), mit unangetastetem 0,10x-Cache-Multiplizierer; die Cache-Verbesserungen ändern realisierte Hit-Raten, nicht Sätze3. Lunas Pro-MTok-Tag oben zeigt, wie weit die kleine Karte an einem großen Loop-förmigen Tag reicht — mit allen Fähigkeits-Vorbehalten, die ein 4B-Token-Tag impliziert.
- Null Google. Google hat im Fenster nichts bewegt; die Flash-Intro-Raten sind ältere Nachrichten4. Grok 4.7 startete zu unveränderten Preisen5.
Und das ehrliche Kontrafaktisch für den Flotten-Betreiber: Nichts in diesem Fenster hat die Workload-Form verändert. Die Token-Kostenkette — die Inferenz-Mathematik aus Prefill, KV-Wiederverwendung und Decode — bewegte sich nur auf der Abrechnungsschicht, und die Serving-Engine-Landschaft ist der Ort, an dem diese Kosten wirklich leben. Eine Flotte, deren Agenten zu 75% loopen, zahlt nun 0,05x je Zehntel auf das Echo statt 0,10x bei einem Anbieter — die Form entscheidet weiterhin die Rechnung. Misst die Hit-Rate, deckelt die Loop-Tiefe, bepreist den Tag gegen die Karte — und lest „Preiskriegs"-Schlagzeilen so, wie ihr jede Aggregation aus einem Ereignis, einem Launch und einem Schweigen lest: als Kompressions-Artefakt, nicht als Zitat.
Fußnoten
Footnotes
-
Anthropic, „Introducing Claude Opus 5.5", 22. September 2026 — Preistabelle (Eingabe \20, Cache-Writes \0,20/MTok), die −60%-Cache-Read-Behauptung, Fast Mode \40 bei bis zu 2,5x Geschwindigkeit und die Rationale „requires less compute to serve than Opus 5... will cost 40% less than Opus 5 on typical workloads": https://www.anthropic.com/claude-opus-5-5 — samt vollständiger Modell-Preise und Cache-Multiplizierer (Standard 0,1x Read; 1,25x/2x Writes; 0,05x Read explizit bei Opus 5.5): https://platform.claude.com/docs/en/about-claude/pricing ↩ ↩2 ↩3 ↩4
-
OpenAI, „Introducing GPT-6 Sol and Luna", 22. September 2026 — die Tabellen \2/\10 (Sol) und \0,10/\0,50 (Luna), die Zitate „reducing API prices... by 50%" und „passing those savings directly on": https://openai.com/index/introducing-gpt-6-sol-and-luna/ — live API-Preise mit gecachter Eingabe bei flachem 0,10x des Listenpreises: https://developers.openai.com/api/docs/pricing ↩ ↩2 ↩3 ↩4
-
OpenAI, „Better prompt caching for GPT-6", 22. September 2026 — höhere Standard-Cache-Hit-Raten, 30-Minuten-Wiederverwendungsfenster für gemeinsame Prefixe, explizite Breakpoints, Prompt-Caching-Dashboard und Miss-Diagnostik, „discounts of up to 90% on cached input tokens" und Reasoning-Aufwandswechsel mitten im Gespräch ohne Cache-Bruch: https://openai.com/index/better-prompt-caching-for-gpt-6/ ↩ ↩2
-
Google-AI-Gemini-API-Preise und -Changelog, abgerufen am 25. September 2026 — Flash-Tier-Intro-Raten (\0,075 gecacht bis 31. Dezember 2026, Verdopplung am 1. Januar 2027) und der Changelog, dessen neueste preisrelevante Einträge auf den 13.–24. August und den 2. September 2026 datiert sind (Gemini 3.8 Flash GA), ohne Eintrag vom 21./22. September 2026: https://ai.google.dev/gemini-api/docs/pricing und https://ai.google.dev/gemini-api/docs/changelog ↩ ↩2 ↩3
-
xAI, Grok-4.7-Ankündigung, 21. September 2026 — gestartet zum gleichen Preis und mit gleicher Geschwindigkeit wie Grok 4.6, also ohne Neubepreisung: https://x.ai/news/grok-4-7 ↩ ↩2 ↩3
-
Flozi TechHub, „Agent-Fleet-Tokenökonomie ist Cache-Ökonomie" — der Barrie-Anker-Tag (~44 Agenten, ~4B Tokens, ~\$1.300, 75% Cache-Read-Anteil) gegen live Preislisten zerlegt, samt Hit-Raten-Kostenmultiplizierer
1 − 0.9 × h: https://flozi.net/de/guides/ai/agent-fleet-cost-cache-elasticity ↩ ↩2