Auf der AAI-2026-Vorstellung hatte AMD eine einzige Zahl für die neue MI455X-GPU — den Motor des Helios-Racks: 34x den Token-Durchsatz der eigenen Vorzeilen-Generation MI355X mit DeepSeek V4 Flash in FP412. (Der MI355X trägt dasselbe 288-GB/8-TB/s-Speichersystem wie ein NVIDIA GB3003 — jeder Silizium-Faktor unten gilt also zufällig gegen beide Baselines; die 34x selbst sind aber eine generationsbezogene, keine herstellerübergreifende Zahl.) Vierunddreißig ist eine seltsame Zahl, um ein Produkt zu tragen — Verkäufer bevorzugen runde Werte, die sich mit einer Folie verteidigen lassen. AMD hat sie gewählt, weil sie den einen Test besteht, den Marketing-Zahlen normalerweise nicht bestehen: Die Arithmetik auf der gewählten Arbeitslast stimmt. Die Frage, die dieser Artikel beantwortet, ist billiger als der Kauf eines der beiden Racks: Welche Teile der 34x sind Silizium, und welche sind Entscheidungen über die Arbeitslast? Die Zerlegung ist unerbittlich — von den 34x sind etwa 4,4x Hardware und etwa 7,8x alles andere.
Die Behauptung faktorisieren, bevor man ihr glaubt
34x ist ein Produkt multiplikativer Faktoren. Trenne, was sich aus Datenblättern ablesen lässt, von dem, was nicht.
| Faktor | MI455X / Helios | MI355X | Verhältnis | Quelle |
|---|---|---|---|---|
| HBM-Bandbreite pro GPU | 23,3 TB/s4 | 8 TB/s5 | 2,9x (23,3 ÷ 8 = 2,9125) | Datenblätter |
| HBM-Kapazität pro GPU | 432 GB HBM44 | 288 GB HBM3E5 | 1,5x (432 ÷ 288) | Datenblätter |
| Silizium-Produkt | — | — | 4,37x (2,9125 × 1,5) | berechnet |
| Behauptetes Total | — | — | 34x1 | AMD |
| Zu erklärender Rest | — | — | ~7,8x (34 ÷ 4,37) | berechnet |
Zwei Dinge fallen sofort auf. Erstens: Beide Silizium-Faktoren sind echt. Der MI455X liefert 2,9x die Bandbreite pro GPU und 1,5x die Kapazität des MI355X; multipliziert ergibt das 4,37x — rund 4,4x. Bandbreite zählt, weil Decode speichergebunden ist; Kapazität zählt, weil Batch-Größe und KV-Cache-Spielraum mit ihr skalieren. Weil der MI355X exakt das 288-GB/8-TB/s-Speichersystem eines GB300 NVL72 trägt53, gelten dieselben Faktoren auch gegen NVIDIA Blackwell Ultra — aber dieser herstellerübergreifende Vergleich ist unserer, nicht AMDs: Die offengelegten 34x sind eine generationsbezogene Zahl.
Zweitens — und das ist die ganze Geschichte: 34 ÷ 4,37 = 7,78. Etwa 7,8x des behaupteten Vorteils sind kein Silizium — sie müssen aus Arbeitslast-Konfiguration, Serving-Stack-Einstellungen, Quantisierungswahl und Batch-Annahmen kommen. AMD hat DeepSeek V4 Flash in FP4 auf 432-GB-Karten gemessen1; diese Konfiguration leistet enorme Arbeit in diesem Verhältnis, und sie ist der Teil, den kein Datenblatt verifizieren oder widerlegen kann.
Der Rest von 7,8x im Verhör
Der Rest muss aus benennbaren, prüfbaren Mechanismen gebaut sein. Liste der plausiblen Beiträge mit Bewertung:
FP4-Modellwahl (groß, echt, teilweise fair). DeepSeek V4 Flash wurde auf Helios in FP4 gemessen1. Geringere Precision wirkt doppelt: Die Gewichte schrumpfen (mehr Modellkopien pro Rack, mehr KV-Raum), und — wenn die Baseline dichter läuft — erbt der Vergleich einen Precision-Mismatch. Die MI355X-Baseline, die AMD tatsächlich nutzte, macht die Precision-Frage schärfer: Der MI355X unterstützt ebenfalls FP4 (MXFP4 auf CDNA 4)5 — lief die Baseline ebenfalls in FP4, trüge der Rest gar keinen Precision-Mismatch. Wie AMD die MI355X-Seite des Vergleichs betrieben hat, ist nicht offengelegt — und gegen NVIDIA GB300 (der NVFP4 nativ kann3) gilt dieselbe Einschränkung: Der ehrliche Anteil dieses Faktors ist nur der Kernel- und Stack-Unterschied, kein Precision-Anspruch. Plausibler Beitrag: bis zu 1,5–2,5x des Rests, wenn die Baseline in FP8 lief; nahe 1x, wenn beide Seiten FP4 liefen.
Spekulative Dekodierung, Akzeptanzrate (groß, arbeitslastabhängig). Spek-Decode multipliziert den effektiven Durchsatz mit der Akzeptanzlänge — 2–4x sind mit gut abgestimmten Draft/Target-Paaren erreichbar, und das ist reine Software. Hat AMDs Stack MTP oder ein externes Draft-Modell genutzt, die Baseline nicht, kann allein dieser Punkt den Großteil des Rests tragen. Urteil: realer Mechanismus, aber eine Konfigurations-Eigenschaft — keine Eigenschaft von 432 GB HBM4.
MoE-Routing und Expert-Parallel-Platzierung. Mit 31 TB HBM4 in einer 72-GPU-UALoE-Domain (3,6 TB/s pro GPU)4 hält ein MoE-Modell mehr Experten resident und routet weniger All-to-Alls über Knotengrenzen — hier wandelt Kapazität für MoE-Serving tatsächlich in Durchsatz. Das ist der eine Rest-Beitrag, der siliziumsnah ist: Ohne die 1,5x Kapazität und das 72-GPU-Fabric gäbe es ihn nicht. Plausibler Beitrag: 1,3–2x, der verteidigungsfähigste Teil des Rests.
Batch-Skalierung aus dem Kapazitätsspielraum. Decode-Durchsatz skaliert mit der Batch-Größe bis zur Compute-Grenze; die Batch-Größe skaliert mit freiem HBM. 432 GB gegen 288 GB heißen 1,5x KV-Cache, also tieferes Batching bis zur speichergebundenen Decke. Aber Vorsicht — dieser Faktor ist bereits halb gezählt: Das Kapazitätsverhältnis ist die 1,5x im Silizium-Produkt. Es im Rest nochmal zu zählen ist Doppelbuchung, die häufigste Art, wie Hersteller-Zerlegungen schummeln. Urteil: Nur der nichtlineare Rest (Batch jenseits der GB300-Decke) ist legitimerweise additiv, und der ist bescheiden — vielleicht 1,2x.
Serving-Stack-Tuning. Engine-Wahl, Scheduler-Einstellungen, Chunked Prefill, KV-Eviction-Politik — jeder Punkt bewegt zig Prozent, und der dokumentierte Churn der Serving-Runtimes zeigt, dass sich das unter deinen Füßen ändert6. Ein Benchmark-Team, das eine Seite härter tuned, kauft 1,3–1,7x, ohne Hardware anzufassen. Urteil: real, aus der Offenlegung nicht überprüfbar — der Rabatt des Käufers.
Die speichergebundene Decke selbst. Auf batch-lastigem Decode wandelt sich der Bandbreitenfaktor nahezu linear — 2,9x Bandbreite sind ~2,9x Tokens an der Decke. Hier gibt es keinen Rest; das ist der bereits gezählte Teil.
Das ehrliche Konto: 4,4x Silizium, rund 1,3–2x MoE/Fabric-Nähe, 1,2x nichtlineares Batching — und die restlichen 3–5x beruhen auf FP4-gegen-FP8-Baseline-Parität und Spec-Decode-/Batch-Konfiguration. Nichts davon ist erfunden; alles davon gilt unter der Bedingung, DeepSeek V4 Flash so zu betreiben, wie AMD es betrieben hat.
Warum FP4 auf einer kapazitätsreichen Karte das Verhältnis schmeichelt
Die Messkonfiguration verdient eigene Prüfung. DeepSeek V4 Flash in FP4 auf 432-GB-Karten ist der günstigste Standpunkt für Helios, aus drei gestapelten Gründen. Erstens halbieren FP4-Gewichte noch einmal gegenüber FP8, sodass der 1,5x-Kapazitätsvorsprung zum Multiplikator auf einem noch größeren freien Pool wird — KV-Cache-Raum, residente Expert-Kopien, tiefere Batches. Zweitens maximiert eine kapazitätsreiche Karte, die hart quantisiert, den Bandbreite-pro-Modellbyte-Vorteil: Die 2,9x Bandbreite kaufen 4-Bit-Lesen, den dichtestmöglichen Traffic — genau dort ist speichergebundener Decode am schnellsten. Drittens wandert die NVIDIA-Baseline des Vergleichs in die Gegenrichtung: Eine Baseline, dichter geladen (FP8), gibt mehr Bytes pro Token aus und wirkt langsamer auf demselben Silizium, das ebenfalls FP4 könnte3.
Nichts davon macht die Messung falsch. Es macht sie zu einer Best-Case-Ecke: Die Multiplikation aus Precision, Modellform und Kapazität ist so gewählt, dass jeder Silizium-Faktor gleichzeitig voll ausgereizt wird. Ein Käufer, der ein dichtes FP8-Modell oder eine latenzsensitive Klein-Batch-Arbeitslast betreibt, sitzt nirgends in dieser Ecke. Die Behauptung ist dort, wo sie gemessen wurde, wahr — und die Offenlegung (AMD Performance Labs, Messungen und Berechnungen, DeepSeek V4 Flash FP4 gegen MI355X)1 sagt das genau, wenn man genau liest. Was sie nicht sagt: Auf welches Verhältnis die Zahl am Betriebspunkt deiner Arbeitslast kollabiert.
Ramp-Realität: Was wann ausgeliefert wird
Das Silizium-Argument mag überstehen; der Lieferkalender ist der Ort, an dem Hype historisch verschwindet. Ground Truth Ende September 2026:
- AMD-CFO Jean Hu auf der Citi Global TMT Conference (September 2026): MI450-Produktionsauslieferungen beginnen Ende Q3 2026 mit dort beginnenden Umsatz, ein „sehr signifikanter Schritt nach oben" in Q4, weitere Steigerungen bis Anfang 2027, und die Nachfrage 2027 „über unseren ursprünglichen Erwartungen" — das Angebot werde ausgebaut7.
- Oracle und AMD kündigten am 14. Oktober 2025 an, dass OCI Launch-Partner des ersten öffentlich verfügbaren MI450-Superclusters wird — anfänglich 50.000 GPUs ab Kalenderquartal Q3 20268; Jean Hus Auslieferungsleitung (Ende Q3, siehe oben) passt zu ersten Racks, die jetzt Oracle-Rechenzentren erreichen.
- „In Produktion" heißt nicht „für dich verfügbar": Das HBM4-Angebot 2026 ist an hyperscalerartige Käufer vergeben; für alle anderen ist Helios-Volumen ein Gespräch für 20277. Parallel dazu berichtete SemiAnalysis (via CNBC, 6. Juli 2026), dass NVIDIA Kyber NVL144 — das Rubin-Ultra-Rack — wegen PCB-Midplane-Fertigbarkeit auf 2028 verschoben wurde, während Vera Rubin NVL72 derselben Generation in voller Produktion steht und diesen Herbst ausgeliefert wird9. Der Kalendervergleich ist auf beiden Seiten in Bewegung.
- Der Prüfpunkt ist nicht die Keynote, sondern der Q4-Umsatzschritt, den ein CFO inzwischen öffentlich angekündigt hat7. Druckt er, ist die Ramp echt; wird er weich, waren die 34x der leichte Teil.
Urteil: Echte Arithmetik auf einer gewählten Arbeitslast, kein Silizium-Urteil
Die 34x sind ehrliche Arithmetik auf der Konfiguration, die AMD gewählt hat: Jeder Faktor ist plausibel echt, die Silizium-Hälfte ist datenblattverifizierbar, und die Offenlegung nennt Modell, Precision und Baseline — AMDs eigenen MI355X1. Was sie nicht ist: 34x der Durchsatz, den du sehen wirst. Ein Käufer sollte in dieser Reihenfolge abdiskontieren:
- Die 4,4x behalten. Bandbreite und Kapazität sind physikalisch; sie wandeln sich auf speichergebundenen Lasten ungefähr linear.
- Die Precision-Ecke abdiskontieren. Wenn dein Modell FP8 läuft oder dein SLA FP4-Eckverhalten verbietet, war ein Teil des Rests nie deiner.
- Spec-Decode- und Batch-Annahmen bei deiner Traffic-Form neu rechnen. Akzeptanzlänge und Batch-Tiefe sind arbeitslastspezifisch, nicht kaufbar.
- Den Stack einpreisen, nicht nur die GPU. Runtime-Churn auf beiden Plattformen bewegt gemessene Zahlen zwischen Releases um zig Prozent6.
| Vergleich | Ehrliches Verhältnis | Anmerkungen |
|---|---|---|
| Nur Silizium (Bandbreite × Kapazität) | 4,4x | 2,9125 × 1,5; datenblattverifizierbar43 |
| + MoE/Fabric-Residenz auf Helios | ~5–8x | Kapazitätswandlung, teilweise verteidigbar |
| + FP4-Konfigurationsecke auf DeepSeek V4 Flash | volle 34x | AMDs Messpunkt; Baseline: AMDs eigener MI355X1 |
| Deine FP8-dichte Arbeitslast, getunte Stacks, beide Seiten | ~3–5x im besten Fall | die Zahl, die du vor der Unterschrift modellieren solltest |
| NVIDIA-Rack der nächsten Generation (Rubin Ultra / Kyber NVL144, berichtet 2028) | unbekannt | es existieren noch keine Drittanbieter-Zahlen9 |
Unser kritisches Urteil zur MI400-Generation bleibt bestehen4: Das Datenblatt-Roofline begünstigt zum ersten Mal Decode und Prefill, und Helios ist die erste ernstzunehmende Rack-Antwort von AMD. Die 34x zerlegen sich so, wie es jede gute Marketing-Zahl tut — eine wahre Tatsache über Silizium, multipliziert mit einer gewählten Arbeitslast, als einzige Zahl präsentiert. Kauf das Silizium; leite den Rest selbst ab.
Artikel erstmals veröffentlicht: 24. September 2026 Autor: flozi00
Weiterlesen
- AMD MI300X/MI350/MI400: Kritische Datensicht — die Datenblatt-Grundlage dieser Zerlegung
- Serving-Engine-Churn 2026 — warum Stack-Annahmen in jedem Benchmark driften
- Der KV-Cache: Bit-exakte Speicher-Mathematik — wie Kapazität in Batch-Tiefe wandelt
Footnotes
-
AMD, AAI-2026-Pressemitteilung, Fußnote MI400-020 — 34x-Behauptung: „measurements and calculations by AMD Performance Labs in July 2026 … run on Deepseek V4 Flash with FP4 serving compared to AMD Instinct™ MI355X GPU." Pressetext: „AMD Instinct MI455X GPUs deliver 34x higher token throughput compared to MI355X GPUs." https://ir.amd.com/news-events/press-releases/detail/1294/aai-2026-amd-delivers-full-stack-compute-for-the-agentic-ai-era ↩ ↩2 ↩3 ↩4 ↩5 ↩6 ↩7
-
AMD-Pressemitteilung, AAI 2026: AMD Delivers Full-Stack Compute for the Agentic AI Era, 2026-07-23 — MI400/Helios-Launch, „bis zu 30% mehr Inferenz-Tokens pro Dollar", 31 TB HBM4 und ~1,7 PB/s aggregiert pro Rack. https://ir.amd.com/news-events/press-releases/detail/1294/aai-2026-amd-delivers-full-stack-compute-for-the-agentic-ai-era ↩
-
NVIDIA, GB300 NVL72 Spezifikationen — 288 GB HBM3e pro GPU bei 8 TB/s; NVFP4 erste Klasse auf Blackwell Ultra. https://resources.nvidia.com/en-us-blackwell sowie The Next Platform, GB300 NVL72 rack analysis, 2025/2026. https://www.nextplatform.com ↩ ↩2 ↩3 ↩4 ↩5
-
AMD, Instinct MI455X Produktspezifikationen (432 GB HBM4, 23,3 TB/s pro GPU, UALoE 3,6 TB/s pro GPU, 72 GPUs pro Rack) und Helios-Broschüre; Launch-Berichterstattung: Tom's Hardware, AMD AAI 2026: Helios rack analysis, Juli 2026. https://www.amd.com/en/products/accelerators/instinct/mi400/mi455x.html ↩ ↩2 ↩3 ↩4 ↩5
-
AMD, Instinct MI355X Produktseite — 288 GB HBM3E, 8 TB/s Peak-Speicherbandbreite, MXFP6/MXFP4-Support auf CDNA 4. https://www.amd.com/en/products/accelerators/instinct/mi350/mi355x.html ↩ ↩2 ↩3 ↩4
-
flozi00 TechHub, Serving Engine Churn 2026 — datiertes Register verhaltensändernder Runtime-Releases über vLLM/SGLang/TensorRT-LLM. https://flozi.net/de/guides/ai/serving-engine-churn-2026 ↩ ↩2
-
AMD-CFO Jean Hu, Citi Global TMT Conference, September 2026 — erste MI450-Auslieferungen Ende Q3 2026, „sehr signifikanter Schritt nach oben" in Q4, Nachfrage 2027 über ursprünglichen Erwartungen; berichtet von edgen.tech, gedeckt von Tom's Hardware. https://www.tomshardware.com ↩ ↩2 ↩3
-
Oracle und AMD, Oracle and AMD Expand Partnership to Help Customers Achieve Next-Generation AI Scale, 14.10.2025 — OCI Launch-Partner, anfänglich 50.000 MI450-GPUs ab Kalenderquartal Q3 2026. https://www.oracle.com/news/announcement/ai-world-oracle-and-amd-expand-partnership-to-help-customers-achieve-next-generation-ai-scale-2025-10-14 ↩
-
SemiAnalysis (via CNBC), Nvidia's next-gen AI rack system delayed to 2028 on manufacturing snags, 6. Juli 2026 — „Kyber NVL144 rack architecture has been delayed to 2028 as the PCB midplane remains challenging from a manufacturability standpoint"; derselbe Bericht: aktuelles Rubin in voller Produktion, Auslieferung Herbst 2026. https://www.cnbc.com/2026/07/06/nvidia-kyber-rack-system-delays-manufacturing-taiwan-rubin-chips-.html ↩ ↩2