Zum Inhalt springen
Kurzer Hinweis: flozi00 TechHub ist ein Solo-Nebenprojekt neben einem Vollzeitjob — persönliche Lernnotizen, keine offiziellen Aussagen. Kritische Schritte selbst prüfen.

Der HBM4-Mangel ist ein KV-Cache-Ökonomieproblem, kein Beschaffungsproblem

Warum HBM-Kapazität, nicht FLOPs, die KI-Inferenz begrenzt: Agenten-anzahl pro GB für MHA/GQA/MLA/MQA, aus der Byte-Formel hergeleitet, Microns ~3-facher Wafer-Flächen-Verlust pro HBM-Bit, die Rubin-Ultra-Reduktion von 288 auf 192 GB nachgerechnet, Spot-gegenüber-LTA-Preise und die Milderungsleiter, die Betreiber tatsächlich hochklettern.

9 Min. Lesezeitflozi00
aimachine-learninggpuhbmgpu-memoryinferencehardware

Der HBM4-Mangel wird als Beschaffungsgeschichte berichtet: Wer hat welche Mehrjahresvereinbarung unterschrieben, welcher Hyperscaler hat welche Allokation gesichert. Diese Rahmung verkennt den Mechanismus. High-Bandwidth-Memory ist knapp, weil Inferenz es strukturell verbraucht — jeder Agent mit langem Kontext ist ein speicherresidenter Prozess, dessen Footprint linear mit dem Kontext wächst, und jeder Prozentpunkt HBM, den Sie nicht kaufen können, sind Agenten, die Sie nicht betreiben können. Dieser Leitfaden rechnet die Arithmetik von Ende zu Ende durch: Bytes pro Token, Agenten pro GB, Wafer pro Bit, Dollar pro Stack. Die Schlussfolgerung ist für die Erzählung „KI-Nachfrage ist unendlich, das Angebot wird schon aufholen" unangenehm: Die Limitierung entsteht dort, wo die Physik des KV-Caches auf eine Wafer-Allokation trifft, die strukturell rationiert ist.

Die eine Formel, wiederverwendet

Aus unserem KV-Cache-Leitfaden: KV-Bytes = 2 × Layer × KV-Heads × Head-Dimension × Bytes pro Wert × Tokens. Die vier Architekturen dieses Artikels, site-verifiziert:

  • MHA (kein KV-Sharing, 64 Layer, 64 KV-Heads, 128 Dim, fp16): 2 × 64 × 64 × 128 × 2 B = 2.097.152 B = 2 MiB/Token
  • GQA-8 (Qwen3-32B: 64 Layer, 8 KV-Heads): 262.144 B = 256 KiB/Token
  • MQA (1 KV-Head): 32.768 B = 32 KiB/Token
  • MLA (DeepSeek-V3: 576 latente Elemente × 61 Layer × 2 B): 70.272 B ≈ 68,6 KiB/Token

Agenten pro GB: Die einzige Kapazitätszahl, die zählt

Ein paralleler Agent ist sein KV-Cache, der für die Lebensdauer der Session im HBM resident ist. Teilt man nutzbares HBM durch den Footprint pro Session, erhält man die einzige Zahl, die Beschaffung tatsächlich kauft.

Session-Footprints und Agenten pro GB (KiB/MiB zur Basis 1024, GB = 10^9 B):

ArchitekturB/Token100k-Kontext / SessionAgenten pro GB bei 100k1M-Kontext / SessionAgenten pro GB bei 1M
MHA (fp16)2.097.152209,7 GB0,00482.097 GB0,00047
GQA-8 (fp16)262.14426,2 GB0,038262,1 GB0,0038
MLA (bf16)70.2727,03 GB0,14270,3 GB0,0142
MQA (fp16)32.7683,28 GB0,30532,8 GB0,0305

Direkt abgeleitet: Bei 100k Kontext bedient 1 GB HBM 0,14 MLA-Agenten oder 0,038 GQA-Agenten. Die Rohkapazität einer 288-GB-GPU fasst selbst unter der kompakteren Architektur dieses Artikels (MQA fp16, ~262 MB pro Session) nur ~1.100 parallele 8k-Sessions — mit GQA-8 ~137; bei agentischem 100k-Kontext fasst dasselbe Silizium 35 MLA-Agenten oder 9,5 GQA-Agenten. Das Rechenwerk steht lange still, bevor der Speicher voll ist — Decode ist speicherbandbreitenbegrenzt, und der Cache ist speicherkapazitätsbegrenzt.

Der Wafer-Mechanismus: Jeder HBM-Stack sind ~3 nicht gebaute DDR5-Module

Auf der Hot Chips 2026 hat Micron quantifiziert, was die Branche jahrelang gemurmelt hat: Für dieselbe Bit-Anzahl verbraucht HBM grob das 3-Fache der Wafer-Fläche von DDR5 — und der Malus weitet sich mit jeder Generation aus1. Die Ursachen stapeln sich: TSV-gedünnte Dies opfern nutzbaren Wafer-Rand, jeder Die eines 12-Hi-Stacks trägt Routing-Overhead für vertikale Busse, Base-Logic-Dies fressen Kapazität am Leading Edge, und Stacking-Ausbeute multipliziert die Ausbeuten der einzelnen Dies. Die Folge ist Arithmetik, nicht Stimmung: Ein Wafer-Start, der zu HBM umgeleitet wird, produziert ein Drittel der Bits. Jede mit 288 GB HBM bestückte GPU verzichtet implizit auf grob 864 GB DDR5-Klasse-Angebot aus demselben Wafer-Einsatz.

TrendForce sieht den HBM-Wafer-Einsatz bei ~18% des Gesamt-DRAM-Wafer-Einsatzes Ende 2025, steigend auf ~30% bis Ende 2027 — aber HBM als Anteil des DRAM-Bit-Angebots erreicht im selben Zeitraum nur ~13%2. Diese Lücke — 30% der Wafer, 13% der Bits — ist der ~3-fache Flächen-Malus, sichtbar in den Industriestatistiken. Deshalb ist „baut mehr Fabs" keine Antwort für 2026, und deshalb ist das Absinken der kombinierten DRAM-Inventare von Samsung und SK hynix unter zehn Tage Vorrat Anfang September 20263 ein Rationierungssignal, kein Nachfragesignal: Der Allokationsmechanismus — nicht der Preismechanismus — bringt diesen Markt zum Stehen.

Rubin Ultra: Die 288-auf-192-GB-Reduktion, nachgerechnet

Basierend auf der Basissparte Rubin liefert die GPU 288 GB HBM4. Rubin Ultra wurde auf der GTC mit bis zu 1 TB HBM4E in 16 Stacks in 12-Hi-Konfiguration angekündigt — und bis September 2026 testet Nvidia Berichten zufolge Varianten mit 192 GB und 256 GB, teils zurückgestuft von HBM4E auf HBM4 und von 12-Hi auf 8-Hi-Stacks45. Nvidias offizielle Linie: „Roadmap intakt"; die Samples sagen: das Speicherbudget ist es nicht. TrendForce führt den Rückzug auf DRAM-Knappheit bis 2027 und unsichere 12-Hi-HBM4E-Validierung zurück — eine angebotsseitige Entscheidung, kein Design-Wunsch. Der 8-Hi-Tausch ist wiederum die Wafer-Mathematik: Kürzere Stacks bedeuten, dass derselbe Pool bekannt-guter DRAM-Dies mehr vollständige Stacks liefert — Kapazität pro Stack gegen System-Output getauscht.

Diese Kürzung von 288 auf 192 GB sind exakt 33% weniger HBM pro GPU. Agentenzahlen nachgerechnet (Budget = Kapazität − 40 GB reserviert für Gewichte, Aktivierungen und Runtime bei einem ~100-GB-Klasse-Serving-Modell mit quantisierten Gewichten; kleinere Modell-Reservierungen ändern nur die Ursache der Lücke, die Steigung bleibt linear in der Kapazität):

GPU-KonfigurationFreies KV-BudgetMLA-Agenten @ 100kGQA-Agenten @ 100kMLA-Agenten @ 1MGQA-Agenten @ 1M
288 GB (Rubin)248 GB35,39,53,530,95
256 GB (Rubin Ultra, getestet)216 GB30,78,23,070,82
192 GB (Rubin Ultra, getestet)152 GB21,65,82,160,58

Bei 192 GB bedient ein Flaggschiff-Beschleuniger von 2027 39% weniger 100k-Kontext-MLA-Agenten als das 288-GB-Teil, das er ablöst (21,6 gegenüber 35,3) — und GQA-Flotten-Betreiber fallen von 9,5 auf 5,8 parallelen Agenten pro GPU. Dass die theoretischen FLOPS gleich bleiben, ist irrelevant: Die Bindung ist Residenz, und die Residenz wurde um ein Drittel gekürzt.

Preis und BOM: Speicher ist jetzt die relative Mehrheit der Maschine

Die Spot-gegenüber-Kontrakt-Spanne ist das sauberste verfügbare Angebotssignal. Anfang September 2026: Ein 36-GB-HBM3E-Stack handelt bei grob 2.100 US-Dollar Spot gegenüber 300–400 US-Dollar in Langzeitvereinbarungen67 — eine 5- bis 7-fache Prämie. Große Käufer zahlen nicht Spot, und genau das ist der Punkt: Die Lieferanten haben die große Mehrheit der 2027er-Kapazität auf Mehrjahresverträge allokiert (laut Seoul Economic Daily ~70% des Outputs gesperrt bei Microsoft, Nvidia und Google, teils bis 2031)8. Der Spotpreis ist der Preis des nicht allogierten Rests. Kontrakt-DRAM erzählt dieselbe Geschichte in Zeitlupe: TrendForces Februar-2026-Revision sieht konventionelle DRAM-Kontraktpreise bei +90–95% QoQ im 1Q26 — das ist eine nahezu Verdopplung in einem Quartal, die sich mit Q2s +58–63% auf rund 3-fach in sechs Monaten aufkumuliert9 — und die 2027er-HBM4-Kontraktrunden sollen die Preise „um ein Vielfaches" heben2.

Was das mit der Stückliste (BOM) einer GPU macht:

PositionSchätzungQuellentyp
H100: HBM ≈ 1.350 von ≈ 3.320 US-Dollar Herstellkosten (~41%)Stackweise LTA-MathematikBOM-Teardown10
B200: 8 × 24 GB HBM3E ≈ 2.900 von ≈ 6.400 US-Dollar (~45%)Stackweise LTA-MathematikBOM-Teardown10
B300 (288 GB, 8 × 36 GB): 2.400 US-Dollar bei 300 US-Dollar/Stack — oder 16.800 US-Dollar zu Spotpreisen8 × 300 vs 8 × 2.100gerechnet6
GB300-Rack: Speicher ≈ 374.000 US-Dollar von ≈ 3,99 Mio. (~9,4%)Morgan-Stanley-BOMRack-Schätzung11
VR200-Rack: Speicher ≈ 2,0 Mio. US-Dollar von ≈ 7,8 Mio. (~25,7%)Morgan-Stanley-BOMRack-Schätzung11

Vor einer Generation war der Logik-Die die Kostenposition der GPU; bei Blackwell-Klasse-Teilen nähert sich HBM der Hälfte der Herstellkosten, und auf Rack-Ebene überschreitet der Speicher ein Viertel der gesamten BOM. Das „Rechenwerk", das man zu kaufen glaubte, ist zunehmend ein Speichersystem mit angehängtem Die.

Die Milderungsleiter: Was Betreiber tatsächlich tun

Wenn HBM rationiert ist, kann man sich nicht herauskaufen — deshalb ist jeder Serving-Trick, der KV-Bytes reduziert, im Kern eine HBM-Beschaffungsstrategie. Nach Hebelwirkung geordnet:

  1. Architektur (beim Modell festgelegt). MLA komprimiert den Cache um den Faktor 29,8 gegenüber MHA und 3,73 gegenüber GQA-8 (262.144 / 70.272 = 3,73): Auf der 192-GB-Variante sind das 21,6 gegenüber 5,8 parallele 100k-Agenten. Ein GQA-Modell in einem memory-rationierten Markt zu wählen ist eine 3,7-fache Kapazitätsselbststrafe. Die volle Herleitung steht in unserem KV-Cache-Leitfaden.
  2. KV-Quantisierung (2-fach, reine Konfiguration). FP8-KV halbiert die Byte-Kosten pro Wert: GQA-8 bei 100k Kontext fällt von 26,2 auf 13,1 GB pro Session — die 192-GB-GPU steigt von 5,8 auf 11,6 GQA-Agenten. Int4-KV (z. B. Kimis KIVI-artiges Per-Channel-Schema) geht auf Kosten der Genauigkeit weiter.
  3. Präfix-Wiederverwendung (bis ~6,4-fach auf präfix-lastigen Flotten). RadixAttention-artiges Sharing speichert geteilte System-Prompt- oder Few-Shot-KV einmal, nicht pro Session. Ein 2.000-Token-Prompt sind ~524 MB GQA-fp16-KV pro parallelem Nutzer ohne Sharing; mit Sharing: einmal.
  4. Tiering in Host-DRAM (unbegrenzt, latenzbepreist). Kalte KV-Seiten über PCIe/CXL in das DDR5 der Hosts auslagern — das seinerseits genau der Speicher ist, den die HBM-Wafer-Allokation verdrängt, man beachte die Ironie. Eine 100k-Kontext-MLA-Session sind 7,03 GB; ein Rack mit Terabytes DDR5 parkt Tausende von Agenten, gegen Re-Read-Latenz bei Aktivierung. Die vollständige Bytes-pro-Runde-Mathematik steht in unserem Agenten-KV-Tiering-Leitfaden.

Keine dieser Maßnahmen fügt ein einziges Wafer hinzu. Sie sind nachfrageseitige Vernichtung der einzigen Ressource, die ausverkauft ist — genau deshalb bestimmen sie, nicht neues Angebot, die Betriebsökonomie bis 2028.

Urteil

„Die KI-Nachfrage ist unendlich" leistet in dieser Analyse keine Arbeit. Nachfrage bei welchem Speicher-Footprint? Bei MHA und 1M Kontext bedeuten 0,00047 Agenten pro GB, dass die gesamte weltweite HBM-Produktion einen Rundungsfehler an Sessions bedient; bei MLA und 100k Kontext bedeuten 0,142 Agenten pro GB, dass eine einzige 192-GB-GPU eine glaubhafte Agentenflotte ist. Die Knappheit ist real, aber sie ist kein Blitz-vom-Himmel-Nachfrageschock — sie ist 3-fache Wafer-pro-Bit-HBM-Ökonomie, die auf agentische Workloads mit 10–30-fachen KV-Footprints gegenüber Chat trifft, abgerechnet über einen Allokationsmechanismus, der das 2027er-Angebot verkauft hat, bevor das Jahr begann. Neue Kapazität kommt: SK hynix' M15X rampt bis Mitte 2027 auf ~50.000 Wafer/Monat12, Samsungs P4 läuft phasenweise ab 2026 ein, und Microns Idaho-Komplex (9,3+ Mrd. US-Dollar) liefert erste DRAM-Wafer im 2. Halbjahr 202712. Das ist Physik mit langer Vorlaufzeit — Cleanrooms, TSV-Werkzeuge, Qualifikationszyklen —, keine Pressemitteilungen, und nichts davon entlastet einen Serving-Plan für 2026–2027. Plant in Agenten-pro-GPU, nicht in FLOPS. Kauft Architektur, bevor ihr Speicher kauft.

Was man mitnehmen soll

  • Der Übertragungsmechanismus der Knappheit ist der KV-Cache: 0,038–0,14 Agenten pro GB bei agentischem Kontext bedeuten, dass HBM-Kapazität — nicht Rechenleistung — das Produkt ist.
  • ~3-fache Wafer-Fläche pro Bit (Micron, Hot Chips 2026) macht das HBM-Angebot unabhängig von der Form der Nachfragekurve strukturell rationiert: Kapazität wird beim Wafer-Start entschieden, gut ein Jahr im Voraus.
  • Rubin Ultras berichtete 192/256-GB-Varianten sind eine 33%-Kapazitätskürzung: 35,3 → 21,6 MLA-Agenten pro GPU bei 100k Kontext — FLOPS unverändert, Residenz ausgehungert.
  • 2.100 US-Dollar Spot gegenüber 300–400 US-Dollar LTA ist die Allokationsprämie; HBM ist inzwischen ~40–47% der GPU-Herstellkosten und ~25,7% einer VR200-Rack-BOM.
  • Die Milderungsleiter — MLA/GQA-Kompression (3,73-fach bis 8-fach gegenüber GQA/MHA), FP8-KV (2-fach), Präfix-Wiederverwendung (~6,4-fach), Host-DRAM-Tiering — ist der einzige Hebel, der sich bewegt, bevor die Kapazität ab 2028 eintrifft.

Footnotes

  1. Micron auf der Hot Chips 2026, berichtet von Tom's Hardware und Igor's Lab: HBM erfordert ~3× die Wafer-Fläche von DDR5 pro Bit, und die Lücke weitet sich pro Generation aus. https://www.igorslab.de/en/micron-hbm-requires-three-times-wafer-area-ddr5-gap-widens ↩

  2. TrendForce, „Tight DRAM Supply Gives Suppliers Greater Pricing Power in HBM" — HBM-Wafer-Einsatz ~18%/22%/30% und HBM-Bit-Anteil ~8%/9%/13% des DRAM Ende 2025/2026/2027; 2027er-HBM4-Kontraktpreise voraussichtlich um ein Vielfaches steigend. https://www.dramexchange.com/WeeklyResearch/Post/2/12718.html ↩ ↩2

  3. Chosun Daily (8. Sept. 2026) und Sedaily (7. Sept. 2026) unter Berufung auf KB Securities: kombinierte Speicher-Inventare von Samsung + SK hynix unter zehn Tagen Vorrat. ↩

  4. Tom's Hardware: „Nvidia reportedly testing lower memory configs of Rubin Ultra as memory shortage bites back — designs tested include as little as 192 GB and step back to HBM4", unter Berufung auf The Information; Nvidia-Stellungnahme: „Our roadmap is intact." https://www.tomshardware.com/pc-components/gpus/nvidia-reportedly-testing-lower-memory-configs-of-rubin-ultra-as-memory-shortage-bites-back-designs-tested-include-as-little-as-192-gb-and-step-back-to-hbm4 ↩

  5. TrendForce (Aug. 2026): Nvidia evaluiert 8-Hi-HBM4E-, 12-Hi-HBM4- und 8-Hi-HBM4-Alternativen für Rubin Ultra, begründet mit DRAM-Knappheit 2027 und 12-Hi-HBM4E-Validierungsrisiko. ↩

  6. Intuition Labs (via Motley Fool / 247wallst.com), 4. Sept. 2026: 36 GB HBM3E bei ~2.100 US-Dollar auf dem Spotmarkt. ↩ ↩2

  7. Seoul Economic Daily via Yahoo Finance: LTA-Preise ~2,87 Mio. Won (~300–400 US-Dollar) pro 36-GB-HBM3E-Stack. ↩

  8. Seoul Economic Daily via Yahoo Finance: ~70% der Samsung-HBM-Kapazität unter LTAs mit Microsoft, Nvidia und Google gesperrt, teils bis 2031; SK-hynix-CEO erwartet Knappheit bis 2030. ↩

  9. TrendForce-Forecast-Revision Februar 2026 (via IBS-Analyse): konventionelle DRAM-Kontraktpreise +90–95% QoQ im 1Q26 (hochgerechnet von +55–60%); Q2 2026 +58–63%; Q3 2026 +13–18%. ↩

  10. Weit verbreitete BOM-Teardown-Schätzungen (Kanal-Analysten): H100 ~1.350 US-Dollar HBM von ~3.320 US-Dollar Herstellkosten; B200 ~2.900 US-Dollar HBM von ~6.400 US-Dollar. Richtung von mehreren unabhängigen BOM-Analysen gestützt; exakte Zahlen sind Schätzungen, nicht herstellerseitig veröffentlicht. ↩ ↩2

  11. Morgan-Stanley-Research-Rack-BOM-Schätzungen (Lieferketten-Checks, mehrfach von Medien bestätigt): GB300-Rack Speicher ≈ 374.000 von ≈ 3,99 Mio. US-Dollar; VR200-NVL72-Rack Speicher ≈ 2,0 Mio. von ≈ 7,8 Mio. US-Dollar. ↩ ↩2

  12. SK hynix M15X (Cheongju): ~50.000 Wafer/Monat bis Mitte 2027, Output überwiegend für HBM committed; Micron Idaho ID1: erste Leading-Edge-DRAM-Wafer im 2. Halbjahr 2027; Samsung Pyeongtaek P4 läuft phasenweise ab 2026 ein. Nach Tom's Hardware, SK-hynix-Investorenmaterial und Microns US-Expansionsveröffentlichungen. ↩ ↩2