Jede Frage der Art „welche GPU soll ich für LLM-Inferenz kaufen?" zerfällt in drei Prüfungen, in dieser Reihenfolge: Passen Modell plus KV-Cache in den VRAM? Reicht die Speicherbandbreite für die angestrebte Token-Rate? Und erst danach: Spielt die Rechenleistung eine Rolle? Dieser Guide zeigt, wie man GPU-Spezifikationen durch diese Brille liest, was die Markt-Tiers im September 2026 tatsächlich kosten, und wo die Fallen lauern — gebrauchte Data-Center-Karten, Grenzen von Consumer-Karten, Interconnect. Die VRAM-Arithmetik selbst ist in unseren bestehenden Deep Dives behandelt; wir verlinken, statt sie erneut abzuleiten.
1. Wie man GPU-Spezifikationen für LLM-Serving liest
Decode ist speicherbandbreitenlimitiert. Beim autoregressiven Decode wird pro generiertem Token jedes aktive Modellgewicht einmal aus dem VRAM gelesen. Bei kleinen Batch-Größen spielen FLOPS kaum eine Rolle: Tokens/s pro GPU ist nach oben durch Bandbreite ÷ aktive Gewicht-Bytes begrenzt. Ein 70B-Modell in BF16 sind ~140 GB Bytes pro Token; eine H100 SXM (3,35 TB/s) hat damit bei Batch 1 eine harte Obergrenze bei etwa 24 Tok/s pro GPU, eine B200 (8 TB/s in HGX-Konfiguration) erreicht ~57 Tok/s — unabhängig von der 4,5×-FLOPS-Lücke zwischen beiden. Prefill und Decode mit großen Batches sind dagegen rechenlimitiert; dort zahlt sich Tensor-Throughput aus (FP8 auf Hopper, natives FP4 auf Blackwell). Die vollständige Roofline-Ableitung steht im Inferenz-Matheartikel.
Kapazität entscheidet, was passt — und was batchbar ist. Der VRAM muss Gewichte plus KV-Cache plus Aktivierungen aufnehmen. Quantisierung tauscht Genauigkeit gegen Kapazität und effektive Bandbreite (Bytes pro Token) — das billigste „GPU-Upgrade" ist daher oft ein Formatwechsel, keine Anschaffung; siehe den Quantisierungs-Guide. Ein Modell, das bequem passt, lässt Raum für längere Kontexte und größere Batches — der eigentliche Hebel für Kosten pro ausgeliefertem Token. Rechnen Sie zuerst mit dem VRAM-Rechner und dem KV-Cache-Deep-Dive, bevor Sie Geld ausgeben.
Die Lesereihenfolge im Datenblatt für Serving lautet also: VRAM-Kapazität (harte Grenze) → Speicherbandbreite (Decode-Tempo) → NVLink/Interconnect (Multi-GPU-Skalierung) → FLOPS (Prefill und Batch). Stromverbrauch und Kühlung multiplizieren all das und werden unten behandelt.
2. Die Markt-Tiers und Preise (Stand: September 2026)
Zuerst ein Klarheitshinweis: Dieser Markt hat keine Listenpreise. NVIDIA veröffentlicht keine für H100/H200/B200/B300; alles Folgende stammt aus Reseller-Listings, OEM-Systempreisen geteilt durch GPU-Anzahl und Analystenschätzungen, jeweils gegen mindestens zwei unabhängige aktuelle Quellen verifiziert. Die Preise sind volatil — dieselbe H100 hat über ein Jahr lang zwischen 25.000 und 40.000 USD geschwankt. Die Zahlen unten sind zum September-2026-Kurs von ~1,16 USD/EUR in EUR umgerechnet 1; behandeln Sie jede Zahl als Range mit ±20 % Verhandlungsrealität (Herkunft in 2). B200 und B300 werden nicht als Einzelkarten verkauft — sie laufen ausschließlich in 8-GPU-HGX-Systemen (gelistet 430.000–860.000 USD pro Node), daher sind deren GPU-Preise systemabgeleitet 3.
| Tier | Karte | VRAM | Bandbreite | Straßenpreis (EUR, Sept 2026) | EUR / GB VRAM | EUR pro TB/s |
|---|---|---|---|---|---|---|
| Consumer-Flaggschiff | RTX 5090 | 32 GB GDDR7 | 1,79 TB/s | ~1.700–3.700 | 53–115 | 950–2.100 |
| Workstation | RTX PRO 6000 Blackwell | 96 GB GDDR7 ECC | 1,79 TB/s | ~6.900–10.300 | 72–108 | 3.850–5.750 |
| Gebrauchte Data Center | A100 80GB | 80 GB HBM2e | 2,0 TB/s | ~6.000–12.000 (gebraucht) | 75–150 | 3.000–6.000 |
| Data Center | H100 | 80 GB HBM3 | 3,35 TB/s | ~21.500–34.500 | 270–430 | 6.400–10.300 |
| Data Center | H200 | 141 GB HBM3e | 4,8 TB/s | ~26.500–34.500 | 190–245 | 5.550–7.200 |
| Data Center | B200 | 180 GB HBM3e | 8,0 TB/s | ~34.500–47.500 | 190–260 | 4.300–5.950 |
| Data Center | B300 | 288 GB HBM3e | 8,0 TB/s | ~43.000–52.000 | 150–180 | 5.400–6.500 |
Die beiden Effizienzspalten gelesen: Consumer-Karten gewinnen gelegentlich bei EUR pro TB/s, aber ihre Kapazität ist winzig; die B300 ist die günstigste aktuelle Karte pro GB (sie ist die Kapazitätswahl — 288 GB pro GPU); und die B200 ist die günstigste pro TB/s der aktuellen Data-Center-Generation. Der Reiz der A100 ist ein breiter Gebrauchtmarkt mit Preisen unter 10.000 € für 80 GB HBM — noch immer der günstigste Einstieg in Data-Center-Speicher, mit den in Abschnitt 4 beschriebenen Risiken. Die RTX PRO 6000 zahlt zudem das ~3-Fache der EUR/TB/s einer RTX 5090 für dieselbe Bandbreite: Man kauft ihre 96 GB und ECC, nicht Tempo 4.
Die Tiers je in einem Satz. Consumer-Flaggschiffe (RTX 5090, 32 GB): schneller Decode pro Euro, begrenzt auf ~32B BF16 bzw. ~70B bei 4 Bit pro Karte. Workstation (RTX PRO 6000 Blackwell, 96 GB ECC): 70B–120B-Serving im einzelnen PCIe-Slot für Teams. Gebrauchte Vorgänger-Generation im Data Center (A100): günstige HBM-Kapazität, aber abgekündigtes Silizium. Aktuelles Data Center (H100/H200): die Produktions-Arbeitstiere mit reifem Ökosystem. Aktuelle Flaggschiffe (B200/B300): kaufen, wenn VRAM oder Throughput pro Rack es erfordern — faktisch eine Systemanschaffung, keine Kartenanschaffung 5.
3. Interconnect: Warum Multi-GPU NVLink will
Tensor-Parallelität teilt jede Transformer-Schicht über die GPUs auf; jeder generierte Token erfordert daher an jeder Schichtgrenze ein All-Reduce über die Aktivierungen. Über PCIe Gen5 x16 (~128 GB/s bidirektional) serialisiert diese Kommunikation gegen ein Speichersystem der 3,35-TB/s-Klasse; über NVLink überlappt sie. NVLink-Bandbreite pro GPU je Tier laut NVIDIA-Dokumentation: NVLink 3 auf der A100 mit 600 GB/s, NVLink 4 auf H100/H200 mit 900 GB/s, NVLink 5 auf B200/B300 mit 1,8 TB/s — gegenüber ~64 GB/s pro Richtung bei PCIe Gen5 x16 6 7. NVLink braucht zudem das SXM-Board (oder NVL-Bridge-Paare); lose PCIe-Karten kommunizieren über den Host-Root-Complex mit PCIe-Tempo.
Praktische Konsequenzen: Eine einzelne Karte der H100-Klasse am PCIe bedient ohne Weiteres — bei TP=1 gibt es keinen Inter-GPU-Verkehr. Zwei oder vier GPUs mit NVLink-Bridges skalieren weiterhin gut. Acht-fache TP innerhalb eines HGX-SXM-Nodes ist, wo der NVSwitch zählt. Und cross-node-TP ist so kommunikationslimitiert, dass Pipeline-Parallel-Layouts auf 16 Cross-Node-H100s bis zu 4,5× höheren Throughput liefern, laut einer ScitiX-AI-Studie — der Grund, warum „mehr GPUs" jenseits eines Nodes ein Layout-Denken erfordert, nicht nur ein größeres Fabric 8.
4. Risiken je Tier
Gebrauchte Data-Center-Karten (A100, ehemalige Cloud-H100s). Data-Center-Teile haben keine Verbraucher-Garantie; NVIDIAs Enterprise-Coverage folgt dem ursprünglichen Systemintegrator, und ein 24/7-Betrieb wie im Mining ist von außen unsichtbar — verlangen Sie, wo möglich, Betriebsstunden und Thermik-Logs. Die A100 ist abgekündigt (CDW listet die PNY A100 80GB PCIe als „Discontinued" zum eingefrorenen letzten Preis von 13.223 USD), dadurch dünnen Ersatzteil- und Reparaturkanäle über die Restlaufzeit aus 3. SXM-Module brauchen ein passendes Baseboard — ein billiges SXM-Modul ohne eines ist ein Papiergewicht. Gefälschte oder ausgeschlachtete Engineering-Samples zirkulieren auf Marktplätzen; kaufen Sie bei Wiederverkäufern mit Rückgaberecht.
Consumer-Karten. 32 GB begrenzen die Modellwahl, bevor alles andere es tut. Kein MIG-Partitioning (eine H100 SXM teilt sich in bis zu 7 isolierte ~10-GB-Instanzen (7×1g.10gb; das 18-GB-Profil 1g.18gb gehört zur H200) — nützlich für das Serving vieler kleiner Modelle). Die RTX 5090 hat kein ECC auf dem GDDR7; die RTX PRO 6000 hat es — relevant für lange unbeaufsichtigte Läufe, in denen stille Bit-Flips Gewichte korrumpieren. Consumer-Karten haben kein NVLink; Multi-GPU-Rigs zahlen PCIe-Overhead und skalieren TP kaum über 2 GPUs hinaus. Two-Slot-Layouts und 575 W TBP bedeuten außerdem: In ein Consumer-Netzteil und Gehäuse passen maximal ein bis zwei Karten.
System-Realitäten an der Spitze. Eine B200 zieht ~1.000 W, eine B300 ~1.400 W pro GPU; ein 8-GPU-B300-Node ist mit ~14,5 kW gelistet — Flüssigkühlungs-Territorium und eine echte Facility-Kostenposition obendrauf 3.
5. Entscheidungstabelle nach Workload
| Workload | Wahl | Begründung |
|---|---|---|
| Einzelnutzer, lokale Modelle ≤ ~70B per 4-Bit-Quantisierung | RTX 5090 (32 GB) | Bester EUR/TB/s-Wert der Tabelle; Kapazität bei Q4 ausreichend — siehe unsere Quantisierungsformate |
| Einzelnutzer, 70B–120B-Modelle (Klasse gpt-oss-120B) | RTX PRO 6000 Blackwell (96 GB) | Ein PCIe-Slot, 70B bei Q8 oder FP8 plus KV-Spielraum 4 |
| Kleines Team, Budget-Server, bestes Kapazität/EUR | Gebrauchte A100 80GB | 80 GB HBM für 6.000–12.000 €; mit den Risiken aus Abschnitt 4 |
| Kleines Team, Neukauf, maximale Flexibilität | H100 PCIe oder H200 NVL | 80–141 GB, MIG auf der H100, als Einzelkarte kaufbar 3 |
| Produktionsserving, 8B–70B-Modelle, SLO-getrieben | 8× H100 oder 8× H200 HGX | Reifes Ökosystem; die H200 halbiert die GPU-Anzahl für 141-GB-Modelle ggü. H100 9 |
| Langkontext / große Batches (RAG, Agenten, großer KV) | Kapazität zuerst: H200 141 GB, B300 288 GB | KV-Cache skaliert mit Kontext × Nebenläufigkeit — siehe den KV-Cache-Guide 5 |
| Frontier-Throughput (>70B dense, max. Tokens/s/Rack) | B200-/B300-Systeme | 2,3× H100-Bandbreite pro GPU, FP4, NVLink 5 — aber kW-Planung und Flüssigkühlung einplanen 7 |
Fazit
Kaufen Sie das Tier, das Ihre Kapazitäts-Rechnung verlangt, nicht das mit den besten FLOPS-Schlagzeilen: Führen Sie zuerst den Inferenz-Rechner mit Ihrem realen Modell, Kontext und Nebenläufigkeit aus. Im Jahr 2026 lauten die überraschenden Antworten: Eine Consumer-Karte für 2.000 € dekodiert ein 30B-Modell so schnell wie eine H100 für 30.000 € (Bandbreitenverhältnis, nicht FLOPS); die H200 ist oft das Produktions-Sweet-Spot (141 GB für kaum mehr als H100-Straßenpreise); und B200/B300-Anschaffungen sind Facility-Projekte, keine Karten-Upgrades. Im Zweifel zuerst mieten — Spezialisten-Clouds bieten H100-Raten nahe 3 USD/GPU-Stunde und erlauben, die reale Auslastung zu messen, bevor Kapital gebunden wird 3.
Footnotes
-
USD/EUR ≈ 1,16 Stand September 2026 (EZB-Referenzkurs ~1,1578); alle EUR-Angaben sind aus verifizierten USD-Listings umgerechnet und approximativ. ↩
-
Preisband-Herkunft: H100 25–40 Tsd. USD (GPUSmith, TRG Datacenters, intuitionlabs); H200 30–40 Tsd. USD + CDW-Einzelkarten-Anker (GPUSmith, GPUPerHour); B200 systemabgeleitet 40–55 Tsd. (Thunder Compute, GPUSmith, GPUPerHour-Divisionen); B300 Single-Unit-Street ~53 Tsd. USD / Systeme 67–98 Tsd. pro GPU (Spheron via Ledger §80, GPUPerHour-Divisionen Supermicro/Broadberry/Lenovo); RTX 5090 2.000–4.300 USD (convly.ai-MSRP, dev.to-Street Aug 2026, openclawdc); RTX PRO 6000 8.000–9.400 USD (runaihome, dev.to, compute-market.com); gebrauchte A100 6–12 Tsd. USD (gpucost.org-Listing 12 Tsd. A100 SXM, intuitionlabs-Baseline abgekündigt/neu 15–17 Tsd., getdeploying-Mieten als Plausibilitätscheck). Bandbreiten: NVIDIA-H100/H200/B200-Datenblätter, zusammengestellt von Rackspace und Thunder Compute; A100 80GB SXM 2.039 GB/s (A100-Datenblatt via getdeploying). ↩
-
GPUPerHour, „H200, B200, A100 Prices: You Buy a Server, Not a GPU" (Sept 2026) — CDW-H200-NVL-Einzelkarten-Listing 33.731,99 USD (21. Sep 2026), 8-GPU-HGX-Systemlistings (Supermicro/Lenovo/Broadberry), A100 abgekündigt 13.223,99 USD, DGX B300 14,5 kW. https://gpuperhour.com/blog/nvidia-gpu-prices ↩ ↩2 ↩3 ↩4 ↩5
-
RTX PRO 6000 Blackwell ggü. RTX 5090: 96 GB GDDR7 ECC ggü. 32 GB, identische 1.792 GB/s Bandbreite, ~8.000–9.400 USD (Jun 2026, Retail-Spread Newegg/Amazon/B&H) ggü. ~2.900–4.300 USD — dev.to/runaihome-Local-AI-Benchmarks (Juni–Aug 2026). ↩ ↩2
-
Thunder Compute, „NVIDIA B200 Pricing" (Sept 2026) — Single-B200-Street 45–55 Tsd. USD, H100/H200/B200-Spezifikationstabelle (3,35 / 4,8 / 8 TB/s; NVLink 900 GB/s / 900 GB/s / 1,8 TB/s). https://www.thundercompute.com/blog/nvidia-b200-pricing ↩ ↩2
-
Spheron, „What is NVLink? GPU Interconnect Bandwidth Explained" (2026) — NVLink-Bandbreite je Generation (A100 600 GB/s, H100/H200 900 GB/s, B200/B300 1,8 TB/s) ggü. PCIe Gen5 x16 mit 128 GB/s bidirektional. https://spheron.network/blog/what-is-nvlink-gpu-interconnect-bandwidth-explained ↩
-
Rackspace, „So You Need Enterprise GPUs" (2026) — H100/H200/B200-Speicher, Bandbreite, NVLink und TDP laut NVIDIA-Datenblättern. https://blog.rackspacecloud.com/blog/2026/01/16/so_you_need_enterprise_gpus_-_a_no-bs_guide_to_h100_h200_and_b200 ↩ ↩2
-
He, Zhao & Cao (ScitiX AI), „SiPipe" (arXiv:2506.22033, Juni 2025) — bis zu 4,5× Throughput ggü. reinem TP in einem Cross-Node-Setup mit 16 H100-GPUs. ↩
-
GPUSmith, „NVIDIA Data Center GPU Pricing: H100 to GB200 Cost Guide" (Juli 2026) — H100 25–40 Tsd. USD, H200 30–40 Tsd. USD pro GPU, B200 Street ~40–45 Tsd. USD. https://gpusmith.com/articles/en/nvidia-data-center-gpu-pricing-guide ↩