Zum Inhalt springen
Kurzer Hinweis: flozi00 TechHub ist ein Solo-Nebenprojekt neben einem Vollzeitjob — persönliche Lernnotizen, keine offiziellen Aussagen. Kritische Schritte selbst prüfen.

Die richtige GPU für Qwen3-Inferenz auswählen

Praxis-Guide für LLM-Inferenz auf GPUs: Roofline-Denken, Bandbreite vs. Rechenwerk, Präzision und Auslastung pro Modellgröße.

6 Min. Lesezeitflozi00
aidatacentergpudeep-learninghardwareguide

Welche GPU passt zur Qwen3-Inferenz?

Prüfe zuerst, ob Gewichte, KV-Cache und Laufzeit-Allokationen in den GPU-Speicher passen; vergleiche danach Bandbreite und Rechenleistung für Batchgröße und Kontext. Dieser Guide wendet die Rechnung auf RTX PRO 6000, H200 und DGX Station an. Seine Tokenraten sind theoretische Obergrenzen, keine gemessene Serving-Leistung.

Der VRAM-Rechner hilft bei der Speicherschätzung, der GPU-Kaufguide bei Spezifikationen und Kaufkriterien. Dieses Playbook erklärt die Hardware-Modell-Rechnung; der vLLM-vs-SGLang-Guide behandelt die Engine-Auswahl.

Diese Übersicht erweitert die Berechnungen aus LLM-Inferenz-Mathematik: Theorie trifft Hardware und wendet sie auf konkrete Hardware- und Modellkombinationen an. Ziel ist es, klar zu machen, wann die NVIDIA RTX PRO 6000, H200 oder die seit Juni 2026 ausgelieferte DGX Station die beste Effizienz für Qwen3-Workloads mit 4B bis 32B aktiven Parametern liefert.

Wichtig: Jede Zahl in diesem Leitfaden stellt eine theoretische Obergrenze dar, die aus Herstellerangaben und vereinfachter Roofline-Mathematik abgeleitet wurde. In der Praxis liegen die Werte oft niedriger, da die Kernels nicht perfekt sind, die Host↔Device-Pipelines Reibung verursachen und GPUs selten über einen gesamten Decode-Durchlauf hinweg 100% Effizienz erreichen.

Zusammenfassung: Die 60-Sekunden ops:byte-Checkliste

  1. Berechnen Sie das ops:byte-Verhältnis der GPU (peak FLOPS ÷ memory bandwidth).
  2. Schätzen Sie die arithmetische Intensität des gesamten Vorgangs als FLOPs geteilt durch bewegte Bytes. d_head ÷ 2 nur für Attention kann keinen vollständigen Transformer-Durchlauf klassifizieren.
  3. Vergleichen Sie diese Intensität mit dem GPU-Verhältnis. Darunter ist die vereinfachte Roofline speichergebunden; darüber kann Rechenleistung begrenzen.
  4. Bei Dense Decode mit kleinem Batch ist Gewicht-Bytes ÷ Speicherbandbreite eine untere Zeitgrenze pro Schritt, sofern Gewichte und KV hineinpassen. KV-Lesevorgänge und weitere Arbeit erhöhen die Dauer.

GPU-Leistungsübersicht

NVIDIA RTX PRO 6000 Blackwell Workstation Edition

  • 96 GB GDDR7 ECC VRAM, gespeist durch 1.792 GB/s Bandbreite und 503,8 TFLOPS FP16/BF16 Tensor (dicht) Rechenleistung — das ist das Verhältnis, das für Inferenz zählt — was zu einem ops:byte-Verhältnis von nahezu 281 führt. (Die ~125 TFLOPS nicht-Tensor-FP32-Shader-Rate würden irreführend ~70 nahelegen; siehe Fußnote im Inferenz-Mathe-Leitfaden.)
  • Die maximale Board-Leistung von 600 W ermöglicht den Einsatz direkt am Arbeitsplatz, wo Geräuschentwicklung und Temperatur wichtig sind, aber die Rack-Leistung begrenzt ist.
  • Ideal, wenn Sie lokale Feinabstimmung oder multimodales Prototyping (Vision, Audio) mit bis zu ~64 GB an Gewichten sowie einem nützlichen KV-Cache-Budget benötigen.1

NVIDIA H200 Tensor Core GPU (SXM + NVL)

  • Erster Hopper-basierter Accelerator mit 141 GB HBM3e und 4,8 TB/s Speicherbandbreite; BF16 Tensor-Leistung erreicht 989 TFLOPS dicht (1.979 TFLOPS mit Sparsity), sodass das ops:byte-Verhältnis auf etwa 206 (dicht) / 412 (sparse) steigt.
  • Wird mit Hardware-MIG-Slicing (7 Instanzen) und optionalen NVL-Konfigurationen für luftgekühlte Racks ausgeliefert.
  • Am besten geeignet für 14B+ dichte Modelle oder MoE-Deployments, bei denen sowohl Kapazität als auch Streaming-Bandbreite die Kosten dominieren.2

NVIDIA DGX Station (Grace Blackwell Ultra)

  • Desktop-System mit einer Blackwell-Ultra-GPU (252 GB HBM3e @ 7,1 TB/s), einer Grace-CPU mit 72 Kernen und 496 GB LPDDR5X (396 GB/s). Die zusammen 748 GB sind kohärent adressierbar; nur 252 GB bieten HBM-Bandbreite.3
  • NVLink-C2C verbindet CPU und GPU mit aggregiert 900 GB/s. Daten im Grace-Speicher bleiben durch dessen Bandbreite und das Zugriffsmuster begrenzt; beachten Sie das beim Auslagern von Gewichten oder Indizes.
  • Das Datenblatt bewertet die GPU mit 20 PFLOPS FP4 / 5 PFLOPS BF16 (sparse; 15 / 2,5 dicht) — das gleiche Blackwell-Ultra-Silizium wie in HGX B300 Servern, deren 8-GPU-Basisplatine NVIDIA mit 18 PFLOPS BF16 dicht bewertet (~2,25 PFLOPS pro GPU).34
  • Richtet sich an Multi-User-Labore, die lokale Autonomie für iteratives Training, MoE-Routing-Experimente und Agenten-Stacks benötigen, bevor diese an einen Cluster übergeben werden.

Qwen3 Modell-Footprints (Batchgröße 1, BF16)

Jedes Modell verwendet die GQA-bewusste KV-Cache-Formel (2 * layers * num_kv_heads * head_dim * 2 bytes; alle Qwen3-Modelle unten nutzen 8 KV-Heads mit head_dim 128).

ModelActive paramsHidden size / layersWeights (GB)KV cache per token (MB)Notes
Qwen3-4B-Instruct~4B2,560 / 36~80.15Sliding-window ready; great for CPU offload experiments.5
Qwen3-VL-8B-Instruct~8B4,096 / 36~160.15Vision-language encoder adds ~1152-dim vision tower.6
Qwen3-14B~14B5,120 / 40~280.1640-layer stack with 1M rope theta for 40k context.7
Qwen3-32B~32.8B5,120 / 64~65.50.27Dichtes Decoder-Modell mit 64 Ebenen; 0,27 GB sind KV je 1k Tokens bei bf16.8

Passende Szenarien

1. Workstation-Prototyping (RTX PRO 6000)

  • Empfohlene Modelle: Qwen3-4B, Qwen3-VL-8B.
  • Warum: Ungefähre bf16-Gewichtsdaten von 8–16 GB lassen auf einer 96-GB-Karte viel Platz. Für den konkreten Checkpoint müssen aber Vision-Gewichte, KV-Cache und Runtime-Belegungen hinzugerechnet werden.
  • Durchsatz: 1,792 TB/s ÷ Gewicht-Bytes ergibt bei Batch 1 reine Gewichts-Obergrenzen von ~224 tok/s für 8 GB beziehungsweise ~112 tok/s für 16 GB. Das sind keine erwarteten Serving-Raten.
  • Tipp: Testen Sie größere Batches gegen Ihr Latenzziel und das verfügbare KV-Budget; Sidecar-Prozesse benötigen ebenfalls Speicher und Rechenleistung.

2. Enterprise-Copiloten (H200 SXM)

  • Empfohlene Modelle: Qwen3-14B und Qwen3-32B, beide dicht.
  • Warum: 141 GB HBM3e fassen die ~65,5 GB bf16-Gewichte von Qwen3-32B und lassen ~75,5 GB vor KV- und Runtime-Reserve. Bei 4,8 TB/s liegen reine Gewichts-Obergrenzen bei ~170 tok/s für ein ungefähr 28 GB großes 14B-Modell und ~73 tok/s für Qwen3-32B. Reale Raten können niedriger sein; die wirksame Grenze ändert sich mit Batch und Kontext.
  • Tipp: MIG teilt Speicher und Rechenleistung unter Mandanten auf. Wählen Sie Instanzen, in die das jeweilige Modell passt, und messen Sie den resultierenden Durchsatz.

3. Labormaßstab-Supercomputer (DGX Station)

  • Empfohlene Modelle: Qwen3-Varianten und zusätzliche Tools, deren gemeinsam aktiver GPU-Arbeitssatz in 252 GB HBM passt.
  • Warum: Die 496 GB Grace-LPDDR5X können CPU-seitige Datensätze halten. Dorthin ausgelagerte Gewichte oder KV arbeiten jedoch nicht mit 7,1 TB/s HBM-Bandbreite. Bilanzieren Sie beide Speicherebenen und die 900-GB/s-C2C-Verbindung getrennt.
  • Durchsatz: Für ~65,5 GB bf16-Gewichte von Qwen3-32B ergibt 7,1 TB/s ÷ 65,5 GB ≈ 108 tok/s eine reine Gewichts-Obergrenze bei Batch 1, vor KV-, Kommunikations- oder Rechenkosten.4
  • Tipp: MIG ermöglicht bis zu sieben Instanzen; reservierte Slices fehlen dem Hauptmodell. Prüfen Sie, ob die Aufteilung Ihrem Workload hilft.

Schnelle Zuordnungsmatrix

ScenarioModelGPUEst. tokens/s (batch 1)Primary bottleneckNotes
Edge copilotsQwen3-4BRTX PRO 6000~220Memory BWPlenty of VRAM left for RAG embeddings.
Vision agent demosQwen3-VL-8BRTX PRO 6000~110Memory BWVision tower benefits from 96 GB VRAM for image batches.
Customer support copilotsQwen3-14BH200~170Memory BWMIG lets you mirror-prod topology in dev.
Technical assistant / codegenQwen3-32BH200~73Weight-read floorEine H200 kann mehrere Sequenzen mit ~2k Kontext halten; die reale Batch-Grenze hängt von KV und Runtime ab.
Multi-agent sandboxQwen3-32B + toolsDGX Station~108Weight-read floorGPU-aktive Gewichte und KV in 252 GB HBM halten; Grace-RAM ist eine langsamere Speicherebene.

Verwandte Artikel

Interaktiver Rechner

Verwenden Sie den LLM-Inferenz-Planner, um Kontextfenster, Batch-Größen und Präzisionsannahmen für jedes GPU-Profil einem Stresstest zu unterziehen — er berechnet VRAM-Fit, Decode-Durchsatz, Prefill-Latenz und die Break-Even-Batch B* live für jedes Modell und jede GPU in diesem Playbook.

Hinweis: Die Token pro Sekunde erreichen ein Plateau, sobald die Auslastung die Compute-Grenze erreicht – der Rechner vergleicht beide Limits und meldet das strengere.

Footnotes

  1. NVIDIA RTX PRO 6000 Blackwell Workstation Edition specifications, NVIDIA. ↩

  2. NVIDIA H200 Tensor Core GPU specifications, NVIDIA. ↩

  3. NVIDIA DGX Station (Grace Blackwell Ultra) specifications, NVIDIA. ↩ ↩2

  4. NVIDIA HGX Platform and Blackwell Ultra specifications (HGX B300), NVIDIA. ↩ ↩2

  5. Qwen/Qwen3-4B-Instruct-2507 model card, Hugging Face. ↩

  6. Qwen/Qwen3-VL-8B-Instruct model card, Hugging Face. ↩

  7. Qwen/Qwen3-14B model card, Hugging Face. ↩

  8. Qwen/Qwen3-32B model card, Hugging Face. ↩