Finde den Guide für deine Frage
Beginne mit der Frage, die du beantworten möchtest. Jeder Leseweg erklärt den Zweck seiner Guides: Grundlagen, Rechner oder vertiefende Analyse.
Wie viel VRAM braucht mein LLM?
Mit dem Speicherbudget beginnen, dann Gewichte, Kontext und Laufzeit-Overhead berechnen. Fine-Tuning braucht ein eigenes Budget.
- LLM-VRAM-Bedarf: Gewichte, Quantisierung & KV-Cache
Das Speicherbudget für Inferenz und seine Annahmen verstehen.
- LLM-VRAM-Rechner: GPU-Speicher & Inferenz berechnen
Modell-Fit für GPU, Präzision und Kontext berechnen.
- LLM-Quantisierung: FP8, INT4, GGUF & VRAM-Bedarf
Gewichtskompression, Qualität und Laufzeitgrenzen unterscheiden.
- KV-Cache erklärt: Speicherbedarf, GQA, MQA & MLA
Speicher für Kontext und gleichzeitige Anfragen bestimmen.
- LoRA- und QLoRA-Finetuning: die echte Speicher-Mathematik
Adapter, Optimizer-Zustände und Aktivierungen für Fine-Tuning planen.
Welche GPU und Vernetzung passen zum Workload?
Modell-Fit und Bandbreite für Inferenzplanung nutzen. Trainingsbenchmarks als Systemergebnisse lesen und von Kaufentscheidungen unterscheiden.
- GPU-Kaufberatung für LLM-Inferenz (2026)
Spezifikationen, Angebote und Workload-Anforderungen vergleichen.
- GPU für Qwen3-Inferenz: VRAM, Bandbreite & Modellgröße
Roofline-Rechnungen auf konkrete Qwen3-GPU-Kombinationen anwenden.
- NVIDIA B200 vs GB200: Unterschiede & MLPerf-Benchmarks
Veröffentlichte B200- und GB200-Trainingsergebnisse fair vergleichen.
- NVIDIA NVLink: Bandbreite, NVSwitch & GPU-Topologie
Verstehen, was eine NVLink-Domäne verbindet.
- Scale-Up vs Scale-Out: NVLink und All-Reduce
Kommunikation innerhalb und zwischen GPU-Servern berechnen.
- AMD Instinct vs NVIDIA: Speicher und Inferenz
AMD- und NVIDIA-Speicherspezifikationen und ihre Grenzen vergleichen.
Wie wähle und betreibe ich eine LLM-Serving-Engine?
Lokales Deployment, Engine-Auswahl, Release-Pflege und Kostenrechnung getrennt betrachten. Jeder Guide beantwortet eine eigene Betriebsfrage.
- llama.cpp vs Ollama vs vLLM: Lokale LLMs betreiben
Zwischen lokalen Runtimes und GPU-Serving wählen.
- vLLM vs SGLang: LLM-Serving, Caching & Entscheidung
vLLM und SGLang für eigene Anfragemuster vergleichen.
- LLM-Serving-Engines 2026: Upgrades und Versionen
Upgrades, Versionsfixierung und Rollback einplanen.
- LLM-Inferenz: Durchsatz, GPU-Bandbreite & Roofline-Modell
Formeln hinter Decode- und Prefill-Grenzen verstehen.
- LLM-Inferenz-Ökonomie: Kosten & Cloud-Break-Even
Self-Hosting-Kosten unter klaren Annahmen mit einer API vergleichen.
Wie dimensioniere und verwalte ich einen KV-Cache?
Vom Speicher pro Token zu Working Sets und Prefix-Wiederverwendung. Dimensionierung, Eviction und Offload lösen unterschiedliche Probleme.
- KV-Cache erklärt: Speicherbedarf, GQA, MQA & MLA
Formel pro Token und Unterschiede der Attention-Layouts lernen.
- KV-Cache-Speicherwachstums-Explorer
Untersuchen, wie wachsender Kontext freien GPU-Speicher belegt.
- KV-Cache-Glossar: GQA, MLA, TTFT und Eviction
Serving-Begriffe und ihre präzisen Definitionen nachschlagen.
- KVSET: LLM-Prefix-Cache mit LRU-Traces dimensionieren
Eine Cache-Kapazitätskurve aus einem LRU-Trace bestimmen.
- LLM-Prefix-Caching: LRU-Eviction und ihre Grenzen
LRU-Eviction für verschiedene Workloads und Kapazitäten bewerten.
- Agenten-Inferenz: KV-Datenverkehr und Speichertiers
Agenten-Working-Sets und Datenverkehr zwischen Speichertiers berechnen.
Was unterscheidet die LLM-Architekturen?
Den Ablauf vom Token zur Ausgabe lernen, dann einzelne veröffentlichte Checkpoints vergleichen. Architektur-Guides erklären Mechanismen und Serving-Grenzen.
- Wie LLMs wirklich funktionieren — Eine animierte Tour
Embeddings, Attention und Sampling in einer Animation nachvollziehen.
- Qwen3-Next-80B-A3B: Architektur und Grenzen beim Serving
Hybride Attention und Sparse Experts von Qwen3-Next untersuchen.
- Kimi-K3-Architektur: KDA, MLA und LatentMoE
Rekurrenz, MLA und LatentMoE-Routing von Kimi K3 lesen.
- GLM-5.3-Flash im Detail: KDA, Sparse MLA, mHC und 8-von-288-MoE
Attention, Residuals und Cache-Formen von GLM-5.3-Flash untersuchen.
- Cloudflare Clef: Qwen und Schema-Bewertung
Clefs Entscheidungsbewertung und sein Design ohne Decode verstehen.
Wie nutze ich NVIDIA-GPUs unter Ubuntu?
Installation und Container-Prüfung von der Diagnose von CUDA-Fehlern trennen. Ein berichteter Workaround ist keine allgemeine Lösung.
- NVIDIA-GPU-Container unter Ubuntu 24.04
Host-Treiber installieren und GPU-Zugriff in Docker prüfen.
- NVIDIA-Fehler 802 unter Ubuntu: Diagnose vor nokaslr
CUDA-Fehler 802 diagnostizieren, bevor nokaslr erwogen wird.