Zum Inhalt springen
Kurzer Hinweis: flozi00 TechHub ist ein Solo-Nebenprojekt neben einem Vollzeitjob — persönliche Lernnotizen, keine offiziellen Aussagen. Kritische Schritte selbst prüfen.
← Start

Finde den Guide für deine Frage

Beginne mit der Frage, die du beantworten möchtest. Jeder Leseweg erklärt den Zweck seiner Guides: Grundlagen, Rechner oder vertiefende Analyse.

Wie viel VRAM braucht mein LLM?

Mit dem Speicherbudget beginnen, dann Gewichte, Kontext und Laufzeit-Overhead berechnen. Fine-Tuning braucht ein eigenes Budget.

  1. LLM-VRAM-Bedarf: Gewichte, Quantisierung & KV-Cache

    Das Speicherbudget für Inferenz und seine Annahmen verstehen.

  2. LLM-VRAM-Rechner: GPU-Speicher & Inferenz berechnen

    Modell-Fit für GPU, Präzision und Kontext berechnen.

  3. LLM-Quantisierung: FP8, INT4, GGUF & VRAM-Bedarf

    Gewichtskompression, Qualität und Laufzeitgrenzen unterscheiden.

  4. KV-Cache erklärt: Speicherbedarf, GQA, MQA & MLA

    Speicher für Kontext und gleichzeitige Anfragen bestimmen.

  5. LoRA- und QLoRA-Finetuning: die echte Speicher-Mathematik

    Adapter, Optimizer-Zustände und Aktivierungen für Fine-Tuning planen.

Welche GPU und Vernetzung passen zum Workload?

Modell-Fit und Bandbreite für Inferenzplanung nutzen. Trainingsbenchmarks als Systemergebnisse lesen und von Kaufentscheidungen unterscheiden.

  1. GPU-Kaufberatung für LLM-Inferenz (2026)

    Spezifikationen, Angebote und Workload-Anforderungen vergleichen.

  2. GPU für Qwen3-Inferenz: VRAM, Bandbreite & Modellgröße

    Roofline-Rechnungen auf konkrete Qwen3-GPU-Kombinationen anwenden.

  3. NVIDIA B200 vs GB200: Unterschiede & MLPerf-Benchmarks

    Veröffentlichte B200- und GB200-Trainingsergebnisse fair vergleichen.

  4. NVIDIA NVLink: Bandbreite, NVSwitch & GPU-Topologie

    Verstehen, was eine NVLink-Domäne verbindet.

  5. Scale-Up vs Scale-Out: NVLink und All-Reduce

    Kommunikation innerhalb und zwischen GPU-Servern berechnen.

  6. AMD Instinct vs NVIDIA: Speicher und Inferenz

    AMD- und NVIDIA-Speicherspezifikationen und ihre Grenzen vergleichen.

Wie wähle und betreibe ich eine LLM-Serving-Engine?

Lokales Deployment, Engine-Auswahl, Release-Pflege und Kostenrechnung getrennt betrachten. Jeder Guide beantwortet eine eigene Betriebsfrage.

  1. llama.cpp vs Ollama vs vLLM: Lokale LLMs betreiben

    Zwischen lokalen Runtimes und GPU-Serving wählen.

  2. vLLM vs SGLang: LLM-Serving, Caching & Entscheidung

    vLLM und SGLang für eigene Anfragemuster vergleichen.

  3. LLM-Serving-Engines 2026: Upgrades und Versionen

    Upgrades, Versionsfixierung und Rollback einplanen.

  4. LLM-Inferenz: Durchsatz, GPU-Bandbreite & Roofline-Modell

    Formeln hinter Decode- und Prefill-Grenzen verstehen.

  5. LLM-Inferenz-Ökonomie: Kosten & Cloud-Break-Even

    Self-Hosting-Kosten unter klaren Annahmen mit einer API vergleichen.

Wie dimensioniere und verwalte ich einen KV-Cache?

Vom Speicher pro Token zu Working Sets und Prefix-Wiederverwendung. Dimensionierung, Eviction und Offload lösen unterschiedliche Probleme.

  1. KV-Cache erklärt: Speicherbedarf, GQA, MQA & MLA

    Formel pro Token und Unterschiede der Attention-Layouts lernen.

  2. KV-Cache-Speicherwachstums-Explorer

    Untersuchen, wie wachsender Kontext freien GPU-Speicher belegt.

  3. KV-Cache-Glossar: GQA, MLA, TTFT und Eviction

    Serving-Begriffe und ihre präzisen Definitionen nachschlagen.

  4. KVSET: LLM-Prefix-Cache mit LRU-Traces dimensionieren

    Eine Cache-Kapazitätskurve aus einem LRU-Trace bestimmen.

  5. LLM-Prefix-Caching: LRU-Eviction und ihre Grenzen

    LRU-Eviction für verschiedene Workloads und Kapazitäten bewerten.

  6. Agenten-Inferenz: KV-Datenverkehr und Speichertiers

    Agenten-Working-Sets und Datenverkehr zwischen Speichertiers berechnen.

Was unterscheidet die LLM-Architekturen?

Den Ablauf vom Token zur Ausgabe lernen, dann einzelne veröffentlichte Checkpoints vergleichen. Architektur-Guides erklären Mechanismen und Serving-Grenzen.

  1. Wie LLMs wirklich funktionieren — Eine animierte Tour

    Embeddings, Attention und Sampling in einer Animation nachvollziehen.

  2. Qwen3-Next-80B-A3B: Architektur und Grenzen beim Serving

    Hybride Attention und Sparse Experts von Qwen3-Next untersuchen.

  3. Kimi-K3-Architektur: KDA, MLA und LatentMoE

    Rekurrenz, MLA und LatentMoE-Routing von Kimi K3 lesen.

  4. GLM-5.3-Flash im Detail: KDA, Sparse MLA, mHC und 8-von-288-MoE

    Attention, Residuals und Cache-Formen von GLM-5.3-Flash untersuchen.

  5. Cloudflare Clef: Qwen und Schema-Bewertung

    Clefs Entscheidungsbewertung und sein Design ohne Decode verstehen.

Wie nutze ich NVIDIA-GPUs unter Ubuntu?

Installation und Container-Prüfung von der Diagnose von CUDA-Fehlern trennen. Ein berichteter Workaround ist keine allgemeine Lösung.

  1. NVIDIA-GPU-Container unter Ubuntu 24.04

    Host-Treiber installieren und GPU-Zugriff in Docker prüfen.

  2. NVIDIA-Fehler 802 unter Ubuntu: Diagnose vor nokaslr

    CUDA-Fehler 802 diagnostizieren, bevor nokaslr erwogen wird.

Alle Fachartikel ansehen →