Themen & Tags
Alle Artikel des TechHub, nach Tag gruppiert. Klick dich durch die Themen.
ai61 Artikel
- Über Florian Zimmermeister
- Qwen3-Next-80B-A3B: Architektur und Grenzen beim Serving
- TypeSafe Jev: Was öffentlich belegt ist
- Agent-Fleet-Tokenökonomie ist Cache-Ökonomie: Der 60-fache Dollar-Spread im Detail zerlegt
- Ihre Agenten-Flotte ist ein Storage-Array: Die KV-Cache-Tiering-Mathematik hinter agentischer Inferenz
- EU-KI-Verordnung Art. 50: Kennzeichnung und technische Grenzen
- EU AI Act nach dem Digital Omnibus: Was sich verschoben hat
- EU AI Act und DSGVO für selbst gehostete LLMs
- Parakeet TDT vs. Encoder-Decoder-ASR: Abwägungen für den Einsatz
- Random Attention vs. scorebasierte KV-Eviction auf Reasoning-Traces
- BOOST: Gleichzeitiger Zugriff auf Host-Speicher und HBM beim LLM-Decode
- Der Cache-Read-Preiskrieg des Septembers 2026, der nicht dreiseitig war
- CXL-SSDs für LLM-Prefix-Caching: Byte-Adressierbarkeit bringt ohne Chunk-Bewusstsein nichts
- CXMT bei 10 % DRAM-Umsatzanteil: Was die Zahlen zeigen
- DeepSeek V4 Pro selbst hosten: die echte Rechnung
- DeepSeek-V4.1-Flash: Was die berichteten 890 Byte KV-Cache pro Token umfassen
- Disaggregierte Quantisierung: Prefill- und Decode-Kosten auf zwei Formate verteilen
- FlashLoop, oder: Wer einen Transformer loopt, vervierfacht die Rechnung — und wirft das Meiste wieder weg
- GPU-Kaufberatung für LLM-Inferenz (2026)
- Die richtige GPU für Qwen3-Inferenz auswählen
- Gumbel-Watermarking ist endlich produktiv — und die Compliance-Asymmetrie, die niemand eingepreist hat
- HBF als dritte KV-Tier: 24x Sessions oder 5x schlechtere Latenz — das Medium ist in Ordnung, die Placement-Politik entscheidet
- HBM-Kapazität und die Kosten des KV-Caches
- Wie LLMs wirklich funktionieren — Eine animierte Tour
- KernelOPTs agentische Kernel-Suche: Die Verifikationskaskade funktioniert, der Speedup verblasst mit der Schwierigkeit
- Deutschlands KI-MIG: Wer überwacht die KI-Verordnung?
- Kimi K3 im Detail: Delta Attention, Attention über Schichten und LatentMoE
- KREX: Kernel-Benchmarking auf geteilten GPUs, ohne die Suche des Agenten zu korrumpieren
- Der KV-Cache: Exakte Speicher-Mathematik, GQA vs MQA vs MLA und PagedAttention
- KV-Cache-Glossar: jeder Begriff des Serving-Stacks
- Wer bezahlt den KV-Cache? Messregeln sind getarnte Preisentscheidungen
- Risikokontrollierte KV-Eviction: Zuverlässigkeitsvertrag und Full-KV-Fallback
- KITE: Das Modell skalieren, die KV-Rechnung einfrieren — welche Prefill-Invariante arXiv:2609.27294 wirklich beweist (und was nicht)
- KV-Cache-Tensordekomposition: Vollrangige Kopf- und Layer-Modi in zwei Modellen
- KVSET: LRU-Stack-Distanzen für das Sizing von LLM-Prefix-Caches
- Leaderboard-Margen gegen verborgene Modellauswahl: Welche Gewinne überleben k geheime Varianten?
- llama.cpp / Ollama vs vLLM: Was, wann und warum
- LLM-Inferenz-Mathematik: Theorie trifft Hardware
- LLM-VRAM-Bedarf: Ein mathematischer Deep Dive
- LoRA- und QLoRA-Finetuning: die echte Speicher-Mathematik
- NVIDIA Groq 3 LPX: SRAM-Decode, Kapazität und Benchmark-Grenzen
- NVIDIA will Hugging Face übernehmen: Die Dependency-Rechnung hinter den 12,93 Mrd. $
- Greedy Decoding ist nicht präzisionsinvariant: BF16-vs-FP16-Flips, Margin-Gating und die Kernel-Reihenfolgen-Achse
- LLM-Prefix-Caching: Wo LRU stark ist und wo es zurückfällt
- PTQ-Konfigurationsbewertung: Den Quantisierungspreis vorhalten, bevor das Modell gebaut wird
- LLM-Quantisierung: Bit-Layouts, Block-Skalen und die VRAM-Mathematik
- Quantisierung kann Retrieval-Ergebnisse trotz stabiler Klassifikationsgenauigkeit ändern
- Qwen3.8-Flash-Next im Detail: Gated DeltaNet, Sparse Attention und N-Gram-Speicher
- RAG-Retrieval-Mathematik: Embedding-Speicher, Vektorindex-Größe und das Latenzbudget, das niemand rechnet
- Expert Parallelism: Das Dilemma des Routers
- Pipeline Parallelism: Daten flussaufwärts pumpen
- Tensor Parallelism: Silizium zerschneiden
- Die Churn-Steuer 2026 für Serving-Engines: vLLM 0.29, SGLang 0.5.19 und TensorRT-LLM ohne TensorRT
- Snapdragon X2 unter Linux: Die 80-TOPS-NPU ist nicht die Story — 228 GB/s sind es
- Uncheatable Eval: LLMs benotet nach den Bits, die sie brauchen
- UNISON und die pausierte Flotte: Warum Agenten-KV-Traffic jede Cache-Policy bricht
- vLLM vs SGLang: Architektur, Overhead und die Frage, wann man was wählt
- Meine Reise: Besessenheit, Scheitern und KI als Anker
- KV-Cache-Speicherwachstums-Explorer
- LLM-Inferenzrechner & Break-Even-Analyse
- LLM-Inferenz-Ökonomie: Kosten & Cloud-Break-Even
machine-learning42 Artikel
- Qwen3-Next-80B-A3B: Architektur und Grenzen beim Serving
- TypeSafe Jev: Was öffentlich belegt ist
- Agent-Fleet-Tokenökonomie ist Cache-Ökonomie: Der 60-fache Dollar-Spread im Detail zerlegt
- Ihre Agenten-Flotte ist ein Storage-Array: Die KV-Cache-Tiering-Mathematik hinter agentischer Inferenz
- Parakeet TDT vs. Encoder-Decoder-ASR: Abwägungen für den Einsatz
- Random Attention vs. scorebasierte KV-Eviction auf Reasoning-Traces
- BOOST: Gleichzeitiger Zugriff auf Host-Speicher und HBM beim LLM-Decode
- Der Cache-Read-Preiskrieg des Septembers 2026, der nicht dreiseitig war
- CXL-SSDs für LLM-Prefix-Caching: Byte-Adressierbarkeit bringt ohne Chunk-Bewusstsein nichts
- DeepSeek V4 Pro selbst hosten: die echte Rechnung
- DeepSeek-V4.1-Flash: Was die berichteten 890 Byte KV-Cache pro Token umfassen
- Disaggregierte Quantisierung: Prefill- und Decode-Kosten auf zwei Formate verteilen
- FlashLoop, oder: Wer einen Transformer loopt, vervierfacht die Rechnung — und wirft das Meiste wieder weg
- Gumbel-Watermarking ist endlich produktiv — und die Compliance-Asymmetrie, die niemand eingepreist hat
- HBF als dritte KV-Tier: 24x Sessions oder 5x schlechtere Latenz — das Medium ist in Ordnung, die Placement-Politik entscheidet
- HBM-Kapazität und die Kosten des KV-Caches
- KernelOPTs agentische Kernel-Suche: Die Verifikationskaskade funktioniert, der Speedup verblasst mit der Schwierigkeit
- KREX: Kernel-Benchmarking auf geteilten GPUs, ohne die Suche des Agenten zu korrumpieren
- Der KV-Cache: Exakte Speicher-Mathematik, GQA vs MQA vs MLA und PagedAttention
- KV-Cache-Glossar: jeder Begriff des Serving-Stacks
- Wer bezahlt den KV-Cache? Messregeln sind getarnte Preisentscheidungen
- Risikokontrollierte KV-Eviction: Zuverlässigkeitsvertrag und Full-KV-Fallback
- KITE: Das Modell skalieren, die KV-Rechnung einfrieren — welche Prefill-Invariante arXiv:2609.27294 wirklich beweist (und was nicht)
- KV-Cache-Tensordekomposition: Vollrangige Kopf- und Layer-Modi in zwei Modellen
- KVSET: LRU-Stack-Distanzen für das Sizing von LLM-Prefix-Caches
- Leaderboard-Margen gegen verborgene Modellauswahl: Welche Gewinne überleben k geheime Varianten?
- llama.cpp / Ollama vs vLLM: Was, wann und warum
- LLM-Inferenz-Mathematik: Theorie trifft Hardware
- LLM-VRAM-Bedarf: Ein mathematischer Deep Dive
- LoRA- und QLoRA-Finetuning: die echte Speicher-Mathematik
- NVIDIA Groq 3 LPX: SRAM-Decode, Kapazität und Benchmark-Grenzen
- NVIDIA will Hugging Face übernehmen: Die Dependency-Rechnung hinter den 12,93 Mrd. $
- Greedy Decoding ist nicht präzisionsinvariant: BF16-vs-FP16-Flips, Margin-Gating und die Kernel-Reihenfolgen-Achse
- LLM-Prefix-Caching: Wo LRU stark ist und wo es zurückfällt
- PTQ-Konfigurationsbewertung: Den Quantisierungspreis vorhalten, bevor das Modell gebaut wird
- LLM-Quantisierung: Bit-Layouts, Block-Skalen und die VRAM-Mathematik
- Quantisierung kann Retrieval-Ergebnisse trotz stabiler Klassifikationsgenauigkeit ändern
- RAG-Retrieval-Mathematik: Embedding-Speicher, Vektorindex-Größe und das Latenzbudget, das niemand rechnet
- Die Churn-Steuer 2026 für Serving-Engines: vLLM 0.29, SGLang 0.5.19 und TensorRT-LLM ohne TensorRT
- Uncheatable Eval: LLMs benotet nach den Bits, die sie brauchen
- UNISON und die pausierte Flotte: Warum Agenten-KV-Traffic jede Cache-Policy bricht
- vLLM vs SGLang: Architektur, Overhead und die Frage, wann man was wählt
gpu33 Artikel
- Ihre Agenten-Flotte ist ein Storage-Array: Die KV-Cache-Tiering-Mathematik hinter agentischer Inferenz
- Random Attention vs. scorebasierte KV-Eviction auf Reasoning-Traces
- BOOST: Gleichzeitiger Zugriff auf Host-Speicher und HBM beim LLM-Decode
- DeepSeek V4 Pro selbst hosten: die echte Rechnung
- GPU-Kaufberatung für LLM-Inferenz (2026)
- Die richtige GPU für Qwen3-Inferenz auswählen
- HBF als dritte KV-Tier: 24x Sessions oder 5x schlechtere Latenz — das Medium ist in Ordnung, die Placement-Politik entscheidet
- HBM-Kapazität und die Kosten des KV-Caches
- KernelOPTs agentische Kernel-Suche: Die Verifikationskaskade funktioniert, der Speedup verblasst mit der Schwierigkeit
- KREX: Kernel-Benchmarking auf geteilten GPUs, ohne die Suche des Agenten zu korrumpieren
- Der KV-Cache: Exakte Speicher-Mathematik, GQA vs MQA vs MLA und PagedAttention
- KV-Cache-Glossar: jeder Begriff des Serving-Stacks
- llama.cpp / Ollama vs vLLM: Was, wann und warum
- LLM-Inferenz-Mathematik: Theorie trifft Hardware
- LLM-VRAM-Bedarf: Ein mathematischer Deep Dive
- LoRA- und QLoRA-Finetuning: die echte Speicher-Mathematik
- NVIDIA Groq 3 LPX: SRAM-Decode, Kapazität und Benchmark-Grenzen
- NVIDIA will Hugging Face übernehmen: Die Dependency-Rechnung hinter den 12,93 Mrd. $
- LLM-Quantisierung: Bit-Layouts, Block-Skalen und die VRAM-Mathematik
- RAG-Retrieval-Mathematik: Embedding-Speicher, Vektorindex-Größe und das Latenzbudget, das niemand rechnet
- Expert Parallelism: Das Dilemma des Routers
- Pipeline Parallelism: Daten flussaufwärts pumpen
- Tensor Parallelism: Silizium zerschneiden
- Die Churn-Steuer 2026 für Serving-Engines: vLLM 0.29, SGLang 0.5.19 und TensorRT-LLM ohne TensorRT
- UNISON und die pausierte Flotte: Warum Agenten-KV-Traffic jede Cache-Policy bricht
- vLLM vs SGLang: Architektur, Overhead und die Frage, wann man was wählt
- NVIDIA-GPU-Container unter Ubuntu 24.04
- AMD MI300X/MI350/MI400: Mehr Speicher, aber gewinnt die Mathematik? — Eine kritische Silizium-Analyse von AMD Instinct vs NVIDIA
- NVIDIA B200 vs GB200: Was MLPerf Training tatsächlich zeigt
- NVIDIA NVLink: Generationen, Domänen und Prüfung
- KV-Cache-Speicherwachstums-Explorer
- LLM-Inferenzrechner & Break-Even-Analyse
- LLM-Inferenz-Ökonomie: Kosten & Cloud-Break-Even
inference31 Artikel
- Agent-Fleet-Tokenökonomie ist Cache-Ökonomie: Der 60-fache Dollar-Spread im Detail zerlegt
- Ihre Agenten-Flotte ist ein Storage-Array: Die KV-Cache-Tiering-Mathematik hinter agentischer Inferenz
- Random Attention vs. scorebasierte KV-Eviction auf Reasoning-Traces
- BOOST: Gleichzeitiger Zugriff auf Host-Speicher und HBM beim LLM-Decode
- Der Cache-Read-Preiskrieg des Septembers 2026, der nicht dreiseitig war
- CXL-SSDs für LLM-Prefix-Caching: Byte-Adressierbarkeit bringt ohne Chunk-Bewusstsein nichts
- DeepSeek-V4.1-Flash: Was die berichteten 890 Byte KV-Cache pro Token umfassen
- Disaggregierte Quantisierung: Prefill- und Decode-Kosten auf zwei Formate verteilen
- FlashLoop, oder: Wer einen Transformer loopt, vervierfacht die Rechnung — und wirft das Meiste wieder weg
- HBF als dritte KV-Tier: 24x Sessions oder 5x schlechtere Latenz — das Medium ist in Ordnung, die Placement-Politik entscheidet
- HBM-Kapazität und die Kosten des KV-Caches
- Kimi K3 im Detail: Delta Attention, Attention über Schichten und LatentMoE
- KV-Cache-Glossar: jeder Begriff des Serving-Stacks
- Wer bezahlt den KV-Cache? Messregeln sind getarnte Preisentscheidungen
- Risikokontrollierte KV-Eviction: Zuverlässigkeitsvertrag und Full-KV-Fallback
- KITE: Das Modell skalieren, die KV-Rechnung einfrieren — welche Prefill-Invariante arXiv:2609.27294 wirklich beweist (und was nicht)
- KV-Cache-Tensordekomposition: Vollrangige Kopf- und Layer-Modi in zwei Modellen
- KVSET: LRU-Stack-Distanzen für das Sizing von LLM-Prefix-Caches
- NVIDIA Groq 3 LPX: SRAM-Decode, Kapazität und Benchmark-Grenzen
- Greedy Decoding ist nicht präzisionsinvariant: BF16-vs-FP16-Flips, Margin-Gating und die Kernel-Reihenfolgen-Achse
- LLM-Prefix-Caching: Wo LRU stark ist und wo es zurückfällt
- PTQ-Konfigurationsbewertung: Den Quantisierungspreis vorhalten, bevor das Modell gebaut wird
- Quantisierung kann Retrieval-Ergebnisse trotz stabiler Klassifikationsgenauigkeit ändern
- Qwen3.8-Flash-Next im Detail: Gated DeltaNet, Sparse Attention und N-Gram-Speicher
- UNISON und die pausierte Flotte: Warum Agenten-KV-Traffic jede Cache-Policy bricht
- AMDs MI455X-Behauptung von 34-fachem Durchsatz: Was die Quellen belegen
- AMD MI300X/MI350/MI400: Mehr Speicher, aber gewinnt die Mathematik? — Eine kritische Silizium-Analyse von AMD Instinct vs NVIDIA
- MLPerf Inference 2026: Was Ergebnisse über Hardware und Software aussagen
- KV-Cache-Speicherwachstums-Explorer
- LLM-Inferenzrechner & Break-Even-Analyse
- LLM-Inferenz-Ökonomie: Kosten & Cloud-Break-Even
llm25 Artikel
- Qwen3-Next-80B-A3B: Architektur und Grenzen beim Serving
- Agent-Fleet-Tokenökonomie ist Cache-Ökonomie: Der 60-fache Dollar-Spread im Detail zerlegt
- Der Cache-Read-Preiskrieg des Septembers 2026, der nicht dreiseitig war
- CXL-SSDs für LLM-Prefix-Caching: Byte-Adressierbarkeit bringt ohne Chunk-Bewusstsein nichts
- DeepSeek-V4.1-Flash: Was die berichteten 890 Byte KV-Cache pro Token umfassen
- Disaggregierte Quantisierung: Prefill- und Decode-Kosten auf zwei Formate verteilen
- FlashLoop, oder: Wer einen Transformer loopt, vervierfacht die Rechnung — und wirft das Meiste wieder weg
- Gumbel-Watermarking ist endlich produktiv — und die Compliance-Asymmetrie, die niemand eingepreist hat
- Wie LLMs wirklich funktionieren — Eine animierte Tour
- KernelOPTs agentische Kernel-Suche: Die Verifikationskaskade funktioniert, der Speedup verblasst mit der Schwierigkeit
- Kimi K3 im Detail: Delta Attention, Attention über Schichten und LatentMoE
- KREX: Kernel-Benchmarking auf geteilten GPUs, ohne die Suche des Agenten zu korrumpieren
- Wer bezahlt den KV-Cache? Messregeln sind getarnte Preisentscheidungen
- Risikokontrollierte KV-Eviction: Zuverlässigkeitsvertrag und Full-KV-Fallback
- KITE: Das Modell skalieren, die KV-Rechnung einfrieren — welche Prefill-Invariante arXiv:2609.27294 wirklich beweist (und was nicht)
- KV-Cache-Tensordekomposition: Vollrangige Kopf- und Layer-Modi in zwei Modellen
- KVSET: LRU-Stack-Distanzen für das Sizing von LLM-Prefix-Caches
- Leaderboard-Margen gegen verborgene Modellauswahl: Welche Gewinne überleben k geheime Varianten?
- Greedy Decoding ist nicht präzisionsinvariant: BF16-vs-FP16-Flips, Margin-Gating und die Kernel-Reihenfolgen-Achse
- LLM-Prefix-Caching: Wo LRU stark ist und wo es zurückfällt
- PTQ-Konfigurationsbewertung: Den Quantisierungspreis vorhalten, bevor das Modell gebaut wird
- Quantisierung kann Retrieval-Ergebnisse trotz stabiler Klassifikationsgenauigkeit ändern
- Qwen3.8-Flash-Next im Detail: Gated DeltaNet, Sparse Attention und N-Gram-Speicher
- Uncheatable Eval: LLMs benotet nach den Bits, die sie brauchen
- Scale-up vs. Scale-out: Netzwerkbandbreite und Kollektivoperationen
hardware18 Artikel
- BOOST: Gleichzeitiger Zugriff auf Host-Speicher und HBM beim LLM-Decode
- CXL-SSDs für LLM-Prefix-Caching: Byte-Adressierbarkeit bringt ohne Chunk-Bewusstsein nichts
- CXMT bei 10 % DRAM-Umsatzanteil: Was die Zahlen zeigen
- GPU-Kaufberatung für LLM-Inferenz (2026)
- Die richtige GPU für Qwen3-Inferenz auswählen
- HBF als dritte KV-Tier: 24x Sessions oder 5x schlechtere Latenz — das Medium ist in Ordnung, die Placement-Politik entscheidet
- HBM-Kapazität und die Kosten des KV-Caches
- LLM-Inferenz-Mathematik: Theorie trifft Hardware
- NVIDIA Groq 3 LPX: SRAM-Decode, Kapazität und Benchmark-Grenzen
- LLM-Quantisierung: Bit-Layouts, Block-Skalen und die VRAM-Mathematik
- Expert Parallelism: Das Dilemma des Routers
- Pipeline Parallelism: Daten flussaufwärts pumpen
- Tensor Parallelism: Silizium zerschneiden
- Snapdragon X2 unter Linux: Die 80-TOPS-NPU ist nicht die Story — 228 GB/s sind es
- AMDs MI455X-Behauptung von 34-fachem Durchsatz: Was die Quellen belegen
- AMD MI300X/MI350/MI400: Mehr Speicher, aber gewinnt die Mathematik? — Eine kritische Silizium-Analyse von AMD Instinct vs NVIDIA
- NVIDIA NVLink: Generationen, Domänen und Prüfung
- Scale-up vs. Scale-out: Netzwerkbandbreite und Kollektivoperationen
deep-learning16 Artikel
- Ihre Agenten-Flotte ist ein Storage-Array: Die KV-Cache-Tiering-Mathematik hinter agentischer Inferenz
- Die richtige GPU für Qwen3-Inferenz auswählen
- Wie LLMs wirklich funktionieren — Eine animierte Tour
- Der KV-Cache: Exakte Speicher-Mathematik, GQA vs MQA vs MLA und PagedAttention
- KV-Cache-Glossar: jeder Begriff des Serving-Stacks
- LLM-Inferenz-Mathematik: Theorie trifft Hardware
- LLM-VRAM-Bedarf: Ein mathematischer Deep Dive
- LoRA- und QLoRA-Finetuning: die echte Speicher-Mathematik
- LLM-Quantisierung: Bit-Layouts, Block-Skalen und die VRAM-Mathematik
- Expert Parallelism: Das Dilemma des Routers
- Pipeline Parallelism: Daten flussaufwärts pumpen
- Tensor Parallelism: Silizium zerschneiden
- UNISON und die pausierte Flotte: Warum Agenten-KV-Traffic jede Cache-Policy bricht
- KV-Cache-Speicherwachstums-Explorer
- LLM-Inferenzrechner & Break-Even-Analyse
- LLM-Inferenz-Ökonomie: Kosten & Cloud-Break-Even
gpu-memory15 Artikel
- Agent-Fleet-Tokenökonomie ist Cache-Ökonomie: Der 60-fache Dollar-Spread im Detail zerlegt
- Ihre Agenten-Flotte ist ein Storage-Array: Die KV-Cache-Tiering-Mathematik hinter agentischer Inferenz
- Random Attention vs. scorebasierte KV-Eviction auf Reasoning-Traces
- BOOST: Gleichzeitiger Zugriff auf Host-Speicher und HBM beim LLM-Decode
- HBF als dritte KV-Tier: 24x Sessions oder 5x schlechtere Latenz — das Medium ist in Ordnung, die Placement-Politik entscheidet
- HBM-Kapazität und die Kosten des KV-Caches
- Der KV-Cache: Exakte Speicher-Mathematik, GQA vs MQA vs MLA und PagedAttention
- KV-Cache-Glossar: jeder Begriff des Serving-Stacks
- Wer bezahlt den KV-Cache? Messregeln sind getarnte Preisentscheidungen
- KITE: Das Modell skalieren, die KV-Rechnung einfrieren — welche Prefill-Invariante arXiv:2609.27294 wirklich beweist (und was nicht)
- KV-Cache-Tensordekomposition: Vollrangige Kopf- und Layer-Modi in zwei Modellen
- KVSET: LRU-Stack-Distanzen für das Sizing von LLM-Prefix-Caches
- LoRA- und QLoRA-Finetuning: die echte Speicher-Mathematik
- RAG-Retrieval-Mathematik: Embedding-Speicher, Vektorindex-Größe und das Latenzbudget, das niemand rechnet
- UNISON und die pausierte Flotte: Warum Agenten-KV-Traffic jede Cache-Policy bricht
nvidia10 Artikel
- Qwen3-Next-80B-A3B: Architektur und Grenzen beim Serving
- NVIDIA Groq 3 LPX: SRAM-Decode, Kapazität und Benchmark-Grenzen
- NVIDIA will Hugging Face übernehmen: Die Dependency-Rechnung hinter den 12,93 Mrd. $
- NVIDIA-GPU-Container unter Ubuntu 24.04
- NVIDIA-Fehler 802 unter Ubuntu: Diagnose vor nokaslr
- AMD MI300X/MI350/MI400: Mehr Speicher, aber gewinnt die Mathematik? — Eine kritische Silizium-Analyse von AMD Instinct vs NVIDIA
- NVIDIA B200 vs GB200: Was MLPerf Training tatsächlich zeigt
- MLPerf Inference 2026: Was Ergebnisse über Hardware und Software aussagen
- NVIDIA NVLink: Generationen, Domänen und Prüfung
- Scale-up vs. Scale-out: Netzwerkbandbreite und Kollektivoperationen
kv-cache9 Artikel
- Random Attention vs. scorebasierte KV-Eviction auf Reasoning-Traces
- BOOST: Gleichzeitiger Zugriff auf Host-Speicher und HBM beim LLM-Decode
- DeepSeek-V4.1-Flash: Was die berichteten 890 Byte KV-Cache pro Token umfassen
- FlashLoop, oder: Wer einen Transformer loopt, vervierfacht die Rechnung — und wirft das Meiste wieder weg
- HBF als dritte KV-Tier: 24x Sessions oder 5x schlechtere Latenz — das Medium ist in Ordnung, die Placement-Politik entscheidet
- Risikokontrollierte KV-Eviction: Zuverlässigkeitsvertrag und Full-KV-Fallback
- KITE: Das Modell skalieren, die KV-Rechnung einfrieren — welche Prefill-Invariante arXiv:2609.27294 wirklich beweist (und was nicht)
- KV-Cache-Tensordekomposition: Vollrangige Kopf- und Layer-Modi in zwei Modellen
- KVSET: LRU-Stack-Distanzen für das Sizing von LLM-Prefix-Caches
guide8 Artikel
- Parakeet TDT vs. Encoder-Decoder-ASR: Abwägungen für den Einsatz
- Die richtige GPU für Qwen3-Inferenz auswählen
- Wie LLMs wirklich funktionieren — Eine animierte Tour
- Expert Parallelism: Das Dilemma des Routers
- Pipeline Parallelism: Daten flussaufwärts pumpen
- Tensor Parallelism: Silizium zerschneiden
- NVIDIA-GPU-Container unter Ubuntu 24.04
- NVIDIA-Fehler 802 unter Ubuntu: Diagnose vor nokaslr
vllm6 Artikel
- llama.cpp / Ollama vs vLLM: Was, wann und warum
- NVIDIA will Hugging Face übernehmen: Die Dependency-Rechnung hinter den 12,93 Mrd. $
- Die Churn-Steuer 2026 für Serving-Engines: vLLM 0.29, SGLang 0.5.19 und TensorRT-LLM ohne TensorRT
- vLLM vs SGLang: Architektur, Overhead und die Frage, wann man was wählt
- KV-Cache-Speicherwachstums-Explorer
- LLM-Inferenzrechner & Break-Even-Analyse
compliance5 Artikel
- EU-KI-Verordnung Art. 50: Kennzeichnung und technische Grenzen
- EU AI Act nach dem Digital Omnibus: Was sich verschoben hat
- EU AI Act und DSGVO für selbst gehostete LLMs
- Gumbel-Watermarking ist endlich produktiv — und die Compliance-Asymmetrie, die niemand eingepreist hat
- Deutschlands KI-MIG: Wer überwacht die KI-Verordnung?
datacenter5 Artikel
economics5 Artikel
- Agent-Fleet-Tokenökonomie ist Cache-Ökonomie: Der 60-fache Dollar-Spread im Detail zerlegt
- Der Cache-Read-Preiskrieg des Septembers 2026, der nicht dreiseitig war
- Wer bezahlt den KV-Cache? Messregeln sind getarnte Preisentscheidungen
- KITE: Das Modell skalieren, die KV-Rechnung einfrieren — welche Prefill-Invariante arXiv:2609.27294 wirklich beweist (und was nicht)
- LLM-Inferenz-Ökonomie: Kosten & Cloud-Break-Even
moe5 Artikel
- Qwen3-Next-80B-A3B: Architektur und Grenzen beim Serving
- DeepSeek V4 Pro selbst hosten: die echte Rechnung
- Kimi K3 im Detail: Delta Attention, Attention über Schichten und LatentMoE
- Qwen3.8-Flash-Next im Detail: Gated DeltaNet, Sparse Attention und N-Gram-Speicher
- Expert Parallelism: Das Dilemma des Routers
ai-act4 Artikel
optimization4 Artikel
- Ihre Agenten-Flotte ist ein Storage-Array: Die KV-Cache-Tiering-Mathematik hinter agentischer Inferenz
- Der KV-Cache: Exakte Speicher-Mathematik, GQA vs MQA vs MLA und PagedAttention
- KV-Cache-Glossar: jeder Begriff des Serving-Stacks
- UNISON und die pausierte Flotte: Warum Agenten-KV-Traffic jede Cache-Policy bricht
quantization4 Artikel
- Disaggregierte Quantisierung: Prefill- und Decode-Kosten auf zwei Formate verteilen
- PTQ-Konfigurationsbewertung: Den Quantisierungspreis vorhalten, bevor das Modell gebaut wird
- LLM-Quantisierung: Bit-Layouts, Block-Skalen und die VRAM-Mathematik
- Quantisierung kann Retrieval-Ergebnisse trotz stabiler Klassifikationsgenauigkeit ändern