GLM-5.3-Flash ist ein veröffentlichtes, nativ multimodales Modell mit offenen Gewichten von Z.ai. Das Team veröffentlichte am 26. August 2026 den standardmäßigen FP8-Checkpoint, einen getrennten BF16-Checkpoint und Deployment-Pfade für Transformers, vLLM, SGLang und weitere Engines. Das Modell besitzt ungefähr 320 Milliarden Parameter, aktiviert laut Herstellerangabe 18 Milliarden pro Token und deklariert eine Kontextgrenze von einer Million Token.123
Die Namen dürfen nicht verwechselt werden. GLM-5.3 verwendet dasselbe Basismodell wie GLM-5.2 und verändert das Post-Training. GLM-5.3-Flash ist dagegen eine neu trainierte 320B-Basis mit einer anderen glm5_next-Architektur. Die Model Card verweist noch auf den früheren GLM-5-Report, der vor dieser Flash-Architektur erschien. Die folgende Low-Level-Beschreibung stützt neue 5.3-Flash-Details deshalb auf die veröffentlichte Konfiguration und die ausführbare Implementierung. Benchmark-Werbetexte dienen nicht als Architekturspezifikation.2345
Der veröffentlichte Stack
| Komponente | Wert im Checkpoint | Bedeutung zur Laufzeit |
|---|---|---|
| Sprach-Backbone | 45 Schichten, Hidden-Dimension 4.096 | 34 KDA-Schichten und elf Sparse-MLA-Schichten.4 |
| Schichtfolge | Drei KDA-Schichten, danach eine Sparse-MLA-Schicht; Schicht 45 ist eine zusätzliche KDA-Schicht | Die meisten Schichten halten einen rekurrenten Zustand fester Größe. Jede vierte Schicht bis Schicht 44 kann ausgewählte frühere Token direkt abrufen.4 |
| Residual-Pfad | mHC mit vier Strömen und 20 Sinkhorn-Iterationen | Jedes Token führt zwischen Teilschichten vier Residual-Ströme der Breite 4.096.45 |
| Feedforward-Pfad | Erste drei Schichten dicht, danach 42 Sparse-MoE-Schichten | Acht von 288 gerouteten Experten plus ein gemeinsamer Experte verarbeiten jedes Token in einer MoE-Schicht.45 |
| Sparse-Attention-Budget | 2.048 ausgewählte Tokenplätze, Index-Pooling-Faktor vier | Der Indexer bewertet Pools, expandiert gewählte Pools zu Tokenindizes und behält den unvollständigen letzten Pool.45 |
| Bildpfad | 24 Schichten, Breite 1.024, Patchgröße 14, zeitliche Patchgröße zwei | Bild- und Videomerkmale werden auf den 4.096 breiten Sprachstrom projiziert.4 |
| Draft-Pfad | Eine MTP-Schicht | Runtimes können sie für Speculative Decoding nutzen; das Zielmodell verifiziert weiterhin vorgeschlagene Token.46 |
Diese Mechanismen arbeiten auf verschiedenen Achsen. KDA und Sparse MLA mischen Informationen über Tokenpositionen. mHC mischt vier Residual-Ströme über die Tiefe. MoE wählt Feedforward-Gewichte über die Modellbreite. Alle drei pauschal als „Routing“ zu bezeichnen, würde unterschiedliche Zustands- und Kommunikationskosten verdecken.
Sequenz-Mixing: 34 KDA-Schichten mit festem Zustand
Die Linear-Attention-Schichten implementieren Kimi Delta Attention (KDA). Für jeden Head besteht der rekurrente Zustand aus einer Matrix statt einer KV-Liste pro Token. Query, Key und Value durchlaufen eine kausale Depthwise-Faltung der Breite vier. Ein kanalweises Forget-Gate schwächt den Zustand ab, ein Skalar steuert das Schreiben nach der Delta Rule, und die Query liest den aktualisierten Zustand. Das veröffentlichte Modell nutzt 64 Heads der Dimension 128 und eine Untergrenze von für den Log-Decay.457
Prefill und Decode verwenden unterschiedliche Kernelformen. Beim Prefill lassen sich Token innerhalb von Chunks parallel auswerten, während zwischen den Chunks ein Zustand weitergereicht wird. Beim Decode eines einzelnen Tokens erfolgt eine rekurrente Aktualisierung. In der Transformers-Referenzimplementierung enthält ein logischer KDA-Zustand
Skalare pro Schicht. Über 34 KDA-Schichten sind das 35.651.584 logische Zustandswerte pro Anfrage. Der Referenz-Cache speichert den rekurrenten Zustand als FP32; das entspricht ungefähr 136 MiB, noch ohne Faltungszustand, Sharding und Allocator-Overhead. Diese Zahl ist eine Rechnung aus den veröffentlichten Dimensionen und dem Referenzcode, keine gemessene vLLM-Allokation. Optimierte Runtimes können den Zustand anders sharden, packen oder repräsentieren.45
Die Zustandsgröße wächst nicht mit der Sequenzlänge. „Feste Größe“ bedeutet jedoch weder kostenlos noch verlustfrei: Informationen alter Token werden in endliche Matrizen komprimiert. Die periodisch eingefügten Sparse-Attention-Schichten erlauben direkten Zugriff auf ausgewählte frühere Positionen. Das breite Hybridprinzip ähnelt Kimi K3; Schichtzahl, Breiten, Residual-Design, Sparse-Selektor und Expertenlayout unterscheiden sich jedoch.
Globaler Abruf: elf NoPE-Sparse-MLA-Schichten
Jede vierte Schicht von den nullbasierten Indizes 3 bis 43 nutzt DeepSeek Sparse Attention (DSA) auf Multi-head Latent Attention. Der Hauptpfad komprimiert jedes Token zunächst in einen 512-dimensionalen KV-Latentvektor. Der Checkpoint verwendet 64 Query-Heads, Query-LoRA-Rang 1.536, 256 Inhaltsdimensionen pro Query-/Key-Head und 256 Value-Dimensionen. qk_rope_head_dim ist null und mla_use_nope ist aktiviert: Diese Sparse-MLA-Schichten wenden keine RoPE-Komponente an. Kausalität und die dazwischenliegenden KDA-Schichten machen das Gesamtmodell weiterhin reihenfolgeabhängig.458
Ein separater Indexer entscheidet, welche früheren Token die Kern-Attention erreichen:
- Er projiziert jede Query auf 32 Heads der Dimension 128.
- Er erzeugt Index-Keys der Dimension 128 und komprimiert Gruppen aus vier Token-Keys mit gelernten Gates und einem Positions-Embedding innerhalb des Pools.
- Jede Query bewertet alle sichtbaren Pools, kombiniert die 32 Head-Scores mit Query-abhängigen Gewichten und wählt höchstens Pools.
- Gewählte Pools werden wieder auf höchstens 2.048 Tokenindizes expandiert. Der aktuelle unvollständige Pool steuert bis zu drei weitere Tail-Positionen bei.
Die Kern-Attention arbeitet damit auf einer begrenzten Auswahl, der Indexer aber nicht in konstanter Zeit. Bei einem Prefill der Länge bewertet er Queries weiterhin gegen ungefähr Pools. Pooling verkleinert also die Indexer-Matrix, beseitigt ihre Abhängigkeit von der Sequenzlänge aber nicht. Auch der Index-Key-Cache wächst mit dem Kontext. Alle Einträge im veröffentlichten Array indexer_types stehen auf full. Anders als GLM-5.2 mit IndexShare deklariert der 5.3-Flash-Checkpoint keine schichtübergreifende Wiederverwendung der Top-k-Indizes.45
Der MLA-Cache selbst hält 512 Latent-Skalare pro Token und Sparse-Schicht, jedoch keinen getrennten RoPE-Vektor. Über elf Schichten sind das 5.632 logische KV-Skalare pro behaltenem Token: ungefähr 11 KiB/Token in BF16 oder 5,5 KiB/Token bei einem Byte pro Skalar. Indexer-Cache, Blockmetadaten und Alignment kommen hinzu. Diese Werte sind abgeleitete Speicheruntergrenzen, keine vollständige Cache-Allokation. Der KV-Cache-Leitfaden erklärt den Unterschied zwischen logischen Tensoren und Runtime-Kapazität.
Mixing über die Tiefe: mHC mit vier Strömen
Manifold-Constrained Hyper-Connections ersetzen den einzelnen Residual-Vektor durch vier Ströme. Das Embedding wird zunächst auf vervielfacht. Vor jeder Attention- und Feedforward-Teilschicht flacht die Implementierung die vier Ströme ab, normalisiert sie und berechnet drei Token-abhängige Gruppen von Koeffizienten:
prebesitzt vier Koeffizienten und reduziert die Ströme auf einen Eingang der Teilschicht;postbesitzt vier Koeffizienten und expandiert die Ausgabe der Teilschicht wieder auf vier Ströme;combist eine -Matrix zum Mischen der Residual-Ströme.
Die comb-Matrix wird mit 20 Sinkhorn-Knopp-Schritten abwechselnd über Zeilen und Spalten normalisiert und damit in Richtung einer doppelt stochastischen Matrix gezwungen. Nach der Teilschicht wird das expandierte Ergebnis zu den gemischten Residual-Strömen addiert. Nach allen 45 Schichten werden die vier Ströme gemittelt und per RMSNorm normalisiert. mHC erhöht somit Aktivierungsverkehr und Koeffizientenberechnung, obwohl Attention oder MLP jeweils nur einen 4.096 breiten Vektor erhalten. Ziel sind ein reichhaltigerer und besser konditionierter Informationsfluss über die Tiefe; der Checkpoint allein belegt keinen Qualitätsgewinn für eine bestimmte Anwendung.945
Mixing über die Breite: acht von 288 Experten
Nach den ersten drei dichten Schichten besitzt jeder Feedforward-Block 288 geroutete Experten, davon acht pro Token ausgewählt, sowie einen gemeinsamen Experten. Jeder geroutete Experte hat Intermediate-Dimension 2.048. Der Referenz-Router berechnet Logits in FP32 und wendet Sigmoid-Scores an. Ein gelernter Korrektur-Bias beeinflusst nur die Expertenwahl. Für die gewählten Experten werden die ursprünglichen Sigmoid-Scores verwendet, normalisiert und mit dem konfigurierten Faktor 2,5 multipliziert. Der gemeinsame Experte läuft immer; seine Ausgabe wird zum gerouteten Ergebnis addiert.45
Das Experten-MLP nutzt SwiGLU mit Clamping: Das Gate ist nach oben auf 10 begrenzt, der Up-Zweig auf . Sparse Aktivierung senkt die Arithmetik pro Token, aber alle 288 Expertensätze müssen weiterhin irgendwo erreichbar gespeichert sein. Expert Parallelism macht das Token-Routing außerdem zu All-to-all-Kommunikation, wenn Runtime und Platzierung die gewählten Experten nicht lokal halten. „18B aktiv“ beschreibt daher Berechnung, nicht den Gerätespeicherbedarf.
FP8-Checkpoint und Betriebsgrenzen
Das standardmäßige Repository zai-org/GLM-5.3-Flash enthält den nativen FP8-Checkpoint; GLM-5.3-Flash-BF16 ist getrennt. Die FP8-Konfiguration deklariert dynamische E4M3-Aktivierungsquantisierung, schließt aber viele Module aus, darunter Attention-Pfade, Hyper-Connections, Embeddings, Sprachmodell-Head sowie ausgewählte Normen und Projektionen. Das Repository enthält deshalb BF16-, FP8- und FP32-Tensoren. 320 Milliarden pauschal mit einem Byte zu multiplizieren ergibt keine vollständige Speicherrechnung.34
Das offizielle vLLM-Rezept schätzt allein für die FP8-Gewichte ungefähr 306 GiB, noch ohne Runtime-Zustand und Caches, und verlangt ein Backend für Sparse NoPE MLA. Die Beispiele verwenden TP4, optional FP8-KV auf Blackwell, MTP-Speculative-Decoding und identische KDA-/KV-Layouts bei getrenntem Prefill und Decode. Das sind implementierungsspezifische Deployment-Rezepte, keine universellen Hardware-Minima. Eine Produktionsplanung muss Modell-Shards, MoE-Kommunikation, Aktivierungen der vier Ströme, rekurrente KDA- und Faltungszustände, Sparse-MLA-KV, Indexer-Zustand, MTP-Workspace und die reale Verteilung der Anfragelängen berücksichtigen.6
Quellen
Footnotes
-
Z.ai, GLM-5.3-Flash: Frontier Intelligence, Flash Cost, 26. August 2026. ↩
-
Z.ai, offizielles GLM-5-Repository und Release-Tabelle. ↩ ↩2
-
Z.ai, offizielle GLM-5.3-Flash-Model-Card und veröffentlichte Gewichte. ↩ ↩2 ↩3
-
Z.ai, veröffentlichte GLM-5.3-Flash-
config.json. ↩ ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8 ↩9 ↩10 ↩11 ↩12 ↩13 ↩14 ↩15 -
Hugging Face Transformers,
modeling_glm5_next.py. ↩ ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8 ↩9 ↩10 -
vLLM, offizielles GLM-5.3-Flash-Deployment-Rezept, aktualisiert am 18. September 2026. ↩ ↩2
-
Kimi Team, Kimi Linear: An Expressive, Efficient Attention Architecture, arXiv:2510.26692. ↩
-
DeepSeek-AI, DeepSeek-V3.2: Pushing the Frontier of Open Large Language Models, arXiv:2512.02556. ↩
-
Xie et al., mHC: Manifold-Constrained Hyper-Connections, arXiv:2512.24880. ↩