# Ein Modell, zwei Dekodier-Strategien

> Qwen 3.8 27B, NVFP4, auf derselben NInfer-Engine: einmal mit Multi-Token-Prediction (MTP), einmal mit DFlash2 (masked-block Drafting). 824 Fragen — vier Standard-Benchmarks und zwei Long-Context-Präzisionstests bei 256K. DFlash2 dekodiert rund 1,5× schneller; der Preis: eine verlorene Nadel im Long-Context und 0,9 Prozentpunkte weniger Genauigkeit.

_Kicker: spec-bench · Datum: 2026-09-08 · Lesezeit: 9 min_

Dasselbe 27-Billionen-Parameter-Modell, NVFP4-quantisiert, dieselbe NInfer-Engine auf einer RTX 5090, derselbe 256K-Kontext — nur die Strategie, mit der das Modell seine Antwort baut, wechselt. MTP lässt das Modell selbst bis zu fünf Token pro Schritt prognostizieren; DFlash2 spekuliert in einem 5-Lagen-Draft-Modell parallel sieben Kandidaten. Die Frage: Was kostet die Geschwindigkeit? Antwort vorweg: DFlash2 spart im Dekodieren rund ein Fünftel der Zeit — und verliert dabei eine Nadel im Lang-Kontext und etwas an Genauigkeit. Wer schneller streamen will, zahlt einen messbaren, aber kleinen Präzisionspreis.

## Setup

### Modell & Gewichte

**Qwen 3.8 27B · QUASAR NVFP4**

Dasselbe Modell und dieselben QUASAR-NVFP4-Gewichte mit nvfp4-KV-Cache in beiden Läufen. Kein Engine- oder Quantisierungs-Unterschied — isoliert bleibt nur die Dekodier-Strategie.

### Strategie A — MTP

**Multi-Token-Prediction · 3 Draft**

Das Modell prognostiziert selbst die nächsten Token (natives MTP-Modul), der Target-Verifizierer bestätigt oder verwirft. `--spec mtp --draft-tokens 3`: maximal drei speculative Positionen pro Runde.

### Strategie B — DFlash2 v2

**masked-block Drafting · K=7**

Ein separates 5-Lagen-Draft-Modell (z-lab/Qwen3.8-27B-DFlash2) erzeugt in einem Forward-Pass parallel sieben Kandidaten, ein Selector pickt die Pfad-Kandidaten, der Target verifiziert. `--spec dflash2 --draft-tokens 7`.

### Umfang

**4 × 200 Fragen + 2 × 12 Long-Context**

Ein Lauf pro Strategie — ein Indikator, kein statistischer Paper-Claim: eine einzelne Stichprobe kann eine Zelle dominieren. Long-Context (RULER, MRCR) als eigener Abschnitt mit 12 Fragen je Benchmark, beide bei 256K Kontext.

## Ergebnisse

### MTP

_Multi-Token-Prediction, 3 Draft-Tokens, natives MTP-Modul auf NInfer_

Gestartet: 2026-09-04 15:23 UTC

| Benchmark | Genauigkeit | Correct/Total | Decode (tok/s) | Prefill (tok/s) | TTFT (ms) | Output-Tokens | Wall-Time (s) |
|---|---|---|---|---|---|---|---|
| GSM8K | 97.0 % | 194/200 | 218.0 | 2117.6 | 70 | 98234 | 456.3 |
| ARC-Challenge | 94.5 % | 189/200 | 205.0 | 2029.0 | 64.5 | 39028 | 201.3 |
| MMLU | 96.0 % | 192/200 | 203.5 | 2049.2 | 68 | 127251 | 620.7 |
| GPQA | 77.0 % | 154/200 | 206.1 | 3186.7 | 77 | 605540 | 2960.5 |

#### Long-Context (256K)

| Benchmark | Kontext (K) | Genauigkeit | Correct/Total | Decode (tok/s) | TTFT (ms) | Wall-Time (s) |
|---|---|---|---|---|---|---|
| RULER | 256 | 100.0 % | 12/12 | 184.2 | 57530.5 | 733.0 |
| MRCR | 256 | 100.0 % | 12/12 | 204.1 | 57178.5 | 771.6 |

### DFlash2 v2

_DFlash2 masked-block Drafting, K=7, 5-Lagen-Draft-Modell auf NInfer_

Gestartet: 2026-09-08 11:55 UTC

| Benchmark | Genauigkeit | Correct/Total | Decode (tok/s) | Prefill (tok/s) | TTFT (ms) | Output-Tokens | Wall-Time (s) |
|---|---|---|---|---|---|---|---|
| GSM8K | 95.5 % | 191/200 | 363.3 | 2155.1 | 68 | 106028 | 351.3 |
| ARC-Challenge | 92.0 % | 184/200 | 321.4 | 2052.4 | 62.5 | 37592 | 144.9 |
| MMLU | 89.5 % | 179/200 | 311.8 | 2278.7 | 60.5 | 140040 | 486.4 |
| GPQA | 84.0 % | 168/200 | 280.6 | 3456.3 | 73 | 612577 | 2271.6 |

#### Long-Context (256K)

| Benchmark | Kontext (K) | Genauigkeit | Correct/Total | Decode (tok/s) | TTFT (ms) | Wall-Time (s) |
|---|---|---|---|---|---|---|
| RULER | 256 | 100.0 % | 12/12 | 317.2 | 57202 | 694.6 |
| MRCR | 256 | 91.7 % | 11/12 | 318.8 | 57371 | 699.8 |

## Findings

### Decode: DFlash2 läuft rund 1,5× schneller

DFlash2 hält 280–363 Token/s, MTP 203–218 Token/s — der Speedup reicht von 1,36× (GPQA) bis 1,72× (RULER). Grund: das Draft-Modell spekuliert sieben Kandidaten parallel, statt dass das Haupt-Modell selbst Token für Token prognostiziert. Für jeden lokal gestreamten Text bedeutet das: merklich kürzere Antwortzeiten, bei jedem Chat und jedem Agent-Loop.

### TTFT: praktisch egal

Der erste Token kommt bei DFlash2 in 60,5–73 ms, bei MTP in 64,5–77 ms — kein messbarer Unterschied. Das ist sinnvoll: die Strategie greift erst im Dekodieren, nicht im Prefill. Wer vor allem auf die Zeit bis zur ersten sichtbaren Antwort schaut, spürt den Unterschied der beiden Strategien kaum.

### Genauigkeit: DFlash2 kostet 0,9 pp, verteilt ungleich

Im Schnitt über die vier Standard-Benchmarks liegt DFlash2 bei 90,25 %, MTP bei 91,12 % — ein Abstand von 0,9 Prozentpunkten. Er verteilt sich aber ungleich: bei GSM8K (95,5 statt 97,0) und MMLU (89,5 statt 96,0) ist DFlash2 spürbar schlechter, bei GPQA sogar besser (84,0 statt 77,0). Das Muster zeigt, dass der Präzisionsverlust kein Rauschen ist, sondern an der Art der Aufgabe hängt — MMLU mit seinen kurzen Wissensantworten leidet mehr als GPQA mit seinen langen Reasoning-Ketten.

### Gesamtdauer: 54 statt 71 Minuten

Der komplette Vierer-Satz lief bei DFlash2 in 54,2 Minuten, bei MTP in 70,6 — bei 896.237 respektive 870.053 Output-Tokens. GPQA mit seinen langen Reasoning-Ketten (Median rund 3.000 Output-Token pro Frage) macht den Unterschied sichtbar: 37,9 statt 49,3 Minuten. Der Geschwindigkeitsvorteil skaliert mit der Antwortlänge.

### Long-Context: DFlash2 verliert eine Nadel, MTP nicht

RULER (verstreute Schlüssel-Wert-Paare) liegt bei beiden bei 12 von 12 — DFlash2 bleibt bei 256K Kontext frei von „Lost in the middle“. MRCR (2/4/8 Nadeln unter Ablenk-Einträgen) trennt sich: MTP 12/12, DFlash2 11/12. Eine der zwölf MRCR-Fragen geht bei DFlash2 verloren. Das ist der konkrete Preis der aggressiveren Spekulation: mehr parallel vorgeschlagene Token erhöhen die Chance, dass der Verifizierer einen Fehler durchlässt oder eine Nadel verliert.

### Long-Context-Geschwindigkeit: DFlash2 fast doppelt so schnell im Decode

Beim Dekodieren im Lang-Kontext bleibt der Vorsprung: DFlash2 317–319 Token/s, MTP 184–204 Token/s. Der TTFT (Prefill der 256K) ist bei beiden rund 57 s — die Kontextlänge dominiert, die Strategie nicht. Hier ist der Vergleich apples-to-apples: gleiche Kontextlänge, gleiche Engine, gleiche Gewichte.

## Grenzen

- Ein Lauf mit je 200 Fragen pro Standard-Benchmark — kein Konfidenzintervall, keine Mehrfachwiederholung.
- Long-Context (RULER, MRCR): je 12 Fragen — die einzelne verlorene MRCR-Nadel (11/12) ist statistisch schwach belastbar, aber konsistent mit dem erwarteten Spekulations-Verhalten.
- MTP (3 Draft) und DFlash2 (K=7) nutzen unterschiedliche speculative Tiefen; der genaue Split zwischen „Strategie-Art“ und „Draft-Anzahl“ lässt sich in diesem Design nicht trennen.
- GPQA erzeugt lange Reasoning-Antworten (Median rund 3.000 Token) — hier ist die Lauf-zu-Lauf-Varianz am größten; der GPQA-Vorteil von DFlash2 könnte teilweise Varianz sein.
- Die MTP-Messung stammt vom 04.09., die DFlash2-v2-Messung vom 08.09. 2026; es ist eine Momentaufnahme, keine gleichzeitige Gegenüberstellung unter identischen Systembedingungen.

## Quellen

- [AI-Benchmark (Läufe vom 04. und 08.09.2026)](https://richard.koehls.de/benchmark/)
- [Qwen3.8-27B QUASAR NVFP4 — NInfer-Artefakt (MirkoCovizzi/Qwen3.8-27B-QUASAR-NVFP4-NInfer)](https://huggingface.co/MirkoCovizzi/Qwen3.8-27B-QUASAR-NVFP4-NInfer)
- [DFlash2-Draft-Modell (Companion, z-lab/Qwen3.8-27B-DFlash2)](https://huggingface.co/z-lab/Qwen3.8-27B-DFlash2)
