# Ein Modell, zwei Engines

> Qwen 3.8 27B, NVFP4, einmal auf der NInfer-Engine, einmal auf LM Studio: Gleiche Hardware, 824 Fragen — vier Standard-Benchmarks und zwei Long-Context-Präzisionstests. Im Dekodieren trennen die Engines deutlich, bei 128K bis 256K Kontext bleiben beide bei 100 Prozent.

_Kicker: engine-bench · Datum: 2026-09-03 · Lesezeit: 9 min_

Dasselbe 27-Billionen-Parameter-Modell, NVFP4-quantisiert, auf derselben RTX 5090 — einmal getrieben von der NInfer-Engine, einmal von LM Studio. Vier Standard-Benchmarks mit je 200 Fragen, dazu zwei Long-Context-Präzisionstests (RULER bei 256K, MRCR bei 128K), eine saubere Decode-Lane pro Lauf. Die Frage: Was bleibt, wenn Modell und Hardware fix sind? Antwort vorweg: die Engine macht den Unterschied — in der Geschwindigkeit deutlich, in der Qualität messbar, aber klein; und selbst mit hunderttausenden Kontext-Tokens verliert das Modell keine der Nadeln.

## Setup

### Modell

**Qwen 3.8 27B · NVFP4**

Dasselbe Modell in beiden Läufen; kein Cloud-Endpoint, beides lokal auf einer RTX 5090 (32 GB VRAM).

### Engine A — NInfer

**C++/CUDA · KV-Cache nvfp4**

Eigenbau-Inferenz-Engine mit QUASAR-NVFP4-Gewichten und nvfp4-KV-Cache. Bewusst `max-concurrency 1`: ein Request nach dem anderen, keine parallele Decode-Lane, keine Störprozesse.

### Engine B — LM Studio

**Standard-Server**

Klassische lokale Inference-Umgebung mit OpenAI-kompatiblem Server (Standard-Konfiguration), ebenfalls max. 1 paralleler Request.

### Umfang

**4 × 200 Fragen + 2 × 12 Long-Context**

Ein Lauf pro Konfiguration — ein Indikator, kein statistischer Paper-Claim: eine einzelne Stichprobe kann eine Zelle dominieren. Long-Context (RULER, MRCR) als eigener Abschnitt mit 12 Fragen je Benchmark.

## Ergebnisse

### NInfer

_QUASAR-NVFP4-Gewichte, KV-Cache nvfp4, C++/CUDA-Engine auf RTX 5090_

Gestartet: 2026-09-02 21:37 UTC

| Benchmark | Genauigkeit | Correct/Total | Decode (tok/s) | Prefill (tok/s) | TTFT (ms) | Output-Tokens | Wall-Time (s) |
|---|---|---|---|---|---|---|---|
| GSM8K | 97.0 % | 194/200 | 218.0 | 2117.6 | 70 | 98234 | 456.3 |
| ARC-Challenge | 94.5 % | 189/200 | 205.0 | 2029.0 | 64.5 | 39028 | 201.3 |
| MMLU | 96.0 % | 192/200 | 203.5 | 2049.2 | 68 | 127251 | 620.7 |
| GPQA | 77.0 % | 154/200 | 206.1 | 3186.7 | 77 | 605540 | 2960.5 |

#### Long-Context (256K)

| Benchmark | Kontext (K) | Genauigkeit | Correct/Total | Decode (tok/s) | TTFT (ms) | Wall-Time (s) |
|---|---|---|---|---|---|---|
| RULER | 256 | 100.0 % | 12/12 | 184.2 | 57530.5 | 733.0 |
| MRCR | 256 | 100.0 % | 12/12 | 204.1 | 57178.5 | 771.6 |

### LM Studio

_qwen/qwen3.8-27b Standard-Quantisierung, Standard-Server auf derselben RTX 5090_

Gestartet: 2026-09-03 09:19 UTC

| Benchmark | Genauigkeit | Correct/Total | Decode (tok/s) | Prefill (tok/s) | TTFT (ms) | Output-Tokens | Wall-Time (s) |
|---|---|---|---|---|---|---|---|
| GSM8K | 96.5 % | 193/200 | 83.2 | 491.9 | 296 | 95247 | 1195.9 |
| ARC-Challenge | 94.5 % | 189/200 | 72.3 | 442.2 | 298 | 43417 | 635.3 |
| MMLU | 93.5 % | 187/200 | 76.1 | 452.0 | 305.5 | 112618 | 1520.4 |
| GPQA | 77.5 % | 155/200 | 76.5 | 713.5 | 358.5 | 587792 | 7734.8 |

#### Long-Context (128K)

| Benchmark | Kontext (K) | Genauigkeit | Correct/Total | Decode (tok/s) | TTFT (ms) | Wall-Time (s) |
|---|---|---|---|---|---|---|
| RULER | 128 | 100.0 % | 12/12 | 95.7 | 46200 | 576.0 |
| MRCR | 128 | 100.0 % | 12/12 | 99.1 | 46179 | 585.8 |

## Findings

### Decode: der Faktor 3 ist die Geschichte

NInfer hält 203–228 Token/s, LM Studio 72–83 Token/s — unabhängig vom Benchmark. Das ist der eigentliche Unterschied: Wer lokal Antworttexte streamt, spürt diesen Faktor in jeder Antwort, bei jedem Chat, bei jedem Agent-Loop.

### TTFT: das eigentliche Ausrufezeichen

Der erste Token kommt bei NInfer in 64–77 ms, bei LM Studio in 296–359 ms — bis zu 5,2-fach schneller. Prefill, Scheduling und KV-Handling laufen in der eigenen Engine spürbar effizienter als im Standard-Setup.

### Genauigkeit: eng, und NInfer vorn

NInfer führt bei GSM8K (97,0 statt 96,5) und MMLU (96,0 statt 93,5), ARC-Challenge ist ein Gleichstand (94,5), GPQA steht 77,0 zu 77,5 — praktisch auf Augenhöhe. Wichtig: Quantisierung und Engine sind hier verknüpft (NVFP4 + nvfp4-KV vs. Standard-Quant); isoliert lässt sich der Effekt in diesem Design nicht trennen.

### Gesamtdauer: 75 statt 185 Minuten

Der komplette Vierer-Satz lief bei NInfer in 74,8 Minuten, bei LM Studio in 184,9 — bei 2,48 Mio. respektive 0,84 Mio. Output-Tokens. GPQA mit seinen langen Reasoning-Ketten (Median 3.375 Output-Token pro Frage) macht den Unterschied dramatisch: 49,3 statt 128,9 Minuten.

### Long-Context: beide bei 12 von 12 — das Modell verliert keine Nadel

RULER (verstreute Schlüssel-Wert-Paare) und MRCR (2/4/8 Nadeln unter Ablenk-Einträgen) liegen bei beiden Engines exakt auf 100 Prozent (12/12). Qwen 3.8 27B sortiert hunderttausende Kontext-Tokens, ohne zu halluzinieren und ohne „Lost in the middle“. Der Long-Context-Vergleich ist allerdings nicht apples-to-apples: NInfer lief mit 256K Kontext, LM Studio mit 128K — mehr dazu unter „Grenzen der Messung“.

### Long-Context-Geschwindigkeit: der Faktor bleibt, der Startpreis steigt

Beim Dekodieren bleibt NInfer rund doppelt so schnell (184–204 statt 96–99 Token/s). Beim Starten dreht sich das Bild: Für 256K Kontext braucht NInfer 57,2–57,5 s TTFT, LM Studio für 128K 46,2 s. Kontextlänge und Engine sind hier verknüpft — der reine Engine-Vorteil im Prefill ist erst bei gleicher Kontextlänge aussagbar.

## Grenzen

- Ein Lauf mit je 200 Fragen pro Standard-Benchmark — kein Konfidenzintervall, keine Mehrfachwiederholung.
- Long-Context (RULER, MRCR): je 12 Fragen, und die Kontextlänge unterscheidet sich je Engine (NInfer 256K, LM Studio 128K — KV-Cache-Budget). Kein direkter Apples-to-Apples-Vergleich bei gleicher Kontextlänge.
- Die Engines nutzen unterschiedliche Quantisierungen (NVFP4 + nvfp4-KV-Cache vs. Standard-Quant); der Engine-Effekt ist damit nicht vollständig vom Quantisierungs-Effekt zu trennen.
- GPQA erzeugt lange Reasoning-Antworten (Median 3.375 Token) — hier ist die Lauf-zu-Lauf-Varianz am größten.
- Die Standard-Benchmarks stammen vom 02./03.09., die Long-Context-Läufe vom 04.09. 2026; es ist eine Momentaufnahme, keine kontinuierliche Messreihe.

## Quellen

- [AI-Benchmark (Läufe vom 02.–04.09.2026)](https://github.com)
- [LM Studio](https://lmstudio.ai/docs)
