DeepSeek V4 Flash 0731 im Test: 1M-Kontext-MoE für $0.09/$0.18 auf OpenRouter

Sparse MoE 284B/13B, 1M-Kontext, Reasoning/Tools; OpenRouter-Hauptlisting $0.09/$0.18. HF Hot +64 %, Katalog-Erstsicht 2026-08-01. Composite-Rang #9 (Kontext-$-Proxy, keine Fähigkeit).

DeepSeek V4 Flash — Konzept eines schnellen Sparse-MoE Bild vergrößern
Flash: spärliche Aktivierung für Langkontext-Durchsatz

Was es ist

DeepSeek V4 Flash 0731 (`deepseek/deepseek-v4-flash-0731`) ist die Effizienzstufe der V4-Linie: Sparse MoE mit 284B gesamt und ~13B aktiv, für Coding, Reasoning und Agent-Workflows, mit 1M-Token-Kontext. Gegenüber V4 Pro (1.6T / 49B aktiv) tauscht Flash Aktivierungsskala gegen Durchsatz und niedrigen Preis.

`ops_model_first_seen` listet die 0731-Revision am 2026-08-01; Flash 0423 und V4 Pro am 2026-06-22. Der Katalog nennt sie re-post-trained — behandeln Sie sie als Punkt-SKU derselben Familie.

Auf HF Hot direkt hinter Kimi-K3 (sort_index=1), +64 % und ~236K Downloads. Hitze zählt, aber Downloads ≠ produktionsreif: entscheiden Sie nach Specs und Multi-Host-Preisen.

Datenblatt auf einen Blick

Sparse MoE: 284B gesamt, ~13B aktiv Bild vergrößern
Die meisten Experts schlafen; wenige Pfade leuchten

Zahlen (`core_model`): Kontext 1.048.576; Modalität `text->text`. 20 API-Parameter, u. a. reasoning, reasoning_effort, tools, structured_outputs und top_a.

Vs Flash 0423: gleiches 1M und text→text, Liste nahezu gleich. Vs V4 Pro: gleiches 1M, etwas kürzere Liste (ohne top_a) und größere Aktivierungsskala. Kein Wissensstichtag für 0731 in diesem Snapshot. Anbieter: DeepSeek.

Preis und Bezugsquellen

Preisleiter der V4-Familie Bild vergrößern
0731 unten: die günstigste Stufe der Familie

Flash 0731: OpenRouter-Hauptlisting $0.09/$0.18. Fireworks und Together $0.14/$0.28 (verifiziert) — nicht überall $0.09 annehmen. Fireworks zeigt cached input $0.028.

Familie (OpenRouter): 0423 $0.14/$0.28; Pro $0.435/$0.87; V3.2 ~$0.269/$0.40. 0731 ist eingangsseitig ~36 % günstiger als 0423. Host-Abdeckung auf Token prüfen.

Familienleiter: Flash 0423 → 0731 → V4 Pro

V4-Leiter (OpenRouter-Hauptlisting, 1M): 0731 gemischt ~$0.135; 0423 ~$0.21; Pro ~$0.65. Aktiv 13B vs 49B.

Composite (Proxy): 0731 ~#9; latest-Alias ~#8; 0423 ~#72; Pro ~#75. Der Score belohnt günstigen Langkontext.

Faustregel: langes Batch/Agent → 0731; alte Route pinnen → 0423; größeres Aktiv-Flaggschiff zu ~4,8× Mix → Pro.

Preis- und Spec-Vergleich über Anbieter

Mischkosten (OpenRouter): 0731 ~$0.135/1M. Kontrast: Llama 4 Scout ~$0.20 (#2), Luna Pro ~$0.35, Qwen3.7 Flash ~$0.08, MiniMax M3 ~$0.75, GLM-5.2 ~$1.59, Kimi K3 ~$9, Grok 4.5 ~$4, Sonnet 5 ~$6.

0731 liegt bei «ultra-günstigem Langkontext». Nur Text — für Bild/Datei Multimodal wählen. Spec-/Kostenvergleich, kein Fähigkeits-Benchmark.

Kosten in der Praxis: zwei Szenarien

Rechnung mit OpenRouter-Hauptlisting (ohne extra Reasoning-Tokens).

A — Agent-Runde (100K in + 20K out): 0731 ~$0.013; 0423 ~$0.020; Scout ~$0.016; Luna ~$0.022; Pro ~$0.061; K3 ~$0.60; Sonnet ~$0.40.

B — Langdokument (500K in + 5K out): 0731 ~$0.046; 0423 ~$0.071; Scout ~$0.052; Pro ~$0.222; K3 ~$1.58.

Fazit: 0731 drückt 1M-Agent-Entwürfe auf Cent-Niveau; Ausgabe kostet nur 2× Eingabe. Spec-/Kostenvergleich, kein Fähigkeits-Benchmark.

Wann wählen, wann nicht

0731 wählen: 1M-Agent-/Code-Entwürfe bei Minimalbudget und nur Text. Punkt-ID pinnen; silent Drift des latest-Alias vermeiden.

Meiden / anders: multimodal → anderes SKU; größeres Aktiv-Flaggschiff → Pro; 0423-Baseline → 0423; wenn Fireworks/Together stabiler ist, zu $0.14/$0.28 routen.

Entscheiden mit Modell-/Token-/Compare-/Trends-Seiten; Composite ist Kontext-$-Proxy.

Deployment-Checkliste

Vor Integration: `deepseek/deepseek-v4-flash-0731` explizit routen, getrennt von 0423/Pro/latest; Harness auf reasoning/reasoning_effort/tools/structured_outputs prüfen; Budget mit realem I/O und hostweise (OR $0.09/$0.18 vs FW/TG $0.14/$0.28).

Betrieb: Tokens pro Runde (inkl. Reasoning) überwachen; Langkontext auf Truncation/Latenz lasten; Token und Trends prüfen. Preise laut SQLite-Snapshot.

Insights