DeepSeek V4 Flash 0731 im Test: 1M-Kontext-MoE für $0.09/$0.18 auf OpenRouter
Sparse MoE 284B/13B, 1M-Kontext, Reasoning/Tools; OpenRouter-Hauptlisting $0.09/$0.18. HF Hot +64 %, Katalog-Erstsicht 2026-08-01. Composite-Rang #9 (Kontext-$-Proxy, keine Fähigkeit).
Bild vergrößern Was es ist
DeepSeek V4 Flash 0731 (`deepseek/deepseek-v4-flash-0731`) ist die Effizienzstufe der V4-Linie: Sparse MoE mit 284B gesamt und ~13B aktiv, für Coding, Reasoning und Agent-Workflows, mit 1M-Token-Kontext. Gegenüber V4 Pro (1.6T / 49B aktiv) tauscht Flash Aktivierungsskala gegen Durchsatz und niedrigen Preis.
`ops_model_first_seen` listet die 0731-Revision am 2026-08-01; Flash 0423 und V4 Pro am 2026-06-22. Der Katalog nennt sie re-post-trained — behandeln Sie sie als Punkt-SKU derselben Familie.
Auf HF Hot direkt hinter Kimi-K3 (sort_index=1), +64 % und ~236K Downloads. Hitze zählt, aber Downloads ≠ produktionsreif: entscheiden Sie nach Specs und Multi-Host-Preisen.
Datenblatt auf einen Blick
Bild vergrößern Zahlen (`core_model`): Kontext 1.048.576; Modalität `text->text`. 20 API-Parameter, u. a. reasoning, reasoning_effort, tools, structured_outputs und top_a.
Vs Flash 0423: gleiches 1M und text→text, Liste nahezu gleich. Vs V4 Pro: gleiches 1M, etwas kürzere Liste (ohne top_a) und größere Aktivierungsskala. Kein Wissensstichtag für 0731 in diesem Snapshot. Anbieter: DeepSeek.
Preis und Bezugsquellen
Bild vergrößern Flash 0731: OpenRouter-Hauptlisting $0.09/$0.18. Fireworks und Together $0.14/$0.28 (verifiziert) — nicht überall $0.09 annehmen. Fireworks zeigt cached input $0.028.
Familie (OpenRouter): 0423 $0.14/$0.28; Pro $0.435/$0.87; V3.2 ~$0.269/$0.40. 0731 ist eingangsseitig ~36 % günstiger als 0423. Host-Abdeckung auf Token prüfen.
Familienleiter: Flash 0423 → 0731 → V4 Pro
V4-Leiter (OpenRouter-Hauptlisting, 1M): 0731 gemischt ~$0.135; 0423 ~$0.21; Pro ~$0.65. Aktiv 13B vs 49B.
Composite (Proxy): 0731 ~#9; latest-Alias ~#8; 0423 ~#72; Pro ~#75. Der Score belohnt günstigen Langkontext.
Faustregel: langes Batch/Agent → 0731; alte Route pinnen → 0423; größeres Aktiv-Flaggschiff zu ~4,8× Mix → Pro.
Preis- und Spec-Vergleich über Anbieter
Mischkosten (OpenRouter): 0731 ~$0.135/1M. Kontrast: Llama 4 Scout ~$0.20 (#2), Luna Pro ~$0.35, Qwen3.7 Flash ~$0.08, MiniMax M3 ~$0.75, GLM-5.2 ~$1.59, Kimi K3 ~$9, Grok 4.5 ~$4, Sonnet 5 ~$6.
0731 liegt bei «ultra-günstigem Langkontext». Nur Text — für Bild/Datei Multimodal wählen. Spec-/Kostenvergleich, kein Fähigkeits-Benchmark.
Kosten in der Praxis: zwei Szenarien
Rechnung mit OpenRouter-Hauptlisting (ohne extra Reasoning-Tokens).
A — Agent-Runde (100K in + 20K out): 0731 ~$0.013; 0423 ~$0.020; Scout ~$0.016; Luna ~$0.022; Pro ~$0.061; K3 ~$0.60; Sonnet ~$0.40.
B — Langdokument (500K in + 5K out): 0731 ~$0.046; 0423 ~$0.071; Scout ~$0.052; Pro ~$0.222; K3 ~$1.58.
Fazit: 0731 drückt 1M-Agent-Entwürfe auf Cent-Niveau; Ausgabe kostet nur 2× Eingabe. Spec-/Kostenvergleich, kein Fähigkeits-Benchmark.
Wann wählen, wann nicht
0731 wählen: 1M-Agent-/Code-Entwürfe bei Minimalbudget und nur Text. Punkt-ID pinnen; silent Drift des latest-Alias vermeiden.
Meiden / anders: multimodal → anderes SKU; größeres Aktiv-Flaggschiff → Pro; 0423-Baseline → 0423; wenn Fireworks/Together stabiler ist, zu $0.14/$0.28 routen.
Entscheiden mit Modell-/Token-/Compare-/Trends-Seiten; Composite ist Kontext-$-Proxy.
Deployment-Checkliste
Vor Integration: `deepseek/deepseek-v4-flash-0731` explizit routen, getrennt von 0423/Pro/latest; Harness auf reasoning/reasoning_effort/tools/structured_outputs prüfen; Budget mit realem I/O und hostweise (OR $0.09/$0.18 vs FW/TG $0.14/$0.28).
Betrieb: Tokens pro Runde (inkl. Reasoning) überwachen; Langkontext auf Truncation/Latenz lasten; Token und Trends prüfen. Preise laut SQLite-Snapshot.