Test de DeepSeek V4 Flash 0731 : MoE à contexte 1M pour $0.09/$0.18 sur OpenRouter

MoE sparse 284B/13B, contexte 1M, reasoning/tools ; listing principal OpenRouter $0.09/$0.18. HF Hot +64 %, première apparition 2026-08-01. Classement composite #9 (proxy contexte/$, pas capacité).

DeepSeek V4 Flash — concept MoE sparse haute vitesse Agrandir l’image
Flash : activation sparse vers le débit à long contexte

Ce que c’est

DeepSeek V4 Flash 0731 (`deepseek/deepseek-v4-flash-0731`) est le palier efficacité de la ligne V4 : MoE sparse 284B totaux / ~13B actifs, pour code, raisonnement et flux agent, avec contexte 1M tokens. Face à V4 Pro (1.6T / 49B actifs), Flash échange l’échelle d’activation contre débit et bas prix.

`ops_model_first_seen` date la révision 0731 au 2026-08-01 ; Flash 0423 et V4 Pro au 2026-06-22. Le catalogue parle d’une révision re-post-trained : SKU ponctuel de la même famille.

Sur HF Hot, juste après Kimi-K3 (sort_index=1), +64 % et ~236K téléchargements. La chaleur compte, mais DL ≠ prêt prod : tranchez sur specs et cotations multi-hôte.

Fiche technique en un coup d’œil

MoE sparse : 284B totaux, ~13B actifs Agrandir l’image
La plupart des experts en veille ; peu de chemins allumés

Chiffres (`core_model`) : contexte 1 048 576 ; modalité `text->text`. 20 paramètres API, dont reasoning, reasoning_effort, tools, structured_outputs et top_a.

Vs Flash 0423 : même 1M et text→text, liste quasi alignée. Vs V4 Pro : même 1M, liste un peu plus courte (sans top_a) et plus grande échelle d’activation. Pas de coupure de connaissances pour 0731 dans ce snapshot. Éditeur : DeepSeek.

Prix et où l’exécuter

Échelle de prix de la famille V4 Agrandir l’image
0731 en bas : le palier le moins cher du clan

Flash 0731 : listing principal OpenRouter à $0.09/$0.18. Fireworks et Together à $0.14/$0.28 (vérifié) : ne supposez pas $0.09 partout. Fireworks expose aussi cached input $0.028.

Famille (OpenRouter) : 0423 $0.14/$0.28 ; Pro $0.435/$0.87 ; V3.2 ~$0.269/$0.40. 0731 est ~36 % moins cher en entrée que 0423. Revérifiez la couverture sur Token.

Échelle familiale : Flash 0423 → 0731 → V4 Pro

Échelle V4 (OpenRouter principal, 1M) : 0731 mixte ~$0.135 ; 0423 ~$0.21 ; Pro ~$0.65. Activation 13B vs 49B.

Tableau composite (proxy) : 0731 ~#9 ; alias latest ~#8 ; 0423 ~#72 ; Pro ~#75. Le score favorise le long contexte bon marché.

Règle : batch/agent long → 0731 ; ancrer une ancienne route → 0423 ; fleuron à plus grande activation à ~4,8× mixte → Pro.

Comparatif prix et specs inter-éditeurs

Coût mixte (OpenRouter) : 0731 ~$0.135/1M. Contrastes : Llama 4 Scout ~$0.20 (#2), Luna Pro ~$0.35, Qwen3.7 Flash ~$0.08, MiniMax M3 ~$0.75, GLM-5.2 ~$1.59, Kimi K3 ~$9, Grok 4.5 ~$4, Sonnet 5 ~$6.

0731 est dans le « long contexte ultra-bon marché ». Texte seul : pour image/fichier, choisissez du multimodal. Comparaison specs/coût, pas benchmark de capacité.

Coût en pratique : deux scénarios

Calcul avec listing principal OpenRouter (hors tokens reasoning extra).

A — tour agent (100K in + 20K out) : 0731 ~$0.013 ; 0423 ~$0.020 ; Scout ~$0.016 ; Luna ~$0.022 ; Pro ~$0.061 ; K3 ~$0.60 ; Sonnet ~$0.40.

B — long document (500K in + 5K out) : 0731 ~$0.046 ; 0423 ~$0.071 ; Scout ~$0.052 ; Pro ~$0.222 ; K3 ~$1.58.

Conclusion : 0731 ramène les brouillons agent 1M au niveau des centimes ; la sortie ne coûte que 2× l’entrée. Comparaison specs/coût, pas benchmark de capacité.

Quand le choisir ou non

Choisir 0731 : brouillons agent/code à 1M avec budget minimal et texte seul. Épinglez l’ID ponctuel ; évitez la dérive silent de l’alias latest.

Éviter / ailleurs : multimodal → autre SKU ; fleuron à plus grande activation → Pro ; baseline 0423 → 0423 ; si Fireworks/Together est plus stable, routez à $0.14/$0.28.

Tranchez avec pages modèle/Token/compare/Trends ; le classement composite est un proxy contexte/$.

Checklist de déploiement

Avant intégration : utilisez `deepseek/deepseek-v4-flash-0731` explicite, séparé de 0423/Pro/latest ; confirmez reasoning/reasoning_effort/tools/structured_outputs ; budgétez avec le ratio réel et par hôte (OR $0.09/$0.18 vs FW/TG $0.14/$0.28).

Ops : surveillez les tokens par tour (reasoning inclus) ; testez troncature/latence en long contexte ; revérifiez Token et Trends. Prix selon le snapshot SQLite.

Insights