Análise do DeepSeek V4 Flash 0731: MoE com contexto 1M a $0.09/$0.18 no OpenRouter
MoE esparso 284B/13B, contexto 1M, reasoning/tools; listing principal OpenRouter $0.09/$0.18. HF Hot +64%, primeira aparição 2026-08-01. Ranking composto #9 (proxy contexto/$, não capacidade).
Ampliar imagem O que é
DeepSeek V4 Flash 0731 (deepseek/deepseek-v4-flash-0731) é o patamar eficiente da linha V4: MoE esparso com 284B totais e ~13B ativos, voltado a código, raciocínio e fluxos agent, com contexto de 1M tokens. Perante V4 Pro (1.6T / 49B ativos), Flash troca escala de ativação por throughput e preço baixo.
ops_model_first_seen regista a revisão 0731 em 2026-08-01; Flash 0423 e V4 Pro em 2026-06-22. O catálogo chama-lhe revisão re-post-trained: trate como SKU pontual da mesma família.
No HF Hot fica logo após Kimi-K3 (sort_index=1), +64% e ~236K downloads. O calor importa, mas download ≠ pronto para produção: decida com specs e cotações multi-host.
Ficha técnica num relance
Ampliar imagem Números (core_model): contexto 1.048.576; modalidade text->text. Expõe 20 parâmetros API, incluindo reasoning, reasoning_effort, tools, structured_outputs e top_a.
Vs Flash 0423: mesmo 1M e text→text, lista quase alinhada. Vs V4 Pro: mesmo 1M, lista um pouco mais curta (sem top_a) e maior escala de ativação. Sem corte de conhecimento para 0731 neste snapshot. Fornecedor: DeepSeek.
Preço e onde usar
Ampliar imagem Flash 0731: listing principal OpenRouter a $0.09/$0.18. Fireworks e Together a $0.14/$0.28 (verificado): não assuma $0.09 em todos os hosts. Fireworks expõe cached input $0.028.
Família (OpenRouter): 0423 $0.14/$0.28; Pro $0.435/$0.87; V3.2 ~$0.269/$0.40. 0731 é ~36% mais barato na entrada que 0423. Confira cobertura na página Token.
Escada da família: Flash 0423 → 0731 → V4 Pro
Escada V4 (OpenRouter principal, 1M): 0731 misto ~$0.135; 0423 ~$0.21; Pro ~$0.65. Ativação 13B vs 49B.
Quadro composto (proxy): 0731 ~#9; alias latest ~#8; 0423 ~#72; Pro ~#75. O score premia contexto barato.
Regra: batch/agent longo → 0731; fixar rota antiga → 0423; carro-chefe de maior ativação a ~4,8× misto → Pro.
Comparativo de preço e specs entre fornecedores
Custo misto (OpenRouter): 0731 ~$0.135/1M. Contraste: Llama 4 Scout ~$0.20 (#2), Luna Pro ~$0.35, Qwen3.7 Flash ~$0.08, MiniMax M3 ~$0.75, GLM-5.2 ~$1.59, Kimi K3 ~$9, Grok 4.5 ~$4, Sonnet 5 ~$6.
0731 cai em «contexto longo ultra-barato». É só texto: para imagem/arquivo escolha multimodal. Comparação de specs/custo, não benchmark de capacidade.
Custo na prática: dois cenários
Cálculo com listing principal OpenRouter (sem tokens reasoning extra).
A — turno agent (100K in + 20K out): 0731 ~$0.013; 0423 ~$0.020; Scout ~$0.016; Luna ~$0.022; Pro ~$0.061; K3 ~$0.60; Sonnet ~$0.40.
B — documento longo (500K in + 5K out): 0731 ~$0.046; 0423 ~$0.071; Scout ~$0.052; Pro ~$0.222; K3 ~$1.58.
Conclusão: 0731 deixa rascunhos agent de 1M em centavos; a saída custa só 2× a entrada. Comparação specs/custo, não benchmark de capacidade.
Quando escolher e quando não
Escolha 0731: rascunhos agent/código a 1M com orçamento mínimo e só texto. Fixe o ID pontual; evite deriva silent do alias latest.
Evite / veja outro: multimodal → outro SKU; carro-chefe de maior ativação → Pro; baseline 0423 → 0423; se Fireworks/Together for mais estável, roteie a $0.14/$0.28.
Decida com páginas modelo/Token/compare/Trends; o ranking composto é proxy contexto/$.
Checklist de implantação
Antes de integrar: use deepseek/deepseek-v4-flash-0731 explícito, separado de 0423/Pro/latest; confirme reasoning/reasoning_effort/tools/structured_outputs; orce com proporção real e por host (OR $0.09/$0.18 vs FW/TG $0.14/$0.28).
Ops: monitore tokens por turno (com reasoning); teste truncamento/latência em contexto longo; revise Token e Trends. Preços conforme snapshot SQLite.