DeepSeek V4 Flash 0731 深度评测:1M 上下文 MoE,OpenRouter 仅 $0.09/$0.18

284B/13B 稀疏 MoE、100 万 token 上下文、reasoning/tools;OpenRouter 主 listing $0.09/$0.18。HF Hot 增长 +64%,目录首次出现 2026-08-01——本站综合榜 #9(上下文/美元代理指标,非能力分)。

DeepSeek V4 Flash — 高速稀疏 MoE 概念图 点击放大图片
Flash:稀疏激活,冲向长上下文吞吐

它是什么

DeepSeek V4 Flash 0731(`deepseek/deepseek-v4-flash-0731`)是 DeepSeek V4 线里偏「效率」的一档:目录描述为稀疏 MoE,总参数 284B、激活约 13B,面向编码、推理与 agent 工作流,并支持 100 万 token 上下文。相对同门 V4 Pro(1.6T / 49B 激活),Flash 用更小的激活规模换吞吐与低单价。

站内 `ops_model_first_seen` 记录 0731 修订于 2026-08-01 入库;更早的 Flash 0423 与 V4 Pro 同在 2026-06-22 首次出现。0731 被描述为 re-post-trained 修订——选型时把它当成「同家族、更新训练/对齐」的定点 SKU,而不是另一个模型名营销号。

社区侧,本快照 HF Hot 将 DeepSeek-V4-Flash-0731 排在 Kimi-K3 之后(sort_index=1),24h 增长 +64%,HF 下载约 23.6 万;另有 unsloth GGUF 派生同榜。热度信号强,但下载量≠生产就绪——仍以规格与多 host 报价做决策。

规格速览(参数党)

稀疏 MoE:284B 总量,约 13B 激活 点击放大图片
多数专家休眠,少数路径点亮

硬指标(`core_model`):上下文 1,048,576;模态 `text->text`(输入/输出均为文本,非多模态)。API 暴露 20 个参数,含 frequency_penalty、include_reasoning、logit_bias、logprobs、max_tokens、min_p、presence_penalty、reasoning、reasoning_effort、repetition_penalty、response_format、seed、stop、structured_outputs、temperature、tool_choice、tools、top_a、top_k、top_logprobs、top_p。

相对 Flash 0423:同为 1M 上下文与 text→text,参数表几乎对齐(均含 reasoning_effort、top_a)。相对 V4 Pro:同样 1M,但 Pro 参数表略窄(无 top_a),定位是更大激活规模的旗舰 MoE。本快照未披露 0731 知识截止日期。厂商:DeepSeek。

价格与在哪调用

V4 家族价格阶梯示意 点击放大图片
0731 落在阶梯底部:同族最便宜的一档

Flash 0731:OpenRouter 主 listing(is_primary_listing=1)为每百万 token 输入 $0.09、输出 $0.18。Fireworks 与 Together 上同模型为 $0.14/$0.28(model_bound_verified)——路由时不要默认「处处都是 $0.09」。Fireworks 另露出 cached input $0.028/1M。

同门对照(OpenRouter 主 listing):Flash 0423 为 $0.14/$0.28;V4 Pro 为 $0.435/$0.87;更早的 V3.2 约 $0.269/$0.40。0731 比 0423 便宜约 36%(输入),输出同比例下降——修订版同时带来价格信号。

DeepInfra / deepseek-direct 在本快照主要挂在 0423 / Pro 上;0731 的已验证多 host 以 OpenRouter + Fireworks + Together 为主。上线前在 Token 页再扫一遍覆盖。

家族阶梯:Flash 0423 → Flash 0731 → V4 Pro(测评)

同快照 DeepSeek V4 阶梯(OpenRouter 主 listing,1M 对齐):Flash 0731 混合约 $0.135/1M;Flash 0423 约 $0.21;V4 Pro 约 $0.65。激活规模:Flash 线 13B vs Pro 49B;总参数 284B vs 1.6T。

综合榜(上下文/美元代理指标,非能力 benchmark):Flash 0731 约 #9;`~deepseek/deepseek-v4-flash-latest` 别名约 #8;Flash 0423 约 #72;V4 Pro 约 #75。代理分奖励「便宜 + 长上下文」——正是 0731 的画像,因而名次远高于更贵的 Pro。

选型口诀:默认长上下文批处理/agent 草稿 → 0731;必须钉住旧路由或旧评测基线 → 0423;要目录更大激活旗舰且愿付约 4.8× 混合价 → V4 Pro。

跨厂价格与规格对比(测评)

混合价(OpenRouter 主 listing 均值):Flash 0731 约 $0.135/1M(1.0M ctx,text→text)。对照:Llama 4 Scout 约 $0.20(1.3M,综合榜 #2)、GPT-5.6 Luna Pro 约 $0.35、Qwen3.7 Flash 约 $0.08、MiniMax M3 约 $0.75、GLM-5.2 约 $1.59、Kimi K3 约 $9、Grok 4.5 约 $4、Sonnet 5 约 $6。

0731 落在「超便宜长上下文」带,与 Scout / Luna / Qwen Flash 同区,但社区 HF 热度与 DeepSeek 家族叙事更强。注意:0731 是纯文本;需要图像/文件输入时请换多模态型号。以上为规格与成本对比,非能力基准测试。

成本实测:两个场景(测评)

按本快照 OpenRouter 主 listing 推算(不含额外 reasoning token)。

场景 A — agent 编码一轮(10 万输入 + 2 万输出):Flash 0731 约 $0.013;Flash 0423 约 $0.020;Llama 4 Scout 约 $0.016;Luna Pro 约 $0.022;V4 Pro 约 $0.061;MiniMax M3 约 $0.054;Kimi K3 约 $0.60;Sonnet 5 约 $0.40。

场景 B — 长文档一轮(50 万输入 + 5 千输出):0731 约 $0.046;0423 约 $0.071;Scout 约 $0.052;Luna 约 $0.053;Pro 约 $0.222;K3 约 $1.58。

结论:0731 把「百万级上下文 agent 草稿」压到美分级;相对 K3/Sonnet 是数量级差距,相对 Scout 仍更便宜一截。输出价仅 2× 输入——输出偏重循环也不像 5× 输出档那么刺痛。以上为规格与成本对比,非能力基准测试。

何时选它、何时别选

选 Flash 0731:需要 1M 上下文的编码/推理/agent 草稿,预算极敏感,且接受 text→text;希望吃到 HF 热度最高的 DeepSeek 效率档,并可用 OpenRouter 的 $0.09/$0.18 起量。默认钉 0731 定点 ID,避免 silent 漂到别的 latest 别名行为。

别选 / 看别的:必须多模态输入 → 换图像能力型号;要更大激活旗舰叙事且预算够 → V4 Pro;必须钉 0423 旧基线 → 保留 0423;若 Fireworks/Together 路径更稳但接受 $0.14/$0.28,按 host 报价路由,而不是死守 OpenRouter 标价。

用 AI Hippo 模型页、Token 页、对比页与 Trends 做定量取舍;综合榜是上下文/美元代理指标,不是能力 benchmark。

落地检查清单

集成前:路由层显式使用 `deepseek/deepseek-v4-flash-0731`,与 0423 / Pro / `~deepseek/deepseek-v4-flash-latest` 分开;确认 harness 支持 reasoning、reasoning_effort、tools、structured_outputs;按真实输入输出比做预算,并按 host 分支(OpenRouter $0.09/$0.18 vs Fireworks/Together $0.14/$0.28)。

运维侧:对 agent 环监控每轮 token(含 reasoning);长上下文场景单独压测截断与延迟;定期对照 Token 页与 Trends(HF Hot)。数据口径以本站 SQLite 快照为准,上线前再跑一次核对单价。

洞察