仅靠训练层面刷新,DeepSeek 廉价模型在智能体基准测试中反超旗舰

7 月 31 日,DeepSeek 悄然把旗下廉价模型推上了智能体基准测试的领先位置:当天该公司向 Hugging Face 上传了新的 V4-Flash-0731 检查点,并将 V4-Flash API 在同一天转入公开测试阶段。模型架构原封未动,所有提升都来自一轮后训练流程,但这个小模型如今在 DeepSeek 已公布的全部智能体基准测试中,都击败了公司自家的 Pro 旗舰。

最受关注的结果显示出相比预览版的显著跃升。在开发者用于衡量智能体编程任务的 Terminal Bench 2.1 上,V4-Flash-0731 得分为 82.7,高于预览版的 61.8,也领先 V4-Pro 的 72.1。在软件工程基准 DeepSWE 上,该模型在一次刷新中从 7.3 跃升至 54.4。测试安全智能体性能的 Cybergym 则从 38.7 攀升至 76.7。这些提升看起来目标明确:同一轮后训练让该模型在多项智能体测试中与 GLM-5.2 和 Anthropic 的 Opus-4.8 大体相当,而推理时的体量仍小得多。

这些提升伴随着保留意见。基准数据由厂商自行报告,且是在 DeepSeek 内部 Harness 框架的最小模式下得出的,该框架尚未发布,因此独立评估的结果可能存在出入。另外两个测试集 DSBench-FullStack 和 DSBench-Hard 属于 DeepSeek 内部。公司自己的文档也提示,智能体得分对所用的 harness 相当敏感。

定价才是这次发布对开发者最具吸引力的地方。API 在缓存未命中时每百万输入 token 收费 0.14 美元,缓存命中时每百万收费 0.0028 美元,每百万输出 token 收费 0.28 美元,约为 V4-Pro 输出费率的三分之一。该模型保留了 2840 亿参数的混合专家(MoE)设计,每个 token 激活 130 亿参数,上下文窗口为 100 万 token,在高推理强度下最多可输出 384,000 个 token。检查点附带 DeepSeek 的 DSpark 投机解码模块,公司称在吞吐量匹配的部署方式下,该模块可使每用户生成速度提升 60% 至 85%。

Support independent reporting built on evidence, transparency, and scientific rigor.

Become a supporter

API 的升级路径被刻意设计得毫无障碍:从预览版切换过来的开发者只需修改客户端代码里的模型标识符。新版本原生支持 Responses API 格式,并针对 Codex 做了适配,瞄准的正是 DeepSeek 似乎预期将主导流量的智能体与编程工作负载。本次发布没有更新 V4-Pro 的 API 和 App 模型。

对于完全不想使用托管 API 的团队,模型权重以 MIT 许可发布且无需申请即可获取,支持本地部署。这条路并不轻松:按 DeepSeek 的 vLLM 参考配置,全精度部署需要一个四节点 GB300 集群;激进量化则可将需求降至内存与显存合计约 110 GB,Unsloth 的无损 8 位版本约需 162 GB,3 位版本约需 103 GB。

战略信号在于模型的梯次布局:DeepSeek 正以三分之一的价格把日常智能体与编程流量引向 Flash,同时把最难的推理工作负载留给 Pro。这次刷新让初创公司和独立开发者以相当于同类专有模型一小部分的成本,获得接近旗舰水平的智能体能力。

婷 翻译

Sources: DeepSeek Upgrades DeepSeek-V4-Flash-0731 with Major Agentic and Coding Gains (MarkTechPost, July 31, 2026); DeepSeek-V4-Flash-0731 model card (Hugging Face); DeepSeek puts V4-Flash API into public beta (TechNode, July 31, 2026); DeepSeek API pricing (DeepSeek)

Scroll to Top