DeepSeek官方公布的九项Agent基准测试数据呈现出"反常识"的提升曲线。第一项是Terminal Bench 2.1(Linux终端自主规划与多步命令执行):82.7分,超过V4-Pro-Preview的72.1和GLM-5.2的81.0,仅落后Claude Opus 4.8的85.0约2.3分。这一项是"Agent能否独立操作系统"的实战测试。第二项是NL2Repo(代码仓库理解与修改):从39.4提升至54.2(+37.6%),考察Agent能否理解真实代码库上下文并生成可执行补丁。第三项是CyberGym:从38.7暴涨至76.7(+98%),测试Agent在网络安全场景中识别漏洞、利用漏洞的实战能力。第四项是DeepSWE(专门评估长周期、多步骤编程任务的自主解决能力):从7.3飙升至54.4(+645%),是九项中涨幅最恐怖的指标。
其余五项同样表现亮眼:Toolathlon-Verified 70.3、Agents' Last Exam 25.2、AutomationBench 25.1、DSBench-FullStack 68.7、DSBench-Hard 59.6。第三方评测平台Artificial Analysis的智能指数测试中,V4-Flash-0731(最高推理档位)拿下50分,而同类可比模型中位数仅17分——高出近3倍。Arena.ai的前端代码竞技场榜单上,V4-Flash-High拿到1586分,比预览版暴涨154分,比V4-Pro-Preview还高121分,直接冲进开放类别全球第三。
DeepSeek-V4-Flash正式版的定价延续了DeepSeek一贯的"白菜价"策略。输出价2元/百万tokens、缓存命中价0.2元/百万tokens,对比Claude Opus 4.8的约180元/百万tokens(输出)和约45元/百万tokens(缓存命中),DeepSeek的输出价仅为Claude的约1/90,缓存命中价仅为Claude的约1/225。开发者社区实测数据显示:使用V4-Flash-0731跑一小时Agent代码任务,调用成本不到1元人民币,缓存命中率高达98-99%。这意味着任何一家中小企业的AI开发团队(年调用量100亿tokens级),如果切换到DeepSeek-V4-Flash,年成本可从百万元级别降至千元级别。
DeepSeek-V4-Flash正式版的影响远超"又一款开源模型发布"。第一层冲击是"闭源旗舰的护城河被廉价开源挑战":Claude Opus 4.8、GPT-5.6 Luna等顶级闭源模型虽然仍领先2-3分,但价差是90倍以上。对Agent应用层开发者,"99%场景用DeepSeek+1%场景用闭源旗舰"成为经济上最优的选择。第二层冲击是"Agent测试标准的可信度重塑":本次DeepSeek官方注明分数是在自研Harness极简模式下跑的(max档位+topp=0.95+temperature=1.0),自研框架测自家模型存在"框架红利"风险。社区呼吁第三方平台(Artificial Analysis、Arena.ai)建立"中立测试基准",避免厂商选择性披露。第三层冲击是"开源模型的工程化能力上限被重估":传统观点认为"开源模型=能力次一等",但DeepSeek-V4-Flash证明"开源+精细化后训练"可以逼近闭源旗舰。这意味着DeepSeek-V4-Pro正式版一旦发布(DeepSeek已预告"尽快发布"),可能在Agent能力上与Claude Opus 4.8、GPT-5.6 Luna正面交锋。