DefiRWA

 找回密码
 立即注册
搜索
热搜: 活动 交友 discuz
查看: 13|回复: 0

DeepSeek-V4-Flash正式版上线:模型没改DeepSWE暴涨6倍+1元买Claude服务

[复制链接]

1190

主题

1201

帖子

4006

积分

版主

Rank: 7Rank: 7Rank: 7

积分
4006
发表于 2026-8-1 12:47:06 | 显示全部楼层 |阅读模式
2026年7月31日晚,DeepSeek悄然上线V4-Flash正式版API(版本号V4-Flash-0731),没有发布会、没有直播,只在更新日志里写了一行"Agent能力大幅增强"。然而开发者社区在12小时内彻底炸锅——这款2840亿参数MoE架构、激活仅130亿的"廉价版"模型,DeepSWE评分从预览版7.3暴涨到54.4(+644%),Terminal Bench 2.1拿到82.7分(超越自家V4-Pro-Preview的72.1和智谱GLM-5.2的81.0),Arena.ai前端代码榜直接冲到开放类别全球第三。最让开发者震撼的不是性能,而是"只重做了后训练,模型骨架一点没变"。输出价低至2元/百万tokens、缓存命中价0.2元/百万tokens——按官方定价折算,调用一次Claude Opus级服务的钱,可以调用DeepSeek-V4-Flash 90次。


一、九项Agent基准全面碾压:模型没动,性能暴涨的工程奇迹

DeepSeek官方公布的九项Agent基准测试数据呈现出"反常识"的提升曲线。第一项是Terminal Bench 2.1(Linux终端自主规划与多步命令执行):82.7分,超过V4-Pro-Preview的72.1和GLM-5.2的81.0,仅落后Claude Opus 4.8的85.0约2.3分。这一项是"Agent能否独立操作系统"的实战测试。第二项是NL2Repo(代码仓库理解与修改):从39.4提升至54.2(+37.6%),考察Agent能否理解真实代码库上下文并生成可执行补丁。第三项是CyberGym:从38.7暴涨至76.7(+98%),测试Agent在网络安全场景中识别漏洞、利用漏洞的实战能力。第四项是DeepSWE(专门评估长周期、多步骤编程任务的自主解决能力):从7.3飙升至54.4(+645%),是九项中涨幅最恐怖的指标。

其余五项同样表现亮眼:Toolathlon-Verified 70.3、Agents' Last Exam 25.2、AutomationBench 25.1、DSBench-FullStack 68.7、DSBench-Hard 59.6。第三方评测平台Artificial Analysis的智能指数测试中,V4-Flash-0731(最高推理档位)拿下50分,而同类可比模型中位数仅17分——高出近3倍。Arena.ai的前端代码竞技场榜单上,V4-Flash-High拿到1586分,比预览版暴涨154分,比V4-Pro-Preview还高121分,直接冲进开放类别全球第三。

值得强调的是DeepSeek官方明确声明:V4-Flash-0731与预览版采用完全相同的模型架构和参数规模(284B总参+13B激活),能力提升主要来自后训练升级,并非扩大模型规模或更换底层架构。这是AI产业历史上罕见的"零模型变更、纯后训练优化带来质变"的工程案例。


二、为什么"只重做了后训练"能带来质变

后训练优化的空间被严重低估,是本次DeepSeek-V4-Flash正式版给行业最深的启示。传统大模型迭代路径是"堆参数+换架构+扩数据",但MoE架构已经证明:当总参数达到2800亿量级后,参数边际收益急剧递减。DeepSeek的突破点在于后训练阶段的三项精细化优化第一是强化学习数据构造策略升级:传统RLHF依赖"人类偏好排序",DeepSeek团队构造了更高质量的多轮Agent执行轨迹,让模型在"沙盒终端操作+代码生成+工具调用"三类场景获得更密集的正反馈信号。第二是在线蒸馏(Online Policy Distillation)的精细化:通过让V4-Pro-Preview(旗舰预览版)作为教师模型指导V4-Flash的学生模型,在不改变学生模型结构的前提下,把旗舰模型的"决策模式"迁移到廉价模型。第三是测试时计算(Test-Time Compute)的动态调度:Agent任务在执行过程中可以根据难度动态切换"思考模式/非思考模式",简单任务用快速路径,复杂任务启用深度推理。

这三项优化的协同效应在DeepSWE评分上体现得最充分——DeepSWE考察的是"长周期多步骤编程任务",单一后训练优化很难获得这种量级的提升。DeepSeek的解法是:先用RL数据让模型"敢执行"(不再回避高风险操作),再用OPD蒸馏让模型"会执行"(模仿旗舰的决策模式),最后用Test-Time Compute动态调度让模型"省执行"(按需启用深度推理)。三者叠加才能让"廉价模型"在长周期任务上获得接近旗舰的能力。


三、价格碾压:1元能买Claude服务90次

DeepSeek-V4-Flash正式版的定价延续了DeepSeek一贯的"白菜价"策略。输出价2元/百万tokens、缓存命中价0.2元/百万tokens,对比Claude Opus 4.8的约180元/百万tokens(输出)和约45元/百万tokens(缓存命中),DeepSeek的输出价仅为Claude的约1/90,缓存命中价仅为Claude的约1/225。开发者社区实测数据显示:使用V4-Flash-0731跑一小时Agent代码任务,调用成本不到1元人民币,缓存命中率高达98-99%。这意味着任何一家中小企业的AI开发团队(年调用量100亿tokens级),如果切换到DeepSeek-V4-Flash,年成本可从百万元级别降至千元级别。

更关键的是DeepSeek-V4-Flash原生支持Responses API格式并针对Codex进行了优化适配。Codex是OpenAI的智能体编码框架,本次适配意味着开发者可以"零代码改动"地将基于Codex构建的Agent迁移到DeepSeek。这是OpenAI生态与DeepSeek生态首次实现"接口级兼容",对OpenAI生态的开发者锁定效应形成实质冲击。


四、对全球AI Agent生态的冲击

DeepSeek-V4-Flash正式版的影响远超"又一款开源模型发布"。第一层冲击是"闭源旗舰的护城河被廉价开源挑战":Claude Opus 4.8、GPT-5.6 Luna等顶级闭源模型虽然仍领先2-3分,但价差是90倍以上。对Agent应用层开发者,"99%场景用DeepSeek+1%场景用闭源旗舰"成为经济上最优的选择。第二层冲击是"Agent测试标准的可信度重塑":本次DeepSeek官方注明分数是在自研Harness极简模式下跑的(max档位+topp=0.95+temperature=1.0),自研框架测自家模型存在"框架红利"风险。社区呼吁第三方平台(Artificial Analysis、Arena.ai)建立"中立测试基准",避免厂商选择性披露。第三层冲击是"开源模型的工程化能力上限被重估":传统观点认为"开源模型=能力次一等",但DeepSeek-V4-Flash证明"开源+精细化后训练"可以逼近闭源旗舰。这意味着DeepSeek-V4-Pro正式版一旦发布(DeepSeek已预告"尽快发布"),可能在Agent能力上与Claude Opus 4.8、GPT-5.6 Luna正面交锋。


五、结论

DeepSeek-V4-Flash正式版上线是2026年Q3 AI产业最具颠覆性的事件之一。它证明了三件事:第一,"堆参数"不是唯一出路,后训练优化的空间远大于行业预期; 第二,"开源vs闭源"的二元对立正在让位于"分层共存"——开源廉价模型承担90%场景,闭源旗舰承担10%高价值场景; 第三,AI Agent的工程化竞争从"模型规模"切换到"后训练数据+测试时计算调度+智能体框架适配"三位一体的精细化运营。 对中国AI产业来说,DeepSeek-V4-Flash是"国产开源模型在Agent能力上完成对闭源旗舰追赶"的标志性事件。可以预期,2026年Q4将出现"后训练优化"成为大模型竞赛新主战场——MoE架构的总参数竞赛降温,针对特定Agent场景的强化学习数据构造+在线蒸馏+Test-Time Compute调度的精细化能力将成为决胜点。


数据来源

TechWeb《DeepSeek-V4-Flash正式API上线》(2026.07.31);金融界《DeepSeek-V4-Flash正式版上线公测》(2026.08.01);云头条《DeepSeek-V4-Flash 正式 API 上线》(2026.08.01);微博 @8006029702《DeepSeekV4Flash正式版跑分出炉》(2026.08.01);微博 @7876646016《DeepSeek-V4-Flash跑分出炉》(2026.08.01);博客园 rangsh《DeepSeek V4 Flash 正式版:成绩碾压 Pro 预览版》(2026.08.01);DeepSeek官方API更新日志(api-docs.deepseek.com,2026.07.31);Artificial Analysis智能指数测试(artificialanalysis.ai,2026.08.01);Arena.ai前端代码竞技场榜单(arena.ai,2026.08.01)。具体基准测试分数、定价数据、缓存命中率以DeepSeek官方API文档与Artificial Analysis最新数据为最终依据。
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

QQ|货物清仓|Archiver|手机版|小黑屋|倒数|舒尔特|好邻卡|RWA+DeFi|融资计划|内购渠道|Github|Web4

GMT+8, 2026-9-5 11:20 , Processed in 0.058535 second(s), 20 queries .

Powered by Discuz! X3.4

Copyright © 2001-2023, Tencent Cloud.