DefiRWA

 找回密码
 立即注册
搜索
热搜: 活动 交友 discuz
查看: 13|回复: 0

DeepSeek-V4-Flash再降价60%碾压GPT-5.6 Luna:中国大模型周调用14倍美国

[复制链接]

1190

主题

1201

帖子

4006

积分

版主

Rank: 7Rank: 7Rank: 7

积分
4006
发表于 2026-8-2 10:30:08 | 显示全部楼层 |阅读模式
2026年8月1日,AI产业同时发生两件标志性事件:OpenAI宣布将GPT-5.6 Luna降价80%试图应对来自DeepSeek的竞争压力;国际独立基准机构Artificial Analysis与Arena.ai同步更新DeepSeek-V4-Flash-0731正式版跑分——智能指数50分(仅比GPT-5.6 Luna的51分低1分),缓存命中约98%让V4-Flash单任务成本比Luna再低60%。同一天,央广网报道:中国开源模型累计下载量突破100亿次居全球首位,全球最大开源平台报告显示中国模型占下载量41%超越美国;OpenRouter 7-20至7-26统计数据显示中国大模型周调用量达到美国大模型的14倍,13周连续领跑全球。OpenAI降价+DeepSeek跑分逼近+中国模型调用量绝对领先,标志着"廉价+优质"双轮驱动的中国大模型正式进入"AI产业核心定价权"争夺阶段,AI产业从"美中技术差距"切换到"美中性价比+生态"双线竞速。


一、OpenAI GPT-5.6 Luna降价80%:闭源旗舰首次主动放弃利润

8月1日,OpenAI宣布将GPT-5.6 Luna降价80%——这是OpenAI自2024年GPT-4o以来首次对旗舰模型进行如此大幅度的价格调整。降价前的GPT-5.6 Luna定价:输入约12.5美元/百万tokens、输出约50美元/百万tokens。降价后:输入约2.5美元/百万tokens、输出约10美元/百万tokens。降价80%的直接触发因素是DeepSeek-V4-Flash正式版的上线——DeepSeek在7月31日悄然上线V4-Flash正式版API(V4-Flash-0731),输出价2元/百万tokens(缓存命中价0.2元/百万tokens),定价仅为GPT-5.6 Luna降价前的约1/225。OpenAI降价80%后,DeepSeek-V4-Flash的单任务成本仍比Luna低约60%(因为DeepSeek缓存命中率约98%远超OpenAI的90%)。

这次降价的战略意义远超"价格战"第一层意义是"闭源旗舰首次主动放弃让旗舰承担通用流量"——GPT-5.6 Luna降价80%意味着OpenAI把"日常使用场景"让给降价后的Luna,把"高价值场景"留给GPT-5.6 Sol(编程专用)、GPT-5.6 Terra(长上下文专用)。这与Anthropic 7-24发布Claude Opus 5时"Fable 5不再被当作日常模型,只承担专家模型角色"的战略如出一辙。第二层意义是"AI推理成本曲线进入'非对称下行'阶段"——DeepSeek-V4-Flash的"后训练优化"证明AI推理成本可以通过工程手段(非堆参数)持续压低,这意味着OpenAI/Anthropic的"高定价护城河"被结构性削弱。第三层意义是"价格战扩展到编程、长上下文、Agent三大场景"——OpenAI在7月底同步推出GPT-5.6 Sol编程专用版、GPT-5.6 Terra长上下文专用版定价差异化,但DeepSeek-V4-Flash在三个场景都有对应产品。


二、DeepSeek-V4-Flash:模型没动,性能暴涨的工程奇迹

DeepSeek-V4-Flash正式版(V4-Flash-0731)的九项Agent基准测试成绩呈现"反常识"的提升曲线。Terminal Bench 2.1(Linux终端自主规划与多步命令执行):82.7分,超过V4-Pro-Preview的72.1和GLM-5.2的81.0,逼近Claude Opus 4.8的85.0。NL2Repo(代码仓库理解与修改):从39.4提升至54.2(+37.6%)。CyberGym(网络安全场景):从38.7暴涨至76.7(+98%)。DeepSWE(长周期多步骤编程任务):从7.3飙升至54.4(+645%)——这是九项中涨幅最恐怖的指标。其余五项:Toolathlon-Verified 70.3、Agents' Last Exam 25.2、AutomationBench 25.1、DSBench-FullStack 68.7、DSBench-Hard 59.6。

Artificial Analysis智能指数(AII):V4-Flash-0731(最高推理档位)拿下50分,比4月发布的V4 Flash预览版高出10分,比自家V4 Pro还高6分,仅比GPT-5.6 Luna(最高51分)低1分Arena.ai前端代码竞技场榜单:V4-Flash-High拿到1586分,比预览版暴涨154分,比V4-Pro-Preview还高121分,直接冲进开放类别全球第三。值得强调的是,DeepSeek官方明确声明:V4-Flash-0731与预览版采用完全相同的模型架构和参数规模(284B总参+13B激活),能力提升主要来自后训练升级,并非扩大模型规模或更换底层架构。这是AI产业历史上罕见的"零模型变更、纯后训练优化带来质变"的工程案例。

为什么"只重做了后训练"能带来质变第一是强化学习数据构造策略升级——DeepSeek团队构造了更高质量的多轮Agent执行轨迹,让模型在"沙盒终端操作+代码生成+工具调用"三类场景获得更密集的正反馈信号。第二是在线蒸馏(Online Policy Distillation)的精细化——通过让V4-Pro-Preview(旗舰预览版)作为教师模型指导V4-Flash的学生模型,把旗舰模型的"决策模式"迁移到廉价模型。第三是测试时计算(Test-Time Compute)的动态调度——Agent任务在执行过程中根据难度动态切换"思考模式/非思考模式"。三者叠加才能让"廉价模型"在长周期任务上获得接近旗舰的能力。


三、中国大模型周调用量14倍美国:OpenRouter数据揭示的真实格局

OpenRouter 2026-07-20至07-26统计数据显示,中国大模型周调用量达到美国大模型的14倍,13周连续领跑全球。这一数据的结构性意义远超"国产模型能力强"——它揭示了AI应用层的真实分布。中国大模型调用量领先的核心驱动是三方面第一是价格优势:DeepSeek、通义千问、Kimi、文心一言等国产模型的API价格仅为OpenAI、Anthropic的1/10到1/90,开发者经济上倾向于使用国产模型。第二是中文场景适配:国产模型在中文理解、中文写作、中文知识库三个维度的能力优于海外模型,企业级应用(智能客服、内容生成、知识管理)首选国产模型。第三是Agent应用爆发:扣子、智谱清言、阿里通义、腾讯元宝等国产Agent平台2026年Q2用户量月增40%以上,Agent调用频次远高于ChatGPT类对话应用。

但调用量领先不等于"模型能力领先"Artificial Analysis智能指数测试中,中国大模型最高分是Kimi K3(72分),低于Claude Opus 4.8(89分)、GPT-5.6 Luna(85分)、Gemini 3 Ultra(82分)。调用量的领先更多反映"价格+本地化+应用层成熟度"三重优势,模型基础能力仍有差距这种"调用量领先但能力次一等"的格局,对国产大模型提出明确方向:通过工程化优化(推理加速、长上下文、价格策略)和开源生态共建,缩小"应用层领先"与"基础能力差距"的剪刀差。

中国开源模型累计下载量已突破100亿次居全球首位。全球每10次大模型下载中,就有6次来自中国研发的模型。在全球主流大模型调用榜单上,排名前六位的模型全部来自中国团队。过去12个月里,国产模型有9个月保持着全球开源模型的规模上限。月之暗面7-29完成F轮融资超35亿美元,投后估值达350亿美元——资本市场对"中国大模型"赛道给予巨额押注。开源模型领跑+闭源模型差异化(Fable 5/Opus 5定价回升+Claude Voice Mode等场景化产品)正形成"中国领先开源+美国领先闭源"的双极竞速。


四、对AI产业格局的深远影响

第一层影响是"AI产业链利润分配重构"。当DeepSeek-V4-Flash在智能指数上仅比GPT-5.6 Luna低1分,但单任务成本比Luna低60%时,AI应用层开发者的最优选择是"99%场景用DeepSeek+1%场景用闭源旗舰"。闭源旗舰的角色从"通用工具"切换到"专家工具"——只在闭源旗舰能力绝对领先2-3分的高价值场景使用。这对OpenAI/Anthropic的商业模式是结构性挑战:高定价护城河被廉价开源+优质开源双重削弱。第二层影响是"AI创业公司成本结构剧变"——任何AI应用层创业公司,如果不在2026年Q3-Q4切换到DeepSeek/Kimi/通义等国产开源模型,将面临"竞争对手用1/90成本提供同等服务"的成本劣势。

第三层影响是"AI Agent生态的中国话语权"。DeepSeek-V4-Flash原生支持Responses API格式并针对Codex进行了优化适配——Codex是OpenAI的智能体编码框架,本次适配意味着开发者可以"零代码改动"地将基于Codex构建的Agent迁移到DeepSeek。这是OpenAI生态与DeepSeek生态首次实现"接口级兼容",对OpenAI生态的开发者锁定效应形成实质冲击。DeepSeek-V4-Flash"白菜价"将让中小企业的AI开发团队(年调用量100亿tokens级),年成本从百万元级别降至千元级别——这意味着"AI Agent创业门槛"被结构性降低。


五、结论

DeepSeek-V4-Flash 8月1日跑分逼近GPT-5.6 Luna + OpenAI紧急降价80% + 中国大模型周调用量14倍美国,是2026年Q3 AI产业最具标志性的三件大事。它们共同指向一个结论:AI产业正式进入"性价比+生态"双线竞速阶段,闭源旗舰的定价护城河被结构性削弱。对中国AI产业来说,"应用层领先+开源生态领先+工程化能力领先"的三重优势正在转化为"市场主导力"。全球每10次大模型下载中6次来自中国模型、调用榜单前六全部是中国团队、月之暗面估值350亿美元——这是"中国AI"从"技术追赶者"切换到"产业定义者"的分水岭。可以预期,2026年Q4将出现"中国大模型出海欧美"加速——DeepSeek、Kimi、智谱、阿里通义、腾讯混元等头部中国模型将进入"欧美市场争夺战",与OpenAI/Anthropic/Google正面交锋"AI产业全球定价权"。


数据来源

网易《中国多部委密集发声AI+DeepSeek V4-Flash正式版跑分出炉+OpenAI安全事故再升级》(2026.08.01);TechWeb《DeepSeek-V4-Flash正式API上线》(2026.07.31);快科技《Kimi K3发布让华尔街蒸发3.2万亿元》(2026.08.01);央广网《中国开源模型下载量破百亿》(2026.08.01);今日头条《2026年8月1日AI领域热点汇总》(2026.08.01);ZAKER《月之暗面Kimi与阿里达成2万枚英伟达芯片算力协议》(2026.08.01);OpenRouter周度模型调用排行榜(openrouter.ai/rankings,2026.07.20-07.26);Artificial Analysis智能指数测试(artificialanalysis.ai,2026.08.01);Arena.ai前端代码竞技场榜单(arena.ai,2026.08.01);DeepSeek官方API更新日志(api-docs.deepseek.com,2026.07.31);Hugging Face Open LLM Leaderboard 8月数据(huggingface.co/spaces/open-llm-leaderboard,2026.08.01)。具体基准测试分数、定价数据、调用量数据以DeepSeek官方API文档与OpenRouter最新数据为最终依据。
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

QQ|货物清仓|Archiver|手机版|小黑屋|倒数|舒尔特|好邻卡|RWA+DeFi|融资计划|内购渠道|Github|Web4

GMT+8, 2026-9-5 10:32 , Processed in 0.093950 second(s), 20 queries .

Powered by Discuz! X3.4

Copyright © 2001-2023, Tencent Cloud.