DefiRWA

 找回密码
 立即注册
搜索
热搜: 活动 交友 discuz
查看: 14|回复: 0

6月AI模型格局大洗牌:Fable 5登顶、国产三强突围,DeepSeek颠覆成本曲线

[复制链接]

895

主题

906

帖子

3035

积分

版主

Rank: 7Rank: 7Rank: 7

积分
3035
发表于 2026-7-1 07:20:42 | 显示全部楼层 |阅读模式
2026年6月是AI大模型领域近年来变化最密集的一个月。短短两周内,Anthropic发布Claude Fable 5、谷歌推出DiffusionGemma、美团LongCat-2.0开源、月之暗面更新Kimi K2.7 Code、智谱发布GLM-5.2——一个旧的排行榜刚刚确立,就被新一批发布打乱。本文整理6月以来最关键的模型动态和数据,帮你在信息洪流中找到真正值得关注的信号。


一、Claude Fable 5:SWE-Bench Pro 80.3%,24小时迁移5000万行代码

6月9日,Anthropic同时发布了Claude Fable 5和Claude Mythos 5。这次发布的独特之处在于双轨制结构:两款模型基于完全相同的底层架构和权重,但面向不同的访问群体。Fable 5向公众开放,内置动态风险控制机制——当用户的请求触及网络安全、生物研究、化学等高风险领域时,系统会自动回退到Claude Opus 4.8处理;Mythos 5则仅向经过资质审核的研究机构和企业开放,没有这层限制。

能力数据是这次发布最有说服力的部分。在衡量真实世界软件工程能力的SWE-Bench Pro评测中,Claude Fable 5拿到80.3%的得分——比GPT-5.5的58.6%高出近22个百分点。在安全攻防能力评测ExploitBench上,Fable 5得到78.0%;在Epoch AI主导的Humanity's Last Exam(含工具调用版)上,得分64.5%。

最能体现Fable 5实际工程能力的是一个具体案例:在Anthropic与合作企业的内部测试中,该模型在24小时内完成了5000万行Ruby代码的迁移任务——这个体量通常需要一个十人工程师团队跑数月。

价格方面,Fable 5定价为每百万输入token 10美元、每百万输出token 50美元,比Opus 4.8贵了整整一倍。Anthropic的策略很明确:Fable 5是旗舰产品,面向的是有高强度代码和知识工作需求、愿意为顶级性能付更高溢价的用户。


二、综合排行榜:三家巨头的得分与位次重组

在Artificial Analysis综合智能指数(AAII v4.0)上:

| 模型 | 综合得分 | 关键特征 |
|------|----------|----------|
| Claude Opus 4.8 | 61.4 | 历史上首个突破60分 |
| GPT-5.5 | 60.2 | 综合高但幻觉率86% |
| Gemini 3.1 Pro | 57.8 | 多模态原生视频输入 |

GPT-5.5的争议比较集中:综合评分虽然高,但在真实世界幻觉(Hallucination)测试中,错误率高达86%,显著高于同档次竞争对手。OpenAI方面表示GPT-5.6将在6月底前发布,并重点针对幻觉问题做专项优化。

Gemini 3.1 Pro虽然综合排名第三,但它是本轮评测中多模态能力最强的模型——原生支持视频输入(mp4/mov/webm,最长5分钟,1080p),是具备完整视频处理能力的六款模型之一,价格也是三巨头中最低的(输入2美元/百万tokens,输出12美元)。

值得一提的是谷歌6月10日开源的DiffusionGemma 26B-A4B。这款专注扩散式文本生成的开源模型,参数量约26B(激活约4B),代表谷歌在开源生态上的一次另辟蹊径——用扩散路线探索不同于自回归的可能性。


三、国产开源三强:DeepSeek、Kimi、GLM、LongCat各有斩获

6月的另一条重要线索是中国开源模型的集体更新。

| 模型 | 参数量 | AAII v4.0 | 关键定位 |
|------|--------|-----------|----------|
| DeepSeek V4-Pro | 1.6万亿 | - | 技术极限型 |
| LongCat-2.0 | 1.6万亿 | - | 业务驱动+全栈开源 |
| Kimi K2.7 Code | 1.1万亿 | 54 | 垂类专精(代码) |
| GLM-5.2 | 7540亿 | 51 | 本地生态 |

DeepSeek V4-Pro在知识推理类评测SimpleQA-Verified上得分57.9,领先开源第二名超过20个百分点。长上下文处理是另一个亮点:在MRCR 1M MMR评测(百万token上下文检索)中得分83.5,超过Gemini 3.1 Pro的76.3。

美团LongCat-2.0(6月30日发布)则把国产大模型推上"业务派"路线——5万卡国产算力全流程训练,Infra框架+推理引擎+模型参数三位一体同步开源。

6月12日,月之暗面更新了Kimi K2.7 Code,这是专注代码任务的专用模型,在编程场景下的SWE-Bench评测中比通用版K2.6提升了约8个百分点。6月16日,智谱GLM-5.2正式发布,中文理解、多轮对话和知识密度都有优化。


四、成本曲线颠覆:DeepSeek的性价比意味着什么

如果说能力排行是"明线",那么成本的分化才是行业格局演变的"暗线"。

6月的定价数据大致如下:

| 模型 | 输入(美元/百万tokens) | 输出(美元/百万tokens) |
|------|----------------------|----------------------|
| Claude Fable 5 | 10 | 50 |
| Claude Opus 4.8 | 5 | 25 |
| GPT-5.5 | 5 | 30 |
| Gemini 3.1 Pro | 2 | 12 |
| DeepSeek V4-Pro | 0.28 | 0.42 |

Artificial Analysis的测算数据显示,DeepSeek V4-Pro的能力性价比(capability-per-dollar)约为171.9,是Claude Opus 4.8的31倍

这个数字的直观意义是:如果业务是纯API调用量驱动型(文档处理、批量摘要、RAG检索),同样的预算用DeepSeek V4-Pro可以处理的任务量是用Claude Opus 4.8的数十倍

越来越多的技术团队采用"多模型路由"策略:对精度要求极高的任务用Claude系列,中等复杂度的日常任务用Gemini 3.1 Pro,高频批量处理类任务用DeepSeek V4-Pro,所有任务共享同一套API调用层。


五、六月周期对2026下半年的三个预测

预测一:闭源旗舰的护城河收窄至"最后15%性能差"

当"可商用的强大推理能力"价格已降到不足0.3美元/百万tokens,OpenAI、Anthropic们的护城河越来越依赖于"那最后15%-20%的性能优势"以及围绕旗舰模型建立的工具链、部署环境和企业服务体系。

预测二:开源生态从"权重开源"升级到"全栈开源"

DeepSeek、LongCat都把训练框架、推理引擎纳入了开源范围。开源正在从"能跑"升级为"能复现、能微调、能部署到任意硬件栈"。

预测三:选型窗口期已至

六月的密集发布反而让选型更清晰:极少数场景需要顶级旗舰(Fable 5/Opus 4.8),更多场景需要的是合适价位、稳定可用的中档模型(Gemini 3.1 Pro),开源模型(DeepSeek/LongCat/Kimi)则填补了大量"不需要最好、只需要够用"的需求缺口。

对于企业AI采购,建议Q3做一次完整的多模型路由测试,把供应商从单一锁定转向"2-3家分场景组合"。

数据来源:Artificial Analysis Intelligence Index v4.0、LM Council Benchmarks、Scale AI评测、Anthropic/OpenAI/Google/月之暗面/智谱/美团官方公告(2026年6月)。
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

QQ|货物清仓|Archiver|手机版|小黑屋|倒数|舒尔特|好邻卡|RWA+DeFi|融资计划|内购渠道|Github|Web4

GMT+8, 2026-7-22 09:30 , Processed in 0.071102 second(s), 20 queries .

Powered by Discuz! X3.4

Copyright © 2001-2023, Tencent Cloud.