关键基准数据:
• PaperBench 93.0(较上代 +28.2 分)——衡量 AI 自动复现顶尖 AI 论文的端到端能力,含代码 + 实验 + 写作;
• OSWorld-Verified 86.1(主流模型全球第一)——评估 AI 在桌面操作系统中完成真实任务的能力(订机票、装软件、编辑文档等);
• CodeArena 全球第四——编程 Agent 端到端评估;
• Vision Arena 全球第二——多模态理解与视觉推理;
• Arena 整体性能仅次于 Anthropic Claude 系列——综合榜单全球第一梯队。
与竞品的直接对比:阿里同时披露了与 Claude Opus 4.8 / Claude Fable 5 / OpenAI GPT-5.6 Sol 在编程基准测试上的对比结果——Anthropic 用 Claude Code 跑、OpenAI 用 Codex 跑,SWE-bench Pro 与阿里自研的 NL2Repo-Bench 评测集上 Qwen3.8-Max 接近 Claude 旗舰。Forrester 副总裁兼首席分析师查理·戴(Charlie Dai)评论:"阿里巴巴确实在缩小差距,但更重要的故事是开放权重模型的快速成熟——企业用户在软件工程、领域定制、数据主权以及成本敏感型部署场景中,已经拥有越来越可信的替代方案,开放性的价值往往不亚于模型的绝对性能。"
四、对开发者与企业用户的实操影响
对开发者:
• API 价格优势——千问 API 价格延续 Qwen3.5 的"性价比斩杀线",每百万 Token 输出价远低于 Claude Opus / GPT-5.6;
• 本地部署选型——个人 / 中小团队用 Qwen3.8-27B(已开源权重的稠密版),大型企业用 Qwen3.8-Max API;
• 1M 上下文长场景——一次性塞入完整代码仓库、长视频、法律合同书、研究报告,无需切分;
• 多模态工程化——把视频、图像、文档作为同一输入流,让模型生成 Graph 记忆 / 时间轴 / 关键摘要。