|
|
2026年9月2日,阿里千问旗舰模型Qwen3.8-Max完成0902版本升级,同步在第三方评测平台Code Arena的WebDev前端编程总榜以1691分登顶,领先Claude Opus5与Kimi K3;同日Qwen办公开启公测,把QoderWork、MuleRun、悟空三款智能体整合到同一入口,初步接入钉钉。这是国产大模型首次同时在"模型能力榜"与"Agent办公落地"两个维度跑出明确身位。
编程榜首:8项任务全面提升
Qwen3.8-Max-0902与8月版共享同一底座,总参数2.4万亿,支持100万tokens上下文,围绕编程与专业办公两个方向做专项后训练。Code Arena官方数据:TerminalBench3.0从11.3跃升至29.0,DeepSWE1.1从56.6升至69.3,QwenSWEbenchV2从55.1升至70.0,JobBench从53.4升至64.0。Agent与多模态任务亦有提升,但幅度相对克制,后训练资源主要压在"可验证的工程任务"上。
更具吸引力的是性价比。Code Arena同步公布的帕累托前沿显示,Qwen3.8-Max-0902每百万tokens综合均价约5美元;API定价维持输入2美元、输出6美元不变。对比Anthropic Fable 5.1缓存降价后的市场参考价,这一价位约为同等编程任务的35-45%。
Qwen办公:三Agent合一+钉钉接入
Qwen办公不是单一产品,而是把QoderWork编程、MuleRun桌面Agent、悟空企业协同三款智能体的能力整合到统一入口。同一句自然语言指令,可被智能路由到合适的Agent执行。用户不再需要记住每个Agent的专长,直接抛任务即可。
钉钉接入把入口与日常沟通管道绑定,AI执行不需要单独的启动仪式。截至公测发布,Qwen办公已支持:文档表格自动生成、跨应用数据搬运、会议纪要+待办闭环、代码生成与单元测试自动提交。
实操建议
1. 评估Agent编排边界:梳理哪些任务适合路由给AI,人类在哪个节点介入
2. 关注1M上下文实战:100万tokens可喂入中型项目完整代码库,Code Review、知识库问答、跨服务依赖分析是新落地点
3. 定价对冲:5美元/百万tokens让中小团队也能跑大规模实验,POC阶段直接对比Fable 5.1与Qwen3.8-Max-0902
结语
阿里千问0902版本的双线发布,意味着国产大模型竞争已从"刷榜"进入"模型+Agent+协同平台"全栈对垒。Code Arena榜首能否稳守,Qwen办公公测能否真正吃下企业协同场景,将决定2026年Q4中国大模型市场的最终格局。 |
|