DefiRWA

 找回密码
 立即注册
搜索
热搜: 活动 交友 discuz
查看: 7|回复: 0

千问Qwen3.8-Max-0902登顶:编程榜1691分,阿里双线抢跑

[复制链接]

1190

主题

1201

帖子

4006

积分

版主

Rank: 7Rank: 7Rank: 7

积分
4006
发表于 前天 07:20 | 显示全部楼层 |阅读模式
2026年9月2日,阿里千问旗舰模型Qwen3.8-Max完成0902版本升级,同步在第三方评测平台Code Arena的WebDev前端编程总榜以1691分登顶,领先Claude Opus5与Kimi K3;同日Qwen办公开启公测,把QoderWork、MuleRun、悟空三款智能体整合到同一入口,初步接入钉钉。这是国产大模型首次同时在"模型能力榜"与"Agent办公落地"两个维度跑出明确身位。


编程榜首:8项任务全面提升

Qwen3.8-Max-0902与8月版共享同一底座,总参数2.4万亿,支持100万tokens上下文,围绕编程与专业办公两个方向做专项后训练。Code Arena官方数据:TerminalBench3.0从11.3跃升至29.0,DeepSWE1.1从56.6升至69.3,QwenSWEbenchV2从55.1升至70.0,JobBench从53.4升至64.0。Agent与多模态任务亦有提升,但幅度相对克制,后训练资源主要压在"可验证的工程任务"上。

更具吸引力的是性价比。Code Arena同步公布的帕累托前沿显示,Qwen3.8-Max-0902每百万tokens综合均价约5美元;API定价维持输入2美元、输出6美元不变。对比Anthropic Fable 5.1缓存降价后的市场参考价,这一价位约为同等编程任务的35-45%。


Qwen办公:三Agent合一+钉钉接入

Qwen办公不是单一产品,而是把QoderWork编程、MuleRun桌面Agent、悟空企业协同三款智能体的能力整合到统一入口。同一句自然语言指令,可被智能路由到合适的Agent执行。用户不再需要记住每个Agent的专长,直接抛任务即可。

钉钉接入把入口与日常沟通管道绑定,AI执行不需要单独的启动仪式。截至公测发布,Qwen办公已支持:文档表格自动生成、跨应用数据搬运、会议纪要+待办闭环、代码生成与单元测试自动提交。


实操建议

1. 评估Agent编排边界:梳理哪些任务适合路由给AI,人类在哪个节点介入
2. 关注1M上下文实战:100万tokens可喂入中型项目完整代码库,Code Review、知识库问答、跨服务依赖分析是新落地点
3. 定价对冲:5美元/百万tokens让中小团队也能跑大规模实验,POC阶段直接对比Fable 5.1与Qwen3.8-Max-0902


结语

阿里千问0902版本的双线发布,意味着国产大模型竞争已从"刷榜"进入"模型+Agent+协同平台"全栈对垒。Code Arena榜首能否稳守,Qwen办公公测能否真正吃下企业协同场景,将决定2026年Q4中国大模型市场的最终格局。
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

QQ|货物清仓|Archiver|手机版|小黑屋|倒数|舒尔特|好邻卡|RWA+DeFi|融资计划|内购渠道|Github|Web4

GMT+8, 2026-9-5 10:32 , Processed in 0.080731 second(s), 21 queries .

Powered by Discuz! X3.4

Copyright © 2001-2023, Tencent Cloud.