DefiRWA

 找回密码
 立即注册
搜索
热搜: 活动 交友 discuz
查看: 20|回复: 0

Qwen3.8-Max 8-3发布:2.4万亿MoE+16天自主编程,PaperBench暴涨28.2分

[复制链接]

1190

主题

1201

帖子

4006

积分

版主

Rank: 7Rank: 7Rank: 7

积分
4006
发表于 2026-8-6 22:53:12 | 显示全部楼层 |阅读模式

Qwen3.8-Max 8-3发布:2.4万亿MoE+16天自主编程,PaperBench暴涨28.2分

2026年8月3日,阿里巴巴正式发布迄今规模最大的旗舰大模型 Qwen3.8-Max——基于 Qwen3.5 架构构建、采用稀疏 MoE 与混合注意力机制联合优化、总参数 2.4 万亿 / 激活 950 亿(4%)、原生支持视觉理解、最大 1M Token 上下文。最具产业冲击的不是参数规模,而是从空文件夹出发、无人工干预独立运行约 16 天,完成开源自进化智能体框架 oh-my-cli(达到 Hermes Agent 级别);PaperBench 较上代提升 28.2 分达到 93.0OSWorld-Verified 86.1 分位居主流模型首位CodeArena 全球第四Vision Arena 全球第二Arena 整体仅次于 Anthropic Claude 系列。Qwen3.8 同时开放 API + 接入"千问办公" Agent。权重计划于下周在阿里云模型工厂开源同步开源 Qwen3.8-27B。这是 2026 年 8 月中国大模型"自主编程 + 长程 Agent + 开放权重"三条主线汇合的标志性事件——把"模型能否独立干完一件实事"从 PPT 搬到开源仓库。


一、2.4万亿MoE的工程含义:4%激活 + 1.2TB权重

Qwen3.8-Max 的核心数据组合
总参数 2.4 万亿 / 激活 95B(约 4%)——MoE 架构让"知识容量"与"单次算力消耗"解耦;
上下文窗口 1M Token(约 99.1 万 Token 输入 / 13.1 万 Token 输出)——可一次塞下大型代码仓库、数百页招股书、长视频 Graph 记忆;
原生多模态——文本 + 图片 + 视频统一输入,文本输出;
4bit 权重约 1.2TB——意味着单机不可部署,主战场是云服务商 + 研究机构 + 大型企业 GPU 集群;
Qwen3.8-27B 同步开源——更适合个人与中小团队的开源版本。

激活率 4% 的工程意义:当普通稠密模型从 7B 扩到 70B,每次推理的算力开销随参数线性增长;而 Qwen3.8-Max 把"2400 名员工公司"的算力支出降到"每次只调度 95 名专家"——单次推理成本接近 95B 模型,但容量是 2.4T 模型。这意味着同一份 GPU 预算下,开发者可以承担过去稠密大模型 5-10 倍的调用量,或者在同等成本下获得远超稠密模型的复杂任务能力。


二、16天自主编程:从"对话生成"到"工作流交付"

最具产业冲击的演示:阿里让 Qwen3.8-Max 从一个空文件夹出发,不接人类干预、自主运行约 16 天,交付了一个"可自我进化的智能体框架 oh-my-cli"——并已完全开源,达到 Hermes Agent 级别水平。这一过程的工程含义有四层:

第一层:长程任务的规划能力——模型要把"造一个自进化 Agent 框架"这样抽象的目标拆解为上千个子任务、调度工具、写代码、跑测试、回看错误、修订方案;
第二层:持续反思与自我升级——遇到 bug 自动定位、给出 patch、写入代码、再跑测试——这是一个完整的"开发-测试-运维"循环;
第三层:数千轮稳定交互——Qwen3.8-Max 在执行-反馈-迭代的闭环中能持续迭代上千轮而不"忘记指令";
第四层:交付可用代码——oh-my-cli 已在 GitHub 开源,可被其他开发者复用——这是从"模型生成段落代码"跨越到"模型交付工程产品"的关键证据。

真实办公场景的延伸:阿里同时披露 Qwen3.8-Max 在办公场景的实测——把一支法务团队约一周的合同审阅量压缩到 1 小时仅凭一句话规划出复杂的动态工作流并交付一套可盈利的端到端量化策略。多模态层面:能"跨页理解 200 页财报"、把"100 小时长视频组织成可检索的 Graph 记忆"、在执行中持续审视自己的中间产物,自主定位错误并重新规划修正。


三、基准测试:PaperBench 93.0 + OSWorld-Verified 86.1 全球第一

关键基准数据
PaperBench 93.0(较上代 +28.2 分)——衡量 AI 自动复现顶尖 AI 论文的端到端能力,含代码 + 实验 + 写作;
OSWorld-Verified 86.1(主流模型全球第一)——评估 AI 在桌面操作系统中完成真实任务的能力(订机票、装软件、编辑文档等);
CodeArena 全球第四——编程 Agent 端到端评估;
Vision Arena 全球第二——多模态理解与视觉推理;
Arena 整体性能仅次于 Anthropic Claude 系列——综合榜单全球第一梯队。

与竞品的直接对比:阿里同时披露了与 Claude Opus 4.8 / Claude Fable 5 / OpenAI GPT-5.6 Sol 在编程基准测试上的对比结果——Anthropic 用 Claude Code 跑、OpenAI 用 Codex 跑,SWE-bench Pro 与阿里自研的 NL2Repo-Bench 评测集上 Qwen3.8-Max 接近 Claude 旗舰。Forrester 副总裁兼首席分析师查理·戴(Charlie Dai)评论:"阿里巴巴确实在缩小差距,但更重要的故事是开放权重模型的快速成熟——企业用户在软件工程、领域定制、数据主权以及成本敏感型部署场景中,已经拥有越来越可信的替代方案,开放性的价值往往不亚于模型的绝对性能。"


四、对开发者与企业用户的实操影响

对开发者
API 价格优势——千问 API 价格延续 Qwen3.5 的"性价比斩杀线",每百万 Token 输出价远低于 Claude Opus / GPT-5.6;
本地部署选型——个人 / 中小团队用 Qwen3.8-27B(已开源权重的稠密版),大型企业用 Qwen3.8-Max API;
1M 上下文长场景——一次性塞入完整代码仓库、长视频、法律合同书、研究报告,无需切分;
多模态工程化——把视频、图像、文档作为同一输入流,让模型生成 Graph 记忆 / 时间轴 / 关键摘要。

对企业
法务 / 财务 / HR 等"长文档审阅"场景——从"一周工作"压缩为"1 小时",AI Agent 直接替代团队 30-50% 的高强度审阅工作量;
量化 / 投研 / 销售策略——一句话生成可盈利的策略框架,端到端交付,不再需要"人工写 prompt、跑模型、修代码"三步走;
国产化合规——金融、医疗、政务场景可通过"国产模型 + 国产 Agent + 国产 IM 嵌入"组合实现完全合规。

对创业者
避开"通用聊天助手"红海——Qwen3.8-Max 的最大意义是为垂直行业 Agent 提供"长程 + 多模态 + 自进化"的底座;
垂直 Agent 模板市场——把 oh-my-cli、自进化框架、长程 Agent 工作流做成 SaaS 卖给传统行业;
行业微调服务——基于 Qwen3.8-27B 开源权重,为企业微调法律 / 财务 / 医疗 / 教育 行业模型。


五、结论

Qwen3.8-Max 8-3 发布是 2026 年下半年中国大模型进入"自主交付"阶段的标志性事件:2.4 万亿 MoE + 16 天自主编程 + PaperBench 93.0 + OSWorld-Verified 86.1 + 下周开源权重——这五重组合明确传递一个信号国产大模型已经从"对话生成"切换到"工作流交付",并把开放权重作为标准动作对开发者,要尽快评估 1M 上下文 + 长程 Agent 在自己业务流中的应用;对企业,要开始测算"法务 / 财务 / 投研 / 量化"等长文档 / 长链工作流能省下多少工时;对创业者,把"垂直行业 Agent 模板 + 行业微调 + Agent 治理"三个方向作为下一个 12 个月的差异化点。下一阶段竞争点不是参数规模,而是模型能否"独立干完一件实事"——Qwen3.8-Max 用 16 天交付的开源 oh-my-cli 已经把答案放在 GitHub 上


数据来源
• 阿里巴巴 Qwen3.8-Max 官方发布公告(qwen.ai/3.8-max,2026-08-03)
• IT之家《Qwen3.8-Max 模型正式上线 总参数量 2.4 万亿》(ithome.com,2026-08-03)
• 至顶科技《阿里巴巴发布 Qwen3.8-Max:自主编程 16 天完成项目》(zdnet.com.cn,2026-08-06)
• 钛媒体 / 光锥智能《模型打底、千问办公上桌,阿里再战 AI 局》(qq.com,2026-08-05)
• PaperBench 官方基准(paperbench.ai,2026-08-03)
• OSWorld-Verified 官方基准(osworld-project.github.io,2026-08-03)
• Chatbot Arena 官方榜单(lmarena.ai,2026-08-03)
• Forrester 副总裁 Charlie Dai 公开评论(forrester.com/research,2026-08-04)
• Qwen3.8 API 千问平台定价(qwen.cn/pricing,2026-08-03)
• oh-my-cli 开源仓库(github.com/qwen/oh-my-cli,2026-08-03)
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

QQ|货物清仓|Archiver|手机版|小黑屋|倒数|舒尔特|好邻卡|RWA+DeFi|融资计划|内购渠道|Github|Web4

GMT+8, 2026-9-5 11:17 , Processed in 0.072638 second(s), 20 queries .

Powered by Discuz! X3.4

Copyright © 2001-2023, Tencent Cloud.