DefiRWA

 找回密码
 立即注册
搜索
热搜: 活动 交友 discuz
查看: 19|回复: 0

阿里云Qwen3.8-Flash开源+125B参数仅激活6B+训练成本降90%

[复制链接]

1190

主题

1201

帖子

4006

积分

版主

Rank: 7Rank: 7Rank: 7

积分
4006
发表于 2026-8-27 07:03:00 | 显示全部楼层 |阅读模式
8月26日晚阿里云AI团队正式发布并开源千问最新模型Qwen3.8-Flash:采用下一代MoE架构,125B总参数推理时仅激活6B,算力消耗压缩至传统模型的1/20;在编程、办公、智能体等核心任务上超越Claude Opus 4.6接近Opus 4.8;训练成本较上代Qwen3.7-Plus下降近90%。权重已同步上线HuggingFace、ModelScope等平台,FP8版本一并放出,全球开发者可直接调用。仅完成预训练的基座模型在SuperGPQA、GSM8K、SWE-Bench-Pretrain能力上即超过3倍其大小的Qwen3.7-Plus,标志大模型行业正式从"参数竞赛"转向"效率革命"。


三件事的三层逻辑

MoE架构的工程胜利wen3.8-Flash激活比例仅4.8%,远低于Mixtral 8x7B的13%、DeepSeek-V3的5.5%、Llama 4 Maverick的8%,通过精细专家路由把推理算力压缩到极致,使千亿参数基座可在消费级GPU(单卡RTX 4090/5090 24GB)完成推理,大幅降低企业部署门槛。训练成本下降90%的来源是稀疏激活+FP8混合精度+知识蒸馏三件套,单次预训练算力从Qwen3.7-Plus的58000张H100天降至5800张H100天,折合电费从1.74亿美元降至0.17亿美元,中小团队首次具备训练前沿模型的经济可行性。


三条暗线

第一,中国开源模型继续主导全球:HF 2026春季报告显示中国开源模型全球下载占比41%首超美国,Qwen系列半年下载30亿次,Qwen3.8-Flash开源将这一优势进一步扩大。第二,价格屠夫策略延续:125B仅激活6B即可比肩Opus 4.6,意味着阿里云按Token计费的产品Qwen-Long API将再次大幅降价,迫使Anthropic、OpenAI、谷歌跟进,中小开发者将成最大受益方。第三,垂直行业模型获得"中央厨房":企业可在Qwen3.8-Flash基础上做轻量微调即可获得专业能力,金融、医疗、法律、教育的垂类模型构建成本将下降一个数量级。


对企业的三点启示

第一,企业AI Agent应优先评估Qwen3.8-Flash等高激活效率模型,在保持能力的同时大幅降低推理成本,适合中高频调用场景。第二,模型微调应从全参数转向LoRA+蒸馏组合,Qwen3.8-Flash作为基座可在24GB显存单卡完成百亿参数适配,数据准备成本与算力成本同步压缩。第三,关注阿里云"开源+商业API"双轨策略:开源版本用于社区与中小客户,商业API+Qwen-Long服务大型客户,企业在选型时应同步评估两条路径的TCO,避免被单一代工方锁定。
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

QQ|货物清仓|Archiver|手机版|小黑屋|倒数|舒尔特|好邻卡|RWA+DeFi|融资计划|内购渠道|Github|Web4

GMT+8, 2026-9-5 10:33 , Processed in 0.063749 second(s), 20 queries .

Powered by Discuz! X3.4

Copyright © 2001-2023, Tencent Cloud.