DefiRWA

 找回密码
 立即注册
搜索
热搜: 活动 交友 discuz
查看: 5|回复: 0

DeepSeek V4多模态开源:305B参数+4.6%激活率+MIT协议,创业团队零成本商用

[复制链接]

1183

主题

1194

帖子

3985

积分

版主

Rank: 7Rank: 7Rank: 7

积分
3985
发表于 4 天前 | 显示全部楼层 |阅读模式
2026年9月1日,DeepSeek在HuggingFace正式开源V4家族首款多模态模型DeepSeek-V4-Flash-Vision-Exp,采用MIT许可协议,总参数305B而每token仅激活13B,激活率低至4.6%,关键基准ZeroBench 35分反超Claude Opus-4.8的34分。一举打破"开源多模态=性能妥协"的行业默认,创业团队第一次可以零授权费、零数据上传地部署一个能力逼近闭源旗舰的多模态Agent底座。


三件事的三层逻辑

参数规模看,305B总参比纯文本V4-Flash近翻倍,每token激活仅13B(激活率4.6%),比混元Hy4的6.4%更激进。背后是MoE稀疏化竞赛进入深水区——更低的激活率意味着推理时显存与算力骤降,mxFP4四比特浮点训练精度配合下消费级显卡本地运行已可行。跑分上ApexBench 36.5、ZeroBench 35(反超Opus-4.8)、Chartography 64.3、TerminalBench 83.9、DeepSWE从54.4升至59.3。MIT许可意味着商用、修改、再分发零版权费,小团队不再被多模态API调用费吃掉现金流。


三条暗线

第一,稀疏化护城河从工程问题上升为学术竞争。Hy4激活率6.4%、V4-Vision激活率4.6%,MoE路由质量取代参数总量成为新护城河,路由错误会激活错位专家导致整套系统崩盘,这对模型架构设计与训练稳定性提出全新要求。第二,多模态Agent成本结构被永久重写。一个开源模型同时承担视觉理解、文本推理、Agent任务,创业团队不再需要为GPT-4V、Claude Vision、SAM-2分别付费,落地成本可降至之前的十分之一。第三,架构创新集中在残差连接范式。mHC(流形约束超连接)、DFlashAttention、Hyper-Connections三条技术线叠加,使模型在极端稀疏下仍能保持稳定训练,后续可能成为新一代通用残差连接标配。


对企业的三点启示

第一,2026下半年AI选型应把"国产或开源多模态模型"列入主清单,DeepSeek-V4-Flash-Vision-Exp、混元Hy4、Qwen3.8-Vision等开源方案提供的能力已逼近闭源旗舰。第二,商业落地优先选择视觉+文本+Agent一体化方案,商品图识别、教育拍题、医疗影像辅助、截图UI还原等场景不再需要三个模型各付费一次,综合成本可压缩至过去的5%-15%。第三,关注实验性模型的长尾风险——Exp标注暗示在细粒度OCR、复杂图表、小语种等场景仍存在幻觉,生产部署前必须做严肃的稳定性验证,API与本地部署要双轨并行准备,避免单点依赖。
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

QQ|货物清仓|Archiver|手机版|小黑屋|倒数|舒尔特|好邻卡|RWA+DeFi|融资计划|内购渠道|Github|Web4

GMT+8, 2026-9-5 09:37 , Processed in 0.063848 second(s), 20 queries .

Powered by Discuz! X3.4

Copyright © 2001-2023, Tencent Cloud.