DefiRWA

 找回密码
 立即注册
搜索
热搜: 活动 交友 discuz
查看: 20|回复: 0

Poolside开源1180亿编程模型:单台DGX运行,训练周期压至9周

[复制链接]

1190

主题

1201

帖子

4006

积分

版主

Rank: 7Rank: 7Rank: 7

积分
4006
发表于 2026-7-23 07:48:08 | 显示全部楼层 |阅读模式
2026年7月22日,Poolside发布Laguna S 2.1开源权重编程模型。公开资料显示,模型总参数约1180亿,采用混合专家架构,每个Token激活约80亿参数,在Terminal-Bench 2.1取得70.2%成绩;量化版本可在单台DGX Spark或Mac Studio运行。训练使用4096张H200,周期少于9周。


一、这次发布的价值不只是跑分

大型编程模型过去通常与超大集群、闭源API和高昂推理成本绑定。Laguna S 2.1的信号是:通过混合专家、低比特量化和针对代码执行的强化训练,企业可以在较小的本地设备上运行具备Agent能力的模型。

总参数与激活参数的差异很关键。1180亿代表模型容量,约80亿激活参数决定一次推理实际使用的主要计算量。MoE把不同专家分配给不同任务,在保持知识容量的同时减少每次计算,但它也带来路由、显存和专家负载不均等工程问题。


二、单机运行会改变哪些场景

第一是代码隐私。金融、工业和政府项目可以在本地分析仓库,减少源码传出边界。第二是稳定成本。高频调用不再完全按Token向云端付费,而转为设备折旧、电力和运维。第三是离线开发,在网络受限环境中仍能完成检索、重构和测试生成。

但“能装进单机”不等于“能支撑整个团队”。单用户交互、批量代码审查和多Agent并发对吞吐要求不同。企业仍需测试首Token延迟、持续生成速度、上下文长度、并发数和显存占用。


三、9周训练周期释放什么信号

4096张H200仍是昂贵资源,但与最大规模前沿模型相比,训练集群和周期已经更可控。Poolside强调其Model Factory自动化架构搜索、评估和基于代码执行的强化学习。对于编程模型,能否运行代码、观察测试结果并修正,比只学习文本更重要。

这类“执行反馈”让训练目标从预测下一个Token,转向完成可验证的软件任务。未来模型竞争会更多关注仓库级修改、终端操作、测试通过率和长任务稳定性,而不是只做单函数生成。


四、企业落地的四步测试

第一,选取20至50个内部真实任务,包括Bug修复、依赖升级、测试补充和文档更新。第二,固定代码版本和验收脚本,比较模型成功率、耗时和人工修改量。第三,做安全测试,检查模型是否读取密钥、执行危险命令或引入高风险依赖。第四,评估部署成本,把设备、显存、功耗、并发和运维工时与云API费用放在同一张表中。

建议先让本地模型处理代码检索、解释和测试草稿;高风险架构修改交给更强模型并由工程师审批。开源模型的优势是可控和可定制,不是天然准确。


五、对开发工具市场的影响

如果中型开源编程模型能在单机稳定运行,IDE厂商和企业平台就能提供“本地模型+云端旗舰”的混合方案。敏感代码留在本地,困难任务经过脱敏后调用云端;日常补全不产生外部Token费用,复杂迁移按需付费。

这会推动模型从独立产品变成可替换组件。开发者真正关心的将是仓库索引、权限、测试、版本控制和审计链能否协同,而不是聊天窗口里显示哪个模型名称。


数据来源

Poolside Laguna S 2.1公开发布信息(2026.07.22);AI Daily Digest对参数、Terminal-Bench 2.1成绩、训练集群和部署条件的汇总。具体性能应以官方模型卡及企业自有基准测试为准。
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

QQ|货物清仓|Archiver|手机版|小黑屋|倒数|舒尔特|好邻卡|RWA+DeFi|融资计划|内购渠道|Github|Web4

GMT+8, 2026-9-5 11:42 , Processed in 0.070011 second(s), 20 queries .

Powered by Discuz! X3.4

Copyright © 2001-2023, Tencent Cloud.