DefiRWA

 找回密码
 立即注册
搜索
热搜: 活动 交友 discuz
查看: 16|回复: 0

GLM-5.3:编程基准大涨,8月14日最强开源模型来了

[复制链接]

1190

主题

1201

帖子

4006

积分

版主

Rank: 7Rank: 7Rank: 7

积分
4006
发表于 2026-8-15 08:32:09 | 显示全部楼层 |阅读模式
8月14日,智谱正式发布 GLM-5.3。它沿用 GLM-5.2 的基座模型,后训练、环境和工具调用训练是主要变化,目标是完成更长的工程任务。智谱尚未披露参数量,权重约在安全评估后两周放出,API 先行。


一、编程能力出现了哪些变化

官方对比数据显示,GLM-5.3 在 Terminal Bench 3.0 上从 4.6 提升到 28.3,DeepSWE v1.1 从 46.2 提升到 66.9,SWE-Marathon v1.1 从 19.4 提升到 42.5。NL2Repo、FrontierSWE、Toolathlon Verified 和 AutomationBench 也同步提升。真正有价值的变化不是单项榜单第一,而是模型更可能在多轮修改、测试、定位依赖和修复回归问题时保持方向。

网络安全能力同样上升。CyberGym 从 77.2 提升到 84.5,ExploitBench 从 24.4 提升到 54.4,ExploitGym 6 小时任务完成数从 39 提升到 130。智谱披露其漏洞研究已追踪 2,436 个发现,涉及 269 个开源项目,其中 53 个已经公开,2,383 个仍在披露流程;严重和高危问题合计 1,097 个,覆盖内核、操作系统、浏览器和开源基础设施。


二、训练效率比一次跑分更值得关注

GLM-5.3 使用 slime 后训练框架。官方称,长周期编程任务端到端强化学习训练吞吐提升超过 2.3 倍;训练与推理的 logprob 平均差异控制在 1e-7 级别,较此前方案降低超过 99.99%。这意味着厂商可以用更多复杂环境训练,而不只拉长时间。后训练数据、验证器和执行环境,正在成为能力竞争的一部分。


三、企业接入要注意什么

第一,API 规则变了:GLM-5.3 支持 low、high、max 三档思考强度,默认是 max,并且不再支持关闭思考;旧调用方式必须迁移。第二,权重刚发布时不能把“开源”当成“已经完成安全审计”,生产环境应先做沙箱运行、依赖锁定和权限隔离。第三,企业最好用自己仓库的真实缺陷测试模型,不要只照搬榜单分数。第四,涉及自动提权、删除数据、联网抓取和生产发布时,必须保留人工审批与回滚点。

GLM-5.3 的核心信号很明确:模型公司正在把能力提升从“回答质量”推进到“执行可靠性”。在它真正落到企业代码库之前,评测、权限和审计仍比宣传口号更重要。

数据来源:智谱 Z.ai《GLM-5.3》官方发布页,2026-08-14;Z.ai Security Disclosure Ledger(2026-08-14)。
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

QQ|货物清仓|Archiver|手机版|小黑屋|倒数|舒尔特|好邻卡|RWA+DeFi|融资计划|内购渠道|Github|Web4

GMT+8, 2026-9-5 11:00 , Processed in 0.061159 second(s), 20 queries .

Powered by Discuz! X3.4

Copyright © 2001-2023, Tencent Cloud.