|
|
2026年9月4日凌晨,OpenAI正式发布旗舰模型GPT-6 Astra,总裁Greg Brockman在发布会结尾高喊“欢迎进入AGI时代”。模型在得州Stargate基地用超过10万块GPU完成训练,是OpenAI迄今规模最大的一次预训练,也是首个达到内部“关键”级网络安全能力门槛的模型。
三项关键数据刷新行业基准
Artificial Analysis基准显示,Astra在Coding Agent Index拿到67分,与Claude Opus 5和Fable 5打平,token效率比GPT-5.6 Sol提升70%;幻觉率从GPT-5.6 Sol的102%下降到51%,降幅近一半。但Intelligence Index仍为61,与前代持平,且API定价上调2.5倍,单任务综合成本上升约75%。
在ARC-AGI-3高难度陌生环境推理测试中,Astra拿到99.9%准确率,能在无规则说明的情况下自主摸索通关二维游戏。网络安全的漏洞利用基准上,Astra拒绝恶意请求的概率达91.5%,相比前代模型的59%有质的飞跃,但出于安全考虑,OpenAI对其最强网络安全能力设置了更严格的访问限制。
从对话到数字员工:任务执行能力跃升
Astra最显著变化是从“回答问题”转向“直接完成任务”。官方演示覆盖电子表格制作、3D环境搭建、电路板设计、报税处理、跨软件工作流编排等场景,用户只需给出目标,模型自主完成多步骤执行。
Brockman表示,Astra代表着“可委托给AI的工作类型”真正发生变化。在多家大模型服务同时出现宕机的当晚,ChatGPT也一度报错,Codex受影响,但OpenAI坚持按节奏发布。竞争对手Anthropic的Claude Fable 5.1和Mythos 5.1同期上线,财务披露显示Anthropic营收首次超越OpenAI,头部双雄争夺进入贴身肉搏。
实操建议
1. 重新评估任务边界:把“能交给AI完成”的任务清单重排,尤其是跨应用数据搬运、文档表格生成等流程型工作
2. 网安场景需额外治理:Astra自主漏洞利用能力已达关键级,企业应配套agent审计与权限控制框架
3. 成本对冲:2.5倍API涨价与70%效率提升并存,中小团队用缓存命中+小模型路由对冲,大企业可做并行压测对比Fable 5.1
结语
GPT-6 Astra的发布,把AGI话题从“何时到来”变成了“如何治理”。Brockman的AGI宣告是否经得起学术检验并不重要,真正改变的是企业采购清单、董事会议程和监管框架的紧迫性。9月4日起,所有AI战略都需重写“Agent治理”这一节。 |
|