|
|
AI 动态 · 2026.07.26
侧重 AI Coding 与具身智能
① Claude Opus 5 半价逼近 Fable 5,重夺性价比
Anthropic 7/24 发布 Claude Opus 5:与 Opus 4.8 同价(每百万 token 输入 $5 / 输出 $25),性能却大幅跃升。CursorBench 3.2 用最大推理强度运行,得分仅比 Fable 5 峰低 0.5%、成本减半;Frontier-Bench v0.1 上优于所有其他模型,相对 Opus 4.8 提升两倍以上;ARC-AGI 3 得分是第二名的 3 倍;OSWorld 2.0 任何预算条件下均优于其他模型。Anthropic 称其为"迄今最安全的模型"——主动限制漏洞利用构建能力。
→ 值得关注:闭源阵营正面回应开源低价路线,把"99% 旗舰性能"压到日常高频场景,编程模型竞争从"刷分"切换到"性价比 + 落地"。
② Claude Code 删减 80% 系统提示词,Opus 5 成为默认
Anthropic 在 Opus 5 上线后删减 Claude Code 80% 系统提示词,编码评估无性能损失——强推理模型让旧提示工程范式过时,"上下文工程"取代"保姆式规则"。官方同步推出 /doctor 命令自动瘦身上下文;Claude Code v2.1.219 将 Opus 5 设为默认模型,子代理嵌套深度提升至 3 层。
→ 值得关注:Agent 工程从"塞规则"切到"留结构"——模型越强、提示词越薄,Agent Skills 与 Harness Engineering 进一步成为通用范式。
③ OpenAI Codex 三线齐崩 111 分钟,Agent 时代 SLA 警钟
7 月 25 日 17:17 起,OpenAI 的 API、ChatGPT、Codex 三线同时报错,31 个服务组件性能下降,约 111 分钟后恢复;第三方监测显示其已连续 17 天未完全正常。Agent 时代生产级依赖集中在单家供应商时的 SLA 风险被再次放大。
→ 值得关注:Agent 部署把单点错误放大到生产链,企业级方案必须在 Codex / Claude Code / Cursor 多家之间做容灾路由,不能让"一家宕机 = 全链路停摆"。
④ 腾讯开源三大具身基座,"三层脑"分层架构破解反应慢
WAIC 2026 期间,腾讯 Robotics X 联合混元开源 Hy-Embodied-VLM-1.0 / RxBrain-1.0 / VLA-0.5 三款基座模型。首席科学家张正友详解"三层脑"架构:VLM(右脑)理解图像/空间/场景,RxBrain(大脑)统一认知与未来状态想象,VLA(小脑)连接身体把高层目标转化为连续动作。HyVLA-0.5 已在日化品工厂产线落地,作业成功率 >95%,新增 SKU 适配周期 <3 天;TairosAgent 框架将响应时间压到 2-3 秒。
→ 值得关注:具身智能从"统一大模型"叙事走向"分层异步架构",与人类大脑多频段运行机制对齐,是工业级实时控制的关键路径。
⑤ 新智具身×复旦开源 3 万小时视觉-触觉数据集,触觉变核心基建
新智具身(NeoteAI)联合复旦大学发布 NeoData 数据集与 VTLA / TWAM 双模型:3 万小时视觉-触觉交互视频、140 万条操作片段、33 亿时间步,已开源 5 千小时;NeoForce 统一表征解决跨传感器"触觉方言"难题;VTLA 插插头成功率 85%(纯视觉方案 60%),拔钥匙 99%(35%);TWAM 世界模型仿真平均成功率 84.5%(最强基线 36%),真机 8 项任务平均 46.3%(LingBot-VA 21.9%)。
→ 值得关注:触觉从"辅助模态"跃升为"核心基建",与视觉形成"视触融合"双模态 Scaling——机器人开始像婴儿一样通过主动触觉探索验证假设,"最后一厘米"问题有了系统化解法。
今日判断
AI Coding 走"半价旗舰 + 提示词瘦身 + 容灾路由"三件套——性价比、模型可靠性、Agent 工程化都在向"可被算账"靠拢;具身智能走"分层异步 + 触觉基建"——多频段大脑对齐物理世界,触觉模态规模化突破"最后一厘米"。两个赛道的共同关键词仍是:可观测、可审计、可量化。
来源:腾讯新闻/科技狐 Opus 5 评测(7.26)、机器之心 Opus 5 提示词瘦身(7.25)、象先志/腾讯新闻 Codex 三线宕机(7.25)、InfoQ/凤凰网 腾讯三具身基座(7.26)、张正友 WAIC 2026 深度访谈(7.21+7.26)、机器之心 新智具身 NeoteAI 系列(7.26)、Anthropic 官方 release notes。 |
|