|
|
AI 动态 · 2026.08.01
AI Coding × 具身智能
① OpenAI:两项 Harness 设置令 ARC-AGI-3 成绩提高近 3 倍
OpenAI 7 月 29 日披露,GPT-5.6 Sol 使用官方评测框架时会在每次动作后丢弃推理状态,并被滚动窗口删除早期动作。启用 retained reasoning 与 context compaction 后,公开任务集得分由 13.3% 升至 38.3%,输出 Token 约降至原来的六分之一。
关注:智能体能力不能只看模型,Harness 的记忆保留、上下文压缩与状态管理会直接改变长任务表现。
② LLM-as-a-Verifier:验证算力成为智能体第四条扩展轴
斯坦福、伯克利与 NVIDIA 团队提出 LLM-as-a-Verifier,以评分 Token 的概率分布期望形成连续分数,并通过粒度、重复评估、标准拆解扩展验证计算。论文报告 Terminal-Bench V2 86.5%、SWE-Bench Verified 78.2%、RoboRewardBench 87.4%。
关注:长链路 Agent 的核心瓶颈正从“生成更多”转向“选对轨迹、及时纠错”,而且无需重新训练模型即可增强验证环节。
③ UniClawBench:真实环境中最强模型通过率仍低于 50%
香港大学多媒体实验室与美团发布 UniClawBench,在真实 Docker、浏览器、软件与文件环境中评测智能体。论文结论显示,即使最强闭源模型也严格低于 50% 任务通过率;同一模型更换 Agent 框架造成的差异,可能大于直接更换模型。
关注:生产验收必须测“模型 × 框架 × 真实环境”,仅凭沙箱榜单容易高估可靠性。
④ Figure 03 进入宝马工厂:从搬运转向零件排序
Figure 宣布 Figure 03 进入宝马斯帕坦堡工厂 Hall 52,处理从料箱抓取无序薄壁零件、按装配顺序放入推车的 sequencing 任务。Helix 02 统一协调手、臂、躯干与双脚;新机加入掌心相机、触觉传感与无线充电,额定载荷 20 千克。
关注:排序任务要求感知、纠偏、移动与操作实时耦合,比固定工位搬运更接近制造物流的真实瓶颈。
⑤ 电子皮肤量产:无本体采集补齐触觉数据
央视 8 月 1 日报道,浙江清华柔性电子技术研究院的柔性触觉末端可感知压力、温度与纹理,智能感知夹爪最大月产能已达 1000 只。其“无本体数据采集”方案让工作人员穿戴柔性触觉与视觉设备,在机器人不在场时采集人类操作经验。
关注:触觉硬件量产与低成本数据采集同步推进,有助于缓解具身智能灵巧操作的数据瓶颈。
来源:OpenAI / arXiv 2607.05391 / arXiv 2607.08768 / Figure AI / 央视新闻 |
|