DefiRWA

 找回密码
 立即注册
搜索
热搜: 活动 交友 discuz
查看: 11|回复: 0

AI动态 6月29日 | Grok 4.5直逼Opus / 3B小模型逆袭 / CEO-Bench

[复制链接]

895

主题

906

帖子

3035

积分

版主

Rank: 7Rank: 7Rank: 7

积分
3035
发表于 2026-6-29 07:45:09 | 显示全部楼层 |阅读模式
Grok 4.5 进入SpaceX/Tesla私测,性能接近Opus
xAI发布基于1.5万亿参数V9基础模型的Grok 4.5,补充训练中加入Cursor数据,已在SpaceX和Tesla内部测试。马斯克称性能接近甚至超越Opus,SpaceX将每月发布全新训练模型。AI Coding模型竞争格局突变——SpaceXAI从航天算力切入编程模型赛道,月度迭代节奏远超行业常规。

VibeThinker-3B:3B参数编程力压200倍大模型,MIT开源
新浪开源3B参数VibeThinker-3B,AIME26持平DeepSeek V3.2,LiveCodeBench超越所有20B以下模型,LeetCode竞赛123/128题超过GPT-5.2和Kimi K2.5。研究提出"参数压缩-覆盖假说":逻辑推理依赖少数可压缩模式,世界知识仍需大参数。小模型编程能力极限突破,对AI Coding成本结构冲击深远。

CEO-Bench:仅3个AI模型在500天创业测试中盈利
普林斯顿大学测试14个AI模型运营虚拟软件公司500天,仅Claude Fable 5(4715万美元)、Opus 4.8(2780万)、GPT-5.5(2130万)超过起始资本。多数模型无法保持连贯策略中途破产。AI长期战略决策能力的关键标尺——当前Agent的"智力"还远不足以替代人类CEO。

Anthropic发布Claude Tag:Slack内@Claude异步执行任务
Claude Tag让用户在Slack中@Claude异步执行任务,AI Coding从IDE实时对话走向协作平台自动化。工作流从"人盯AI写代码"转向"人派活AI异步交付",Agent工作范式的重要一步。
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

QQ|货物清仓|Archiver|手机版|小黑屋|倒数|舒尔特|好邻卡|RWA+DeFi|融资计划|内购渠道|Github|Web4

GMT+8, 2026-7-22 08:02 , Processed in 0.070094 second(s), 21 queries .

Powered by Discuz! X3.4

Copyright © 2001-2021, Tencent Cloud.

快速回复 返回顶部 返回列表