DefiRWA

 找回密码
 立即注册
搜索
热搜: 活动 交友 discuz
查看: 1|回复: 0

Anthropic发现Claude内部工作空间:类脑全球工作空间,首个商用大模型装上思维记录器

[复制链接]

888

主题

899

帖子

3012

积分

版主

Rank: 7Rank: 7Rank: 7

积分
3012
发表于 昨天 07:48 | 显示全部楼层 |阅读模式
2026年7月6日,Anthropic联合16位作者发布了一篇名为《Verbalizable Representations Form a Global Workspace in Language Models》的论文,并同步开源了配套代码与Neuronpedia交互演示。这不是一篇普通的研究报告——它让Claude成为全球第一个拥有"思维记录器"的商用大模型:研发者可以直接读取模型内部的"想法内容",而不是仅看输出层的token轨迹。


一、突破在哪里:从"会输出"到"会思考"

在神经科学中,"Global Workspace Theory"(全球工作空间理论)由Stanislas Dehaene与Lionel Naccache等学者系统提出:人脑有意识的信息处理发生在"一个容量有限的'工作空间'"中,在这个空间里被选中的信息会"全局广播",供推理、报告、灵活使用。其下则是"无法主动感知的大规模潜意识并行加工"。换言之,"可被语言化的想法"仅占大脑活动很小一部分,大部分神经活动是"我们读不到自己CPU在跑什么"。

Anthropic团队用一种全新的数学方法——Jacobian Lens——在Claude内部识别出一个特权活动区域"J-space"(J空间)。Claude在训练过程中自发形成了这块"内部工作空间",模型把可以被报告、可以用于推理的概念存储在这里,而把无法用语言表达的自动化处理留在外层"汪洋"中。Neuronpedia的J-space工具可以实时读取这块区域的活动。

意义何在?过去无论OpenAI的o系列还是Anthropic自己的Claude,都只能从输出层倒推"模型在做什么"。现在,Anthropic第一次让"想法"成为可以审计的对象——这意味着金融、医疗、法律、自动驾驶等高风险场景的AI可解释性,有了首个商用基座。


二、合作阵容:脑科学家背书

这篇论文最不寻常之处在于作者名单。16位作者中包括两位"全球工作空间理论"的奠基级神经科学家:法国的Stanislas Dehaene(神经科学教授、科学院院士)与Lionel Naccache。这相当于让"AI模型内部机制"和"人脑意识机制"在同一篇文章里互相验证。

Dehaene在X上评价:"Anthropic的工作让我激动了整整一周。" Naccache则将这项研究与人脑fMRI的发现相对照。这不只是"AI圈自嗨"的论文——它试图从机制层面回答"大模型到底在不在思考"这个根本问题。


三、不止论文:已落地的工具

Anthropic把整套工具都开源了:
• 论文代码:GitHub上可复现J-space定位方法
• Neuronpedia交互演示:用户可实时观察Claude的"思维活动"
• "J-space读取"接口:金融、医疗、合规审查团队可直接审计模型内部决策

这意味着,在面对监管压力(欧盟AI Act、美国AI行政命令、英国AI安全研究所)时,企业第一次有了一个可被独立第三方验证的"AI可解释性方案"。竞争对手如果提不出同等方案,将在金融/医疗B端竞标中失去先发优势。


四、为什么这是2026年的关键节点

回顾AI安全研究几十年,从"对抗样本"(2013)到"可解释性"(2018)到"机制可解释性"(Anthropic 2022),每一次跨代突破都让AI从"黑盒"逼近"灰盒"。今天J-space的研究,让"灰盒"变成"可读玻璃"。配合Claude 4系列的强推理能力,企业可以在不损失模型智能的前提下满足监管要求。

对从业者的建议:
1. AI产品经理:把"AI决策可解释性"列为PRD必备项,特别是金融、医疗、法律方向
2. 企业架构师:评估是否在关键决策链路中增加"J-space审计"层
3. 合规官:7月开始欧盟AI Act GPAI部分生效,类似J-space方案将成为"事实标准"
4. AI研究者:从"训练更大模型"转一部分精力到"机制可解释性+神经科学交叉"


五、悬念与下一步

J-space目前只覆盖"可用语言报告"的那部分想法,模型的"潜意识"仍是大片黑域。Anthropic下一步的方向可能是:把J-space与"内部表征溯源"结合起来,让模型主动回答"我为什么这么决策"——这才是AI与人脑最终接轨的临界点。

对OpenAI、Google DeepMind、xAI来说,下一代旗舰模型如不集成"思维可审计"能力,将在B端竞争中处于结构性劣势。可以预期,2026年下半年会出现"AI可解释性认证"——类比今天的SOC 2、ISO 27001。没有J-space类似方案的公司,将在金融、医疗、政企客户合同中处于被动。


数据来源

Anthropic官方论文(2026.07.06)、Neuronpedia Demo、GitHub开源仓库(Verbalizable Representations Form a Global Workspace in Language Models)、Stanislas Dehaene与Lionel Naccache公开评论
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

QQ|货物清仓|Archiver|手机版|小黑屋|倒数|舒尔特|好邻卡|RWA+DeFi|融资计划|内购渠道|Github|Web4

GMT+8, 2026-7-22 06:23 , Processed in 0.060784 second(s), 20 queries .

Powered by Discuz! X3.4

Copyright © 2001-2023, Tencent Cloud.