libincao
← ARTICLES
2026.07.08 · 5 MIN · 中文 · AI

语言模型里的「全局工作空间」:Anthropic J-space 研究中文解读

Anthropic 发现 Claude 在训练中自发长出了一个内部的「全局工作空间」,他们戏称为 J-space。它像人的有意识注意:绝大部分处理是自动的、后台的,只有一小部分信息进到这里被刻意地多步推理。更有意思的是它的反证——把 J-space 删掉,Claude 说话依然流利、简单事实照样答得出,但复杂推理直接崩掉。这是一份面向中文读者的解读,含五大性质、五个关键实验,以及研究者在「意识」问题上的克制。

来源 · 解读自 Anthropic Research 的 A global workspace in language models。本文是中文解读与摘要,非逐字翻译;精确表述与完整论证请以原文为准。

一句话概括

Anthropic 的研究者发现,Claude 在训练中自发形成了一个内部的"全局工作空间",他们把它戏称为 J-space(J 空间)。它的运作方式类似人类的有意识、审慎的思考:Claude 绝大部分处理是自动的、后台的,只有一小部分信息会进入这个 J-space,在那里被模型刻意地、多步地推理

打个比方——就像开车:大部分动作是自动的(换挡、微调方向你根本不会去想),但遇到突发情况时,它会进入你的有意识注意。J-space 就是 Claude 版的"有意识注意"区域。


什么是 J-space

J-space 由一组和具体词语相关联的神经激活模式组成,Claude 可以在不把它写出来的情况下"想着"这些概念。

原文核心观点:J-space 在模型内部的神经激活中静默运行,让模型能够"思考一个概念,却不落于文字"。

也就是说,它是模型的**"沉默的念头"(silent thoughts)**所在之处——想到了、但还没说出口的东西。


研究方法:Jacobian lens(J-镜 / J-lens)

为了"看见"这些沉默的念头,研究者开发了一种技术叫 Jacobian lens(雅可比透镜,简称 J-lens)


J-space 的五大核心性质

性质 英文 通俗解释
可报告性 Reportability 你问它"在想什么",Claude 能说出 J-space 里的内容
可调控性 Modulability 你让它专注某概念,Claude 能主动控制 J-space 里放什么
推理性 Reasoning 这些沉默模式真的驱动了多步问题的求解(有因果作用,不是摆设)
灵活性 Flexibility 同一个内部表示(representation)能服务于多个下游任务
选择性介入 Selective involvement 绝大多数处理绕过 J-space,仍停留在自动层面

关键实验(很直观)

  1. 静默思考一个概念 让 Claude"心里想一个运动、先别说出来",J-space 里在它开口前就出现了 "Soccer(足球)"。研究者手动把这个模式改成 "Rugby(橄榄球)",Claude 的回答也随之改变。 → 证明 J-space 里的内容因果性地决定了输出,而不只是巧合。

  2. 刻意保持专注 让 Claude 一边抄写一段无关文字,一边"心里专注于柑橘类",它就能在 J-space 里静默地维持 "orange(橙)" 和 "fruits(水果)" 这些概念——展示了"边做别的、边默默推理"的能力。

  3. 多步推理的中间步骤 面对 "会织网的动物有 ___ 条腿",J-space 里会静默地浮现出 "spider(蜘蛛)" 作为中间推理步骤,尽管 Claude 最终只写出答案(八条腿)。 → 说明推理的"中间草稿"就存在 J-space 里。

  4. 灵活的概念表示 把 J-space 里的 "France(法国)" 换成 "China(中国)",Claude 关于首都、语言、货币的回答会同时全部改变。 → 一个概念表示,牵动多个下游事实。

  5. 删掉 J-space 会怎样 把 J-space 删除后,Claude 的流利语言、简单事实检索仍然正常,但复杂推理崩掉了。 → 反证:这个工作空间正是为复杂推理服务的。


为什么重要:AI 安全

J-lens 能揭示模型没说出口的隐藏行为,对发现"对齐问题(misalignment)"很有价值。研究中它成功检测到:


关于"意识"的谨慎讨论

研究者在这里很克制,区分了两种概念:

他们的结论很有分寸:Claude 表现出通达意识的若干性质——但不代表它拥有现象意识。他们并没有说 Claude "有感受"。


核心结论

J-space 是在训练中**自发涌现(emerged spontaneously)**的——没有人刻意把它设计进去。这暗示:

一个支持"意识式通达"的心智工作空间,也许并不是人脑独有的怪癖,而是智能系统在解决问题时会独立发现的一种通用计算方案

换句话说:不同的智能体,可能会各自"进化"出类似的"意识工作台"。


值得记住的英文术语

英文 中文 备注
global workspace 全局工作空间 认知科学里的经典理论(Global Workspace Theory)
emerge / emerge spontaneously 涌现 / 自发涌现 训练中"自己长出来",非人为设计
representation (内部)表示、表征 模型内部对一个概念的编码
deliberate / deliberately 审慎的 / 刻意地 与"自动的 automatic"相对
reportability 可报告性 能说出自己在想什么
fabricate (data) 编造(数据) 安全语境下的负面行为
phenomenal vs. access consciousness 现象意识 vs 通达意识 本文对"意识"的关键区分
causal / causally 因果的 / 因果性地 改 J-space 会改输出,说明是因果关系

说明:本文为帮助中文读者理解而作的解读与摘要,非官方译文;精确表述与完整论证请以 Anthropic 原文为准。