过去两年间,大模型领域的竞争焦点主要集中在两大方向:一方面是不遗余力地提升模型性能,另一方面则是深入探究模型“变聪明”的底层逻辑——AI究竟如何将不同能力串联起来,完成复杂的推理任务?
北京时间7月7日,Anthropic发布了一项颇具启发性的研究成果,题为《语言模型中的全局工作空间》(A Global Workspace in Language Models)。这项关于大模型可解释性的研究揭示了一个引人注目的发现:Claude模型内部存在一种类似人类大脑的信息组织模式,并且基于这种模式,模型能够进行某种程度上的“有意识”推理。

打个比方,人脑的信息处理过程,一部分是自动运行、悄无声息的,另一部分则是我们能够感知并控制的——比如盘算周末去哪儿采购。神经科学家和哲学家将后一种活动称为“意识通达”(conscious access),以区别于那些无意识的过程。
J-space:模型内部的“思维工作台”
有趣的是,研究人员在Claude内部也发现了类似“意识通达”的架构,并将其命名为“J-space”。你可以将它理解为模型的一个“思维工作空间”,专门负责需要深度推理和分析的任务,能够产生可报告、清晰的想法。更重要的是,它独立于自动语言处理模块之外。
这一发现相当于在大模型的“黑箱”上撬开了一条缝隙。以往我们总觉得模型内部可能是一团乱麻,但现在看来,它内部的信息组织方式竟然与人类自身的思维结构有相似之处。
更令人惊讶的是,Anthropic强调,J-space并非人为设计或写死在程序里的,而是在Claude的训练过程中自发涌现出来的。其背后的逻辑可能是:这种结构本身就是一种极其高效的计算组织形式。这也意味着,用于支持意识通达的“工作空间”并非人类大脑的专利,它更像是智能系统在解决复杂问题时自发采用的一种通用方案。
拔掉J-space会发生什么?
尽管J-space听起来非常关键,但它其实并不参与模型的大部分日常功能。
研究人员进行了一项实验,尝试将J-space整个移除。结果发现,失去J-space的Claude依然能流利地对话、对情绪进行分类、回答选择题,甚至可以大致还原从文章中提取事实的能力。但一旦涉及高阶思维任务,它立刻掉链子:多步推理能力几乎归零,概括和创作的输出水平甚至不如一个体量小得多的完整模型。
这就像一个人能够正常聊天,却无法完成逻辑题或撰写总结报告。
灵感来自神经科学
这项实验的灵感源自神经科学中一个著名的理论——“全局工作空间理论”(Global Workspace Theory)。该理论将大脑描绘成一系列专业系统的集合:视觉、听觉、语言、记忆各司其职,彼此独立。但当需要完成复杂思考时,这些系统会把信息发送到一个共享空间进行整合,然后像广播一样传达给其他区域,最终形成统一决策。
Anthropic发现,Claude的J-space恰恰扮演了这个“广播站”的角色。它与神经网络的其他部分连接得极为紧密。当模型需要回答一个复杂问题时,语言理解、数学推理、代码知识、世界知识这些能力并不会各自为战,而是会在一个或两个关键节点完成信息融合,再驱动后续的计算。换句话说,模型内部很可能存在一个类似“中央工作区”的协调机制。
算是有意识吗?别急着下结论
这一发现一出,不少人可能会想:AI是不是有意识了?别误会。Anthropic在论文最后也专门打了预防针——大模型拥有可意识通达的架构,只是一种计算结构上的相似性,但这绝对不代表它具备感受和心理学意义上的那种意识。
话说回来,如果这个研究方向能持续推进下去,它未来的影响可不只是学术圈的事。
比如,它为监控模型的“内心想法”提供了可能性。更深入地理解模型内部的计算过程,有望帮助研究人员更精准地定位模型为何会产生幻觉、推理出错或出现不安全行为,从而提升AI系统的可靠性与可控性。
再比如,可解释性能力很可能成为未来模型竞争的新维度。目前大模型行业已进入性能趋同阶段,各家不仅要证明自己的模型能力强,还要证明它更透明、更可控、更可信。
这项研究还可能影响未来的模型架构设计。如果J-space真的是复杂推理的关键拼图,那么下一代大模型或许不会再一味地堆参数、攒数据,而是会把重心放在信息整合机制的优化上。
