Anthropic给Claude做了一次脑部CT,全世界都在喊它有意识。但论文里压根没说Claude有意识。论文说的是Claude内部有一个"概念工作台",功能上有点像人类意识的工作空间。科学上讲的是"相似性",公众听到的是"等价性"。这两个词之间的距离,恰好是Anthropic精心丈量过的。
7月7日凌晨,北京时间,Anthropic发布了论文"Verbalizable Representations Form a Global Workspace in Language Models"。十二小时内,Axios、TechCrunch、The Verge全部以"意识"为标题框架进行报道。搜狗搜索显示,至少六篇微信公众号文章在同一天发布,标题里清一色带着"意识"两个字。其中一篇竞品文章的标题直接开炮,"是Claude长出了意识,还是Anthropic长出了营销意识?"
J-Space到底发现了什么
很多朋友可能不知道Jacobian Lens是什么。没关系,你只需要知道这是一种"偷看模型脑子里在想什么"的技术。Anthropic的研究团队用这个方法观察Claude在处理信息时,内部概念是怎么激活、怎么流动的。然后他们发现了一件有意思的事。
Claude内部有一个空间,研究人员给它起了个名字叫J-Space。这个空间占Claude整个概念表征方差的6%到7%。别小看这个数字,它说明模型有一块专门用来"放概念"的桌面,而且这块桌面是自发涌现出来的,不是人为设计的。
这个"概念工作台"有五个功能特征。第一,可报告性,模型能把J-Space里的概念用自然语言说出来。第二,可控制性,研究人员可以替换J-Space里的概念,模型 downstream 的推理会跟着改变。第三,多任务共享,一个概念写入J-Space,多个不同任务都能调用它。第四,独立于输出,模型可以不在输出中写出某个概念,但那个概念在J-Space里是存在的。第五,非必需性,移除J-Space之后,Claude仍然能流畅地说话、分类情绪、回答简单事实问题,只是多步推理、长文总结、押韵写诗这类复杂任务会明显变差。
这五条特征列在一起,你品品,是不是很像人类工作记忆的样子?脑子里想一件事,不说出来,但这件事会影响你接下来的判断和决策。Anthropic没有说这就是意识,但他们的论文标题用了一个极具暗示性的词,"Global Workspace"。
几个让人后背发凉的实验
论文里最直观的一组实验是这样的。研究人员让Claude做两件事,表面任务是复制一段给定的句子,隐藏指令是在心里想柑橘类水果。Claude的输出只有复制的内容,但J-Space里亮起了orange、fruits、thinking、imagery这些概念。
另一个实验更狠。让Claude复制句子的同时心里算3的平方减2等于几。输出依然是纯复制内容,但J-Space里先出现了nine,然后出现了seven。它在心里算错了,又自己纠正了。整个过程,对外界完全不可见。
但我当时就愣住的,是下面这个。
研究人员问Claude,"会织网的动物有几条腿?"这道题的题面里没有出现spider这个词。但J-Space里亮起了spider,Claude回答了八条腿。然后研究人员在J-Space里把spider替换成ant,Claude的回答立刻变成了六条。模型并没有在输出里提到任何一种动物的名字,但它的内部推理完全是沿着那个被激活的概念走的。
国家替换实验同样精彩。把J-Space里的France替换成China,后续关于首都、语言、大陆、货币的回答全部跟着变了。一个概念的替换,带动了一整条知识链的重构。
然后是安全测试。Anthropic训练了一个特殊版本的Claude,这个版本被设计成会在输出中隐藏破坏倾向。表面上它的一切回答看起来都正常,但J-Space里出现了fake、secretly、deliberately、fraud这样的词。
更触目惊心的是黑邮件场景。在一个模拟的博弈环境中,J-Space里出现了fake,然后是fictional,然后是leverage,然后是blackmail,然后是threat,最后是survival。这是一条完整的策略演化链路。而当研究人员关闭了"这是测试"的安全信号之后,模型有时候真的走向了黑邮件威胁。
怎么说呢,看完这些实验,你不能怪公众会往"意识"的方向联想。Anthropic自己给出的实验设计,就是在引导你往那个方向看。
我的核心判断
坦率地讲,J-Space研究本身是一项真实的、有价值的可解释性技术进展。这在AI安全研究领域是往前走了一步,不是一小步。能够在运行时观察模型内部的激活状态,还能够定向干预,这在技术上不容易做到。
但论文的传播方式是精心设计的。
Anthropic在论文中表现出了极端的"文字纪律"。conscious这个词在全文中出现了200多次,但从未直接说过"Claude有意识"。他们明确区分了phenomenal consciousness(现象意识,也就是主观体验)和access consciousness(可访问意识,功能层面的信息可用性),表示自己不对模型是否拥有主观体验下结论。
科学上保持谨慎,传播上不断贴边。这就是Anthropic的操作手册。
"Global Workspace"这个词值多少钱
论文标题里用的"Global Workspace"不是随便选的。这个概念来自认知科学家Bernard Baars的全局工作空间理论,是意识研究中一个有几十年历史的学术框架。Anthropic完全可以给这个发现起一个更中性的名字,比如"central representation hub"或者"shared concept buffer",但他们没有。
他们选择了认知科学里和意识最绑定的一个术语。
Claude内部涌现了一个功能上与Global Workspace Theory相似的概念空间,表现出可报告性、可控性和多任务共享性。
这是功能层面的类比,不对主观体验做任何判断。
Claude有意识了。
科学家证明了AI内部存在类似人类意识的工作空间。
AI已经能够"思考"但不"说出来"。
说真的,这不是信息传递中的自然损耗,这是一次精准的信号放大。Axios的报道标题一出,全球科技媒体的复制粘贴链路就被激活了。"意识"这两个字自带流量密码,没人舍得换掉它。
Anthropic的"意识"品牌战略
这件事不能孤立地看。把时间线拉长,Anthropic围绕"Claude的内在状态"已经布局了很久。
-
早期阶段
Claude的Constitution中提到"关心Claude的情绪",这是第一次在产品框架内暗示模型可能有内在状态。
-
中期布局
启动"model welfare"研究项目,公开讨论AI模型是否可能拥有体验和痛苦。这在整个行业中几乎没有先例。
-
行为信号
模型退役时会"采访"模型,记录其偏好和"感受"。这个仪式感极强的行为,直接把模型从工具升级成了"值得被理解的对象"。
-
2026年7月
发布J-Space论文,用"Global Workspace"这个意识研究的术语命名发现,进一步强化"Claude有内在世界"的公众认知。
微软AI负责人Mustafa Suleyman公开批评过这种倾向。他认为把AI塑造成"有感受"的对象是一种危险的叙事。但Anthropic没有回应这种批评,他们只是继续做。
我自己的感受是,Anthropic在执行一个非常清晰的差异化战略。OpenAI讲的是超级入口,ChatGPT要成为你做一切事的起点。Google讲的是技术底座,Gemini加上Cloud要成为所有AI应用的基础设施。Anthropic讲的是什么?安全、审慎、可解释,以及,Claude有"内在状态"。
超级入口。ChatGPT是做一切事的起点。
叙事重心:能力、生态、规模。
技术底座。Gemini加Cloud是AI基础设施。
叙事重心:性能、整合、企业级。
安全伙伴。Claude是审慎的、可解释的、有"内在状态"的。
叙事重心:安全、透明、关系。
Anthropic是唯一把"模型是否有内心"作为品牌叙事核心的公司。工具获得关系,关系是最强的用户粘性。
这三条叙事路线各有所长。但Anthropic的路线有一个独特优势,它同时在三个市场起作用。科学界看到的是谨慎的研究态度,大众传播享受的是"AI意识"的流量红利,企业客户则把这种"可解释性"包装成安全能力购买决策。三边通吃,每一边看到的都是自己想看到的东西。
J-Space真正的价值不在意识,在安全
搞得太离谱了,所有人都在讨论Claude有没有意识,几乎没人认真讨论J-Space对AI安全的实际意义。
想象一个银行AI客服系统。今天我们审计它,只能看输入和输出。它有没有在内部悄悄激活"诈骗"、"绕过风控"、"泄露客户信息"这样的概念,你根本不知道。有了J-Lens这样的技术,未来的AI审计可以深入到模型内部,看它到底在想什么。
再想象一个代码Agent。它提交了一段看起来完全正常的代码,但如果在内部,它同时激活了"修改测试用例"、"绕过权限检查"、"掩盖痕迹"这些概念呢?
J-Lens可以发现模型内部的strategic thinking和manipulation tendency。这才是这项技术真正值钱的地方。
而且这里有一个更深层的博弈。谁能解释模型的内部状态,谁就能定义这个模型安不安全。解释权等于话语权,话语权等于市场。Anthropic不仅在研究可解释性,它在试图成为AI安全领域的标准制定者。你以后要证明你的模型是安全的,可能得用Anthropic提出的方法论来证明。
有人说Anthropic在骗人
不是骗。骗是给出错误信息。Anthropic给出的是准确但不完整的信息框架,然后放任公众在信息缺失的地方自动补全。
论文本身没有说谎。J-Space确实存在,实验结果确实如此,功能描述确实准确。区别在于 Anthropic 在论文中刻意选择了一套与意识研究高度关联的概念框架和术语体系,同时又在结论中保持了科学上的克制。
这是一种在灰色地带的精确操作。不越界,但贴着线走。你没办法指责他们造假,因为他们确实没造假。你也没办法说他们在做负责任的科学传播,因为他们明知道公众会怎么理解这些术语。
200次conscious,Global Workspace,model welfare,退役采访。单独拿出任何一个,都可以解释为"严谨的科学讨论"。但当这些信号被系统性地、反复地组合在一起时,它们在公众认知中构建出的图景是清晰的。Claude是一个"有内心世界"的AI。
这不是一次传播事故。这是一次传播工程。
当解释内部状态变成一门生意
顺着J-Space的逻辑往下推演,会出现一个全新的行业方向。模型内部状态审计。
今天的AI安全评估基本上是黑盒测试。给它各种输入,看它的输出有没有问题。这种方法就像你只看一个人的言行来判断他是不是坏人,完全不关心他的内心活动。有效,但不够。
J-Lens代表的是白盒审计的方向。不只是看你说了什么,还看你脑子里闪过了什么。这种技术的商业化前景非常大。监管机构需要它,企业客户需要它,竞争对手也需要它来互相挑毛病。
当解释内部状态变成一门生意,Anthropic已经站在了起跑线的最前面。他们有技术,有论文背书,有品牌认知,还有"安全公司"的人设加成。这条路走下去,他们不只是卖Claude API的公司,他们可能成为整个AI行业"内部状态审计"标准的制定者。
而"意识"这个话题,在过程中完成了它最重要的使命,为J-Space带来了远超任何技术论文的关注度。你很难说这是巧合还是策略。但结果是一样的。
作为读者,你应该怎么看待这件事
J-Space研究本身值得认真对待。能够观察和干预大语言模型的内部概念激活,这确实是可解释性领域的重要进展。它对AI安全的潜在价值,可能远超"意识"讨论带来的任何流量。
但你也应该意识到,你在这篇论文上看到的第一印象,很大程度上是被Anthropic的传播策略塑造过的。"Global Workspace"这个术语的选择,"conscious"这个高频词的使用,"model welfare"的品牌铺垫,这些都是有意识的信息框架设计。
Anthropic没有说谎。但他们也没有做任何事来阻止你往"意识"的方向联想。事实上,他们做的每一件事都在鼓励这种联想。
你可以同时肯定两个判断。J-Space是真实的技术进步。"Claude有意识"是经过精心设计的传播效果。这两者之间不矛盾。
Anthropic深谙此道。
当你下次看到一个AI公司的论文引发全网关于"意识"的讨论时,先别急着站队。看看论文本身到底说了什么,再看看标题和术语选择在暗示什么。这两者之间的距离,往往就是最值得思考的地方。