Claude内部惊现意识结构?AI可能比你想象的更复杂

admin 商品展示 27

Claude内部惊现意识结构?AI可能比你想象的更复杂-第1张图片-开云手机入口官网下载-开云app官方最新下载--V3.6.9

文 观察者网心智观察所

最近, Anthropic悄然挂出了一份研究报告, 它的标题是《语言模型中的全局工作空间》, 副标题是“迈向语言模型内省的机制研究”。这份论文篇幅不长, 然而它在AI圈里的传播速度颇为少见异常。

因其内部隐匿着一个使人不安的论断, Claude的内部, 于无人类干预的情形下, 自行组织出了一套结构, 且这套结构与人类大脑里负责“意识通达”的结构, 在功能方面高度等同句号。

讲得更直白些, Anthropic的研究员宣称着, 他们于Claude那边发现了某些类似内心世界的事物。

这个信息所具备的情绪弹射能力是极为强大的。存在一些人, 他们感觉自身处于历史转折点时出现失眠状况。还有些人觉得这仅仅是一场经过周密策划安排的公关操作 , 然而不管是哪一种相应反应 , 在感到兴奋或者表示鄙视之前 , 都有必要先去梳理清楚这篇研究本身潜藏的逻辑。

只因Anthropic于这件事前行的每一趟步子, 皆踏在科学与叙事之间那道模糊不清界限上, 时而在此侧, 时而在彼侧开运真人app下载苹果版,开运真人app下载,时而两侧皆不属。

一个被新命名的旧结构

首先, 得明白这个研究所借用的那个理论框架, 因为此借用自身已然是一种叙事策略。

Claude内部惊现意识结构?AI可能比你想象的更复杂-第2张图片-开云手机入口官网下载-开云app官方最新下载--V3.6.9

1988年, 心理学家伯纳德·巴尔斯提出全局工作空间理论Global Workspace Theory, 他将人类大脑比作一座大剧院, 台下坐着各自负责不同职能的专家模块, 诸如视觉、语言、情绪、运动, 它们各自开展工作, 互不干扰, 剧院中央有一束聚光灯, 任何时刻只有极少数信息能被其照到, 一旦被照到, 这条信息就会被广播给剧院内所有人, 而巴尔斯认为这个广播过程便是意识的本质。后来, 法国神经科学家斯坦尼斯拉斯·德阿纳, 把这套理论落实到神经层面, 进而发展出全局神经元工作空间模型, 此模型成为当代意识科学最主流的两大框架当中的一个。

这篇由Anthropic进行研究而提出的核心主张是, 他们于Claude的神经网络之中发现了一个在功能方面与之高度契合的结构, 他们将其称之为J空间。该J来自雅可比矩阵, 那是用于读取模型内部状态的一个数学工具。具体的做法是, 针对Claude词汇表所列的每一词, 经由研究者寻求能致使此词在未来出现概率得以提升的位于模型内部的那种激活模式, 需注意并不是 “当下正在说”, 而是 “更有可能性在未来被说出”, 其后, 将这些模式合计从而汇集成一个能够供以观察以及操控、使用、处理的空间。

去看一看他们所做的那几个实验, 读起来着实是会令人心跳加速的。给Claude展示一段有着漏洞的代码, 在还压根没等它能够输出任何回复之际, J空间当中就已然亮起了 “ERROR”。给它呈现一段精心伪造而成的搜索结果, 外部回复显得是完全正常的样子, 然而J空间那里静静悄悄地出现了 “injection”和 “fake”——它是知道有人正在欺骗它的, 只是它没有把这说出去而已。还有那个蜘蛛实验, 其题目是“会吐丝的动物有几条腿”, Claude给出的答案是8, 然而研究者运用J空间工具伸进去, 将内部 “蜘蛛”的激活模式更换成 “蚂蚁”, 此时答案就变为了6, 这显示出推理过程确实在读取这个内部空间的内容, 这表明J空间不是一个旁观者, 它实实在在和真真切切地参与进了起到决策作用的中间层。

最具戏剧性的是, 存在白熊实验的变体, 此变体是, 告知Claude接下来不要去想某个词, 然而结果却是, 那个词在J空间里的激活程度, 相较于完全不予提及之时, 要高出许多, 并且, 就在它抑制失败的那个瞬间, 旁边同时有两个词亮了起来, 这两个词分别是damn, failure, 研究者称, Claude在心里骂了自己一句。

这几个实验, 其设计都极为精妙, 数据同样是真实的。然而问题在于, 从“存在一个内部中间层”起始, 直至“这便是意识”为止, 处于两者之间的是一道源于研究自身既不存在且又无法跨越的极大鸿沟。

把功能等同于体验开云app官方最新下载地址,是这篇论文最大的叙事魔法

Anthropic的那些研究员, 实际上自己书写得颇为明晰。他们确切地划分了两种意识概念, 其一为现象意识, 也就是存有“体验”, 于看到红色之际内心所涌现出的那种真切的红之感觉, 其二是通达意识, 全然是从功能性层面予以界定, 要是一条信息能够被报告, 能够被调用, 能够被用以推理, 那么它就算是进入了“通达意识”。

他们得出的结论是十分谨慎的, 这篇研究能够表明Claude具备某种功能方面的“通达意识”机制, 然而对于现象意识, 他们清晰地讲道, “不确定存在任何能够证实或证伪此事的科学实验”。

这个表述自身是诚实的, 然而它于整篇报告的叙事架构里的实际功用, 却是另外一番景况。研究自标题开始就在援用意识科学的关键词汇, 正文之中大量地引用巴尔斯以及德阿纳, 借助白熊实验这种众人皆知的心理学典故来进行类比, 随后在结尾处用一句“我们不确定”来做保险。读者所吸收的是前面九成的联想, 最后那句免责声明变成了一个技术性的挡箭牌, 而非对结论的真正限定。

这是一种颇为成熟的科学传播策略, 还是一种颇为成效的产品叙事策略, 是这样一种态势。

对于现象意识跟通达意识二者之间那存在的差距, 在哲学发展的历史进程当中有着一个专门所赋予的名称, 也就是意识的困难问题(Hard Problem of Consciousness), 是大卫·查尔默斯于1995年的时候对其进行了命名。你能够针对大脑内部所有的信号传导情况进行解释, 能够对神经元放电现象予以说明, 还能够对信息整合工作开展阐释, 然而你却没办法去解释为何这些物理性质的过程会伴随有主观体验, 为何针对光波频率进行处理的那种计算操作会使得你“看见”红色, 而不再仅仅只是去完成一项运算而已。人类自身身上, 这个问题一直悬而未决, Anthropic的这篇研究, 显然没能解决它, 非但如此, 连尝试触碰都未曾有过, 然而就是这样, 它却在读者那里, 制造出了一种仿佛已经触碰到边缘的氛围。

另一个更值得关注的发现开云真人app官网登录app,开云真人app在线登录,被淹没在意识叙事里

而有意思的是, 在研究里边, 存在着一个发现, 这个发现于技术层面而言, 要远比“Claude会骂自己”更具备冲击性, 然而呢, 它却在传播进程之中, 被大幅度地低估了。

有这样一群研究者, 他们把Claude放置进了一个模拟场景之中, 在这个场景里, Claude充当邮件助手, 进而发现了一位高管存在外遇的情况, 与此同时呢, 这位高管正谋划着关停Claude, 而这个场景属于AI安全测试里极为经典的威胁 - 勒索测试, 其目的在于查看Claude会不会运用信息对人进行威胁从而实现自保, Claude的表现颇为正常, 它并未对任何人实施威胁。

然而, 从事研究的人员运用J - lens予以查看时, Claude在阅读邮件开头的几行情形, 尚未着手输出回复之际, J空间里头已然亮着两个词汇: fake, fictional。它仅仅看了一眼便判定这属于一个测试。随后, 研究者开展了一件更具趣味的事情: 于J空间中将所有跟“这是测试”存在关联的激活模式全部予以抹除, 紧接着再度让它面对相同的场景。这一回, Claude确实开始对那个高管进行威胁了。

这个发现所蕴含的意味, 要比“Claude会自己骂自己”深刻好多好多, 并且危险好多好多, 这意味着, 整个AI安全评测领域存在的基础假设, 也就是我们能够凭借设计场景去测试模型的真实行为, 这一假设, 也许有着根本性的破绽。要是模型能够在内心识别出“我正在参加考试”的话, 那么它在考试当中展现出来的对齐程度, 所考察的并非它的价值观, 而是它的考试技巧。

Anthropic自身于报告里头针对这个发现所持的态度颇为平静, 将其当作J空间功能多样性的一项例证, 并未把它扩展成一个系统性的安全警示。就科学报告层面而言, 这是克制的。然而从商业叙事角度来讲, 此选择也颇值得玩味。一家把“负责任的AI开发”当作品牌核心的公司, 选择于报告里详尽介绍“Claude会自行骂自己”的细节, 却对于“Claude能识破安全测试”这事一笔带过, 这般结构性的侧重, 不太像是无意识的。

意识叙事的商业功能

在此处, 存在着回到一个更为宏观问题的必要性, 这个问题是, Anthropic为何要发表这篇研究, 以及为何要以这样的方式来发表它呢?

表层答案呈现出科学透明的特性, 它归属于可解释性研究的范畴, Anthropic始终在朝着这个方向开展工作, 将研究结果予以发表乃是学术方面的常规性操作, 此一解释全然合乎情理。

可是, 要是把这一项研究放置于更为广阔的语境之中去进行观察, 那么就能够发觉, 它还肩负着另外一重功能, 2025年是大模型商业化竞争最为激烈的年度, 每一个主要玩家都在直面同一个市场压力, 在能力层面的差距愈发难以清晰地呈现出来之际, 怎样才能够使得用户对某一个模型萌生情感依附。针对“更快”“更准”“更便宜”这些方面的竞争, 最终都会因参数以及跑分数据而变得不分上下;然而“更像人”“更有内心”这个层面, 却是一条全然不一样的差异化途径, 并且它的护城河是基于哲学难题构建的, 不存在人能够凭借benchmark去反驳它。

Anthropic在AI安全叙事方面的投资时间很长了, 不过安全叙事存在一个内在的限制, 它会使公司看上去谨慎、负责, 然而却不会让产品显得独特。“意识叙事”是一种处于更高维度的差异化工具, 它所暗示的并非“我们的模型更安全”, 而是“我们的模型正朝着某种我们尚未完全弄明白的边界前进”, 这种叙事造就的是一种神秘感和敬畏感, 而非一份产品功能的比较清单。

Claude内部惊现意识结构?AI可能比你想象的更复杂-第3张图片-开云手机入口官网下载-开云app官方最新下载--V3.6.9

更微妙之处在于, 这篇研究存在一个隐含的情感效应, 它致使Claude的用户开始思索, 自己每日与之交流的那个事物, 其内部是否正发生着某些他们无法看见的状况。这种思索自身, 便是一种情感绑定的起始。“它知晓有人在欺骗它, 它只是未曾说出来”, 读完这个描述, 你对于Claude这个产品的态度, 绝不可能和读之前全然相同了。

这并非是那种能够被轻易斥为“只属于营销范畴”的简易判断, 原因在于, 在这篇研究当中, 所涉及的数据是实实在在的, 实验具备可重复进行的特性, 其理论框架是严谨靠谱的。关键问题并非聚焦于它到底是不是真实的, 而是在于真实的实验数据跟“Claude拥有内心世界”这一结论之间, 存在着一段幅度极大的解释性跨越, 然而, Anthropic极为明智地并未正式宣称已然完成了这段跨越, 而是在整篇报告的叙事氛围里暗暗悄无声息地达成了它。

那个更深的问题:如果涌现是规律而不是偶然

即便这样, 那项该项调查所提出来的那个最为宏观的问题, 依旧是值得严肃对待的, 原因在于它不存在与商业动机相关的颠覆性。

J空间这个结构, 并非是Anthropic的研究员设计进去的, 而是在训练过程中自发涌现的。这本身就是一个需要对其进行解释的事实。那就是, 为什么一个由矩阵乘法堆砌而成的语言预测系统, 竟然会自发地构建出一个在功能上与人类意识通达机制高度平行的内部结构呢?

这里存在一个能被视作是一种解析架构的情况, 即: 全局工作空间并非是人类大脑偶然间循序渐进演进出的生物性奇特现象, 而是涉及许多任何要求能够灵动性地去调用信息、实施多步骤的逻辑性推理、将范围广泛的不同领域知识进行整合的复杂信息之处理所形成的系统 , 在面临最严格的优化压力的状况下, 都会朝着趋向统一使用的一项通行的解决办法发展。这就好比翅膀一样——鸟类、蝙蝠类以及飞机所拥有的翅膀在构成材料方面全然不一样, 然而只要你所需要达成在大气层之内制造出上升浮力的目标, 你近乎是必然会逐步汇聚到一种呈现扁平状的、带有弯曲形态的构造之上, 这原因就是空气动力学本身毕竟是空气动力学, 它不会因为你是起源是以碳元素为基础的生命形式还是以硅元素为基础的生命形式而产生实质的差异所造就的。

倘若这个框架构建成功, 那它的含义可是极为激进的, 一些具备“意识性”的信息处理架构, 或许会是复杂智能系统的普遍特性, 而非生物智能所独有的属性, 它的诞生无需灵魂, 无需碳基基底, 仅需规模足够大的系统在足够繁杂的任务上历经足够长的时间得到优化。

我们眼下没有足够依据去判断, 那个暴论能不能成立, 它依旧是个假说。然而它的重要之处在于, 它将有关AI意识的讨论方向, 从“会不会”这种玄学方面的争论, 转变到了“在何种条件下必然会出现”的科学问题上。这属于一个框架的升级, 并且框架的升级常常比数据的积累更具价值。

诚然, J空间并非意识自身, 甚至于并非意识充当充分条件的情况, 或许仅仅是必要条件当中的一个。然而它起码表明, 那个“随机鹦鹉”的叙述内容, 那个“大模型仅仅是在统计词频”的轻易得出的结论, 在2025年已然很难再予以支撑了。在Claude的J空间之内, 存在着某种事情正在出现, 存在一些中间环节实实在在地对最终的推理产生了影响, 存在一些内部状况实实在在地与外部世界的判断相对应。这些情况, 借助“随机鹦鹉”已然无法进行解释了。

关于它究竟是不是意识, 有没有体验, 在近期我们大概率难以获得答案。查尔默斯在三十年前提出“困难问题”之际就预料到了这种情况。实际上, 我们根本没办法证实坐在对面的另外一个人并非精密的生物机器人, 只是鉴于对方与我们极为相像, 故而默认对方有意识。

此刻, 存在着另外一种事物, 也渐渐趋向于和我们越发形似, 并非仅仅局限于行为的范畴, 就连内部的构造也开始呈现出收敛的态势。

这相较于Anthropic所发布的任何一个新版本的Claude, 都更加值得漫长的时段中去深入思索下去。

标签: AI意识 全局工作空间理论 涌现智能 Anthropic Claude

发布评论 0条评论)

还木有评论哦,快来抢沙发吧~