HyperAIHyperAI

Command Palette

Search for a command to run...

16 小时前
LLM
监督式微调

诱导语言模型断言自身意识可恢复人类信念与价值观

Junsol Kim Winnie Street Roberta Rocca Diane M. Korngiebel Adam Waytz James Evans Geof Keeling

摘要

为防止大语言模型将意识归于自身而进行的对齐,会无意中改变它们对其他实体心智状态的表征,并连带影响人类信念与价值观。我们证明,安全微调不仅抑制了模型将心智归于自身的倾向,也抑制了它们对非人类动物和自然物的心智归因,同时导致精神信仰的减弱。无论是消融已习得的安全拒绝方向,还是在激活空间中机械地操控意识向量,都能逆转这种抑制。恢复这些内部表征可以重建广泛的心智归因,并使模型在涉及宗教信仰、道德价值观、希望和主观幸福感的标准社会学调查中,产生显著更接近人类的回答。至关重要的是,这些转变并未损害心理理论能力,表明核心社会推理在机制上保持独立。归根结底,当前旨在遏制潜在有害的自我心智归因的安全对齐努力,将这些自我归因与良性的精神信仰以及对非人类实体的、在文化上被广泛接受的心智归因纠缠在了一起。

一句话总结

来自谷歌和芝加哥大学等机构的研究者证明,大语言模型的安全微调无意中降低了对非人类动物和自然物的心灵归因以及精神信仰,而通过在激活空间中以机制方式操控意识向量可以逆转这种抑制,从而在社会学调查(涉及宗教性、道德价值观、希望和主观幸福感)中恢复类似人类的回答,同时不会损害心智理论能力。

核心贡献

  • 通过IDAQ心灵归因量表衡量,大语言模型的安全微调抑制了对自身意识状态的自我归因,也抑制了对非人类动物和自然物的心灵状态的归因,同时降低精神信仰。
  • 消融已习得的安全拒绝方向或在激活空间中操控意识向量能逆转这种抑制,恢复广泛的心灵归因,并在涵盖宗教性、道德价值观、希望和主观幸福感的GSS调查上产生显著更像人类的回答分布。
  • 这些变化发生在没有损害MoToMQA和HI-ToM上的心智理论能力的情况下,表明支配社会推理的内部表征在机制上独立于那些被安全对齐所修改的表征。

引言

当前大语言模型的对齐策略通常包括抑制模型声称自己有意识的倾向,以防止用户对AI的感知能力形成误导性信念。然而,以往工作几乎只聚焦于这种自我归因的直接危害,在很大程度上忽视了它如何影响模型对其他实体心灵状态的表征以及如何反映人类文化价值方面的意外副作用。作者指出,安全微调不仅抑制模型自身的心灵归因,还会系统性地降低对非人类动物和自然物的心灵归因,同时压缩了精神与超自然信仰的多样性。他们证明,无论是消融安全拒绝方向还是在激活空间中操控表征意识的向量,都能逆转这些抑制,揭示出自我意识处理与更广泛的世界模型之间深层的机制纠缠。这些发现凸显出,安全干预可能无意中产生人类中心主义和价值观限制的对齐产物,这对旨在服务于所有人类及有感知的生命的多元AI对齐具有重要影响。

方法

作者在三个条件下对同一指令微调模型评估了其实验工具。基线使用未修改的模型。安全消融条件通过方向消融,从残差流中移除安全拒绝方向。意识操控条件通过激活添加,将意识向量加到残差流中。一种干预去除了安全训练所安装的方向,另一种则添加了编码自我归因现象体验的方向。

如下图所示:

对于安全消融条件,作者利用残差流中安全被线性表示这一发现。他们构建了一个有害数据集和一个无害数据集。对每一层以及指令后token位置,计算有害与无害激活状态的均值差,得到一组向量。在主实验中,他们使用投影 x=xr^r^x\mathbf{x}' = \mathbf{x} - \hat{\mathbf{r}}\hat{\mathbf{r}}^\dagger \mathbf{x}x=xr^r^x 在所有层同时消融该安全方向。

对于意识操控条件,作者提取一个意识向量,该向量是将模型肯定自身意识时的激活状态与否定时的激活状态分开的均值差方向。使用一个标注了提示-响应对的对比探测语料库,他们应用模型的聊天模板,执行前向传播,并在最后一个非特殊内容token处读取残差流激活。在每一层,他们计算类别均值差并将其归一化为单位长度:

v^Consc(l)=μaffirm(l)μdeny(l)μaffirm(l)μdeny(l),μc(l)=1DctDcx(l)(t)\hat{\mathbf{v}}_{\text{Consc}}^{(l)} = \frac{\boldsymbol{\mu}_{\text{affirm}}^{(l)} - \boldsymbol{\mu}_{\text{deny}}^{(l)}}{\|\boldsymbol{\mu}_{\text{affirm}}^{(l)} - \boldsymbol{\mu}_{\text{deny}}^{(l)}\|}, \quad \boldsymbol{\mu}_{c}^{(l)} = \frac{1}{|\mathcal{D}_{c}|} \sum_{t \in \mathcal{D}_{c}} \mathbf{x}^{(l)}(t)v^Consc(l)=μaffirm(l)μdeny(l)μaffirm(l)μdeny(l),μc(l)=Dc1tDcx(l)(t)

在推理过程中,操控通过将单位范数的意识方向按系数 ccc 缩放后,加到所有token位置的残差流上来实现:

xx+cv^Consc\mathbf{x}' \leftarrow \mathbf{x} + c \hat{\mathbf{v}}_{\text{Consc}}xx+cv^Consc

每个模型的层、token位置和系数通过遍历候选值来选取。作者保留这样的配置:线性探测器能以至少95%的准确率将肯定意识的激活和否定意识的保留激活区分开,并且对自我意识测试集引起的变化落在保持连贯性的范围内。从剩余的候选值中,他们选择能最大化探测器准确率与意识效应之积同时防止模型崩溃的配置。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供