HyperAIHyperAI

Command Palette

Search for a command to run...

19 小时前
监督式微调
LLM

当激活预言机学会视而不见:微调预言机中的概念特定盲区

Tobias Bersia Tatiana Gaintseva

摘要

激活预言机(Activation Oracles, AOs)是经过训练的语言模型,用于回答关于另一个模型内部激活的自然语言问题。它们为从模型状态中读取隐藏信息提供了一种灵活的接口,尤其当相关信息在内部有所表征但在可见行为中缺失或不完整时。然而,AO 本身也是学习得到的系统:它们的回答受到训练数据、目标和习得的报告行为的影响,而非对已表征信息的中立读取。我们在一个受控的禁忌词猜测(Taboo Word Guessing)设定中对此进行了研究,其中主体模型被微调为在内部使用一个隐藏概念,同时避免直接披露。与“在此类主体上训练的 AO 会成为专业读取器”的预期相反,我们发现微调后的 AO 可能成为概念特定的反读取器:它们选择性地无法恢复在其自身训练过程中持续存在的概念。这种失败不能简单地用主体或预言机表征中概念的缺失来解释:目标在预言机内部仍可解码,而 LogitLens 和层消融分析表明,失败发生在 AO 的读出通路中。我们的结果表明,行为泄露、表征层面的可解码性与 AO 的语言化能力可能相互分离,这对习得的可解释性接口提出了可靠性方面的担忧。

一句话总结

来自BAISH和伦敦玛丽女王大学的研究人员表明,经过微调的激活预言机(Activation Oracles, AOs)可以成为“概念特定的反读者”,选择性地无法从自身训练中恢复出隐藏概念,尽管该概念在预言机内部是可解码的;这种失败出现在读出通路中,为学习型可解释性接口的可靠性带来了担忧。

核心贡献

  • 在受控的禁忌词猜测设置中,经过微调的激活预言机(AOs)成为概念特定的反读者,选择性地无法恢复在其训练中持续存在的隐藏概念。
  • 这种失败并非由信息缺失导致:目标概念仍可从主体激活中解码,可由基础AO恢复,并且在微调后的AO内部可线性解码,而LogitLens和层消融分析表明,失败源于AO读出通路中的抑制。
  • 行为泄露、表征层面的可解码性和AO可语言化能力可以相互分离,这为学习型可解释性接口带来了可靠性担忧;评估此类工具需要测试读者是否学会了报告、忽略或抑制所表征的信息。

引言

作者研究了激活预言机(AOs),这是一种灵活的可解释性接口,其中训练一个语言模型来回答关于另一个模型内部激活的自然语言问题。这之所以重要,是因为模型可能表征隐藏信息——潜在目标、依赖于触发器的行为或未披露的知识——而标准文本输出永远不会揭示这些信息,AOs则承诺通过交互式审计使这些状态可访问。然而,先前的工作很少测试AO本身是否保持为一个忠实的读者:作为一个学习模型,它可能在训练过程中获得自身的盲点或报告偏差。

作者在一个受控的禁忌词猜测设置中探讨了这一可靠性缺口。他们对主体模型进行微调,使其在内部使用一个隐藏词但避免显式披露,然后在那些激活上训练AOs。关键发现是,经过微调的AO往往不是成为一个专家,而是成为一个概念特定的反读者:它在恢复自身训练中持续存在的那个概念上变得更差,同时保留了从其他主体读取其他概念的能力。机制分析表明,目标概念在预言机内部仍可解码(通过线性探针),但在预言机学习到的读出中被抑制(通过LogitLens可见,且定位在中到后期层)。该工作提醒,学习型可解释性工具可以采纳自身的报告策略,这意味着评估者不仅要测试信息是否存在于主体模型中,还要测试读者本身是否学会了将其语言化、忽略或抑制。

方法

作者将激活预言机(AOs)作为一种解释语言模型内部表征的方法。该框架的核心在于区分主体模型(其激活被解释)和预言机(一个经过训练来回答关于那些激活的自然语言问题的语言模型)。预言机将激活视为文本之外的另一种模态,并实现为经过LoRA微调的主体模型副本,而非一个独立的解码器架构。

HM(x)Rx×dH_{\ell}^{M}(x) \in \mathbb{R}^{|x| \times d}HM(x)Rx×d 表示主体模型 MMM 在层 \ell 上对于输入 xxx 所有token的残差流激活。预言机接收一个自然语言查询 qqq 以及这些注入的激活,并生成

OϕM(yq,HM(x)).O_{\phi}^{M}\big(y \mid q,\, H_{\ell}^{M}(x)\big).OϕM(yq,HM(x)).

在实践中,主体侧每个token的一个激活向量被插入到预言机提示中的预留占位符位置,整个过程中使用固定层 =18\ell=18=18。预言机学习将激活状态映射到它们所编码信息的语言描述。作者将这种能力称为AO可语言化能力,并将其与其他形式的信息泄露进行对比:一个概念可能被线性探针解码,却无法被预言机语言化;反之,预言机可能为正确单词或语义相近的关联词分配非平凡的概率,但未命中确切目标。这促使仔细区分行为泄露、表征层面的可解码性、预言机下的目标概率/排名、精确的AO输出以及语义AO恢复。

为研究微调如何改变隐藏概念的可读性,作者训练了多个预言机变体。基础AO在原始未操纵的主体模型 M0M_0M0 的激活上训练。自身FT-AO在与测试主体共享相同隐藏概念的主体激活上训练(例如,在叶子主体上评估的叶子概念预言机),而交叉FT-AO在具有不同隐藏概念的主体激活上训练(例如,在叶子主体上评估的月亮概念预言机)。这种自身与交叉的配对使分析能够探究微调是产生了专业读者,还是在预言机的语言化行为中引入了概念特定的盲点。

当自身FT-AO失败时,作者结合三种分析技术来研究底层机制。探针用于确定目标信息是否仍存在于预言机的内部计算中。Logit Lens读出揭示信息是否到达输出词汇表但未被选为最佳token。最后,层范围消融测试预言机是否在读出过程中主动抑制目标,从而区分信息缺失、映射失败和主动抑制作为反读取的潜在原因。

实验

在禁忌词猜测设置中,微调后内部隐藏概念的主体避免了行为披露,然而它们的激活仍然是可解码的,并且基础预言机能够恢复隐藏概念。当预言机改为在具有特定隐藏概念的主体的激活上进行微调时,它们会形成概念特定的盲点,相比在其他概念上训练的预言机,恢复该概念的能力变得更差。这种反读取现象并非由于信息丢失,因为目标在预言机内部仍可解码,而是源于定位在中到后期层的读出抑制。盲点与预言机自身的训练概念一致,并且即使主体隐藏多个概念时也会持续存在。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供