Command Palette
Search for a command to run...
SAESCIENTIST-BENCH:AI 智能体能否开展自主的 SAE 可解释性研究?
SAESCIENTIST-BENCH:AI 智能体能否开展自主的 SAE 可解释性研究?
Yuqiao Tan Shizhu He Jun Zhao Kang Liu
摘要
尽管递归自我改进(RSI)研究主要聚焦于自动化模型训练流程,但可靠的自主开发仍缺失一个关键支柱:用于理解模型所学内容并确保安全对齐的事后监控与审计。机制可解释性工具对于弥合这一鸿沟至关重要,其中稀疏自编码器(SAE)通过分离可解释特征以供模型检查与引导,发挥着基石作用。本文提出 SAESCIENTIST-BENCH,旨在评估 AI 智能体能否像科学家一样,利用 SAE 工具进行自主机制发现。给定一个目标概念,智能体需设计对比探针,并在 Gemma-2-9B-IT 的 Gemma Scope 字典(包含 131K+ 个特征)中进行搜索,以发现最优特征,其表现将依据 Neuronpedia 上锚定的专家参考特征,从激活排序、对比文本上的概念选择性以及因果引导三个维度进行评估。在 10 种智能体配置和 20 项任务中,前沿智能体展现出真实的发现能力,并在不同评估维度上领先,但仍显著落后于专家基线:在区分目标概念与对比控制项方面接近专家水平,而在因果生成引导方面则大幅滞后。进一步分析表明,尽管智能体能够设计对比以排除虚假候选特征,但它们经常误读实验测量结果。这些结果将实验性模型理解确立为闭环自主 AI 研发的一项可衡量能力。我们的代码已开源,地址为 https://github.com/Trae1ounG/SAEScientist。
一句话总结
中国科学院自动化研究所和中国科学院大学的研究人员提出了 SAESCIENTIST-BENCH,一个基准测试,其中 AI agent 设计对比探针,并在 Gemma-2-9B-IT 中导航包含超过 131K 个特征的 Gemma Scope 字典,以发现给定概念的最优特征,并根据激活排名、概念选择性和因果调控的专家参考进行评估,结果表明,在 10 种 agent 配置和 20 项任务中,前沿 agent 展示了真正的发现能力,并在将目标概念与对比控制分离方面接近专家水平,但在因果生成调控方面明显落后,从而将实验性模型理解确立为闭环自主 AI 研发的一项可衡量能力。
核心贡献
- SAESCIENTIST-BENCH 将 AI agent 评估为科学家,通过在 Gemma-2-9B-IT 中导航包含 131K+ 特征的 Gemma Scope 字典,使用假设驱动的对比探测,并根据激活排名、对比文本上的概念选择性以及因果调控对候选特征进行评分,自主发现可解释的特征。
- 在十种前沿 agent 配置和 20 项任务中,agent 在激活空间中将目标概念与对比控制分离方面接近专家水平,但在因果生成调控方面存在显著差距。
- 行为分析表明,有效的发现依赖于严格的假设检验、设计信息丰富的反例以及准确解释实验测量结果,而不仅仅依赖于探索量。
引言
推动递归自我改进(即 AI agent 自主发现并优化模型)的进程中,目前仍将这些模型视为仅通过外部任务指标评估的黑箱。这使得自主训练循环容易受到奖励黑客攻击和欺骗性对齐的影响,因为内部表征未被检查。稀疏自编码器(SAE)可以将模型激活分解为可解释的特征,这些特征同时支持审计和因果调控,但目前尚无标准化的基准测试来衡量 AI agent 执行此类机制发现的能力。作者提出了 SAESCIENTIST-BENCH,一个包含 20 项概念发现任务的基准测试,要求 agent 设计对比探针,在 Gemma-2-9B-IT 中导航大型预训练 SAE 字典,并选择特征,根据专家策划的基线在激活排名、选择性和因果调控方面进行评估。
数据集
作者提出了 SAESCIENTIST-BENCH,这是一个旨在评估稀疏自编码器(SAE)字典中自动化特征发现的基准测试。它不是一个训练数据集,而是一个固定的评估套件,仅用于提交后的基准测试。
-
构成和来源
- 20 个发现任务,每个任务将一个目标概念与 Gemma-2-9B-IT 基础模型的特定层(第 9 层或第 20 层)配对,使用预训练的 Gemma Scope 残差流 SAE。
- 概念涵盖多语言理解(葡萄牙语、西班牙语、拉丁语、土耳其语)、专业文档格式(收益报告、税务申报、招聘信息)以及特定领域知识(临床症状报告、药物剂量)。
- 对于每项任务,都提供了一个专家参考特征,该特征锚定在 Neuronpedia 的公开调控预设中,或通过标准专家工作流程在正面和对比文本上策划。
-
任务结构和评估套件
- 每项任务包含三种类型的评估文本:表达概念的正面文本、包含易混淆替代方案(例如,用英语讨论葡萄牙语)的硬负例文本,以及中性控制文本。
- 任务还包括评估提示,以衡量对下游生成的因果调控效果。
- 每层的 SAE 字典包含 131,072 个特征;agent 必须识别出最能代表该概念的单个特征。
-
使用和处理
- 基准测试在 agent 开发期间严格冻结;任务描述、专家特征和评估套件仅保留用于最终评估。
- 论文使用该基准测试来评估 agent 定位概念表征特征的能力,并根据保留的专家参考来衡量性能。由于数据仅用作零样本评估集,因此不应用训练集划分、混合比例或裁剪。
方法
所提出的框架利用稀疏自编码器(SAE)来解释和干预语言模型表征。语言模型将输入文本映射为 token 级别的隐藏状态。在选定的层,SAE 将隐藏状态 h∈Rd 编码为非负特征激活的稀疏向量 z∈Rm,并通过线性解码器重建状态:
z=Encoder(h),h^=bdec+f=0∑m−1zfdf其中 m 是字典大小,bdec 是重建偏置,df 表示特征 f 的解码器方向。为了对模型生成进行因果干预,激活调控在推理过程中将特征解码器方向直接添加到隐藏状态:h←h+αdf,其中 α 控制干预强度。
基于这些预备知识,作者引入了 SAEScientist-Bench 工作流程,以评估 agent 发现可解释特征的能力。参考框架图:
系统设计分为三个主要阶段:基准构建、agent 发现和评估。在基准构建阶段,一项任务将一个目标概念与配备了预训练 SAE 的基础语言模型的特定层配对。基准测试提供了一个评估套件,包括正面文本、硬负例文本和中性控制。一个包含专家特征 ID 和评估集的冻结专家数据包被建立为严格的参考标准。
在 agent 发现阶段,agent 接收概念描述和 SAE 规格。它迭代地设计探针文本以激活特定特征,并查询探针 SAE 接口。该接口接受 agent 编写的文本,并返回 top-k 激活特征或测量一组提供的候选特征,提供它们在完整字典中的激活值和排名。agent 根据这些反馈信号修改其探针和候选特征,直到提交最终的特征 ID。
最后,在评估阶段,使用 agent 特征 ID 和专家特征 ID 对提交的特征进行评估。激活测试测量评估文本上的特征激活,以计算在所有特征中的排名和文本分离 AUROC。调控测试通过将激活调控应用于固定模型,比较评估提示上的生成结果。输出结果根据流畅性、提示遵循度、目标行为和伪影缺失进行评估。整体性能计算为排名、激活和调控得分的平均值。
实验
该基准测试在 SAE 字典中的 20 个单特征发现任务上评估前沿 agent,衡量激活排名、选择性和因果调控。Agent 在激活选择性方面展示了强大的概念分离能力,但在因果调控方面始终落后于专家基线,揭示了识别相关特征与发现因果有效方向之间的关键差距。搜索策略差异很大,成功更多地取决于严格的假设检验和反例设计,而非搜索量。总体而言,结果突显了自主机制可解释性仍然具有挑战性,尤其是在将表征发现转化为可靠的因果干预方面。
该基准测试将任务分布在四个概念族中——语言、日常领域、专业领域和专业报告——第 9 层承载大多数类别,第 20 层专用于专业和专业任务。由多个 agent 识别出的葡萄牙语专家特征 L9·41424 可靠地将生成调控为流利的葡萄牙语,而许多其他特征尽管激活分离很强,却未能产生任何因果效应。因果调控揭示了仅仅与概念相关的特征与对模型输出施加真正控制的特征之间的明显分界。语言任务(例如葡萄牙语)仅出现在第 9 层,而专业报告(例如临床报告)仅在第 20 层。专业领域任务(例如税务申报)是唯一同时存在于两层的类别,每层的任务数量相等。由 Sol、Opus 4.8 和 Kimi K3 发现的葡萄牙语专家特征 L9·41424 成功地在不同指令下诱导出流利的葡萄牙语。由 Opus 5、Sonnet 5、Grok 4.6 和 Luna 提交的特征在调控中产生零目标相关性,尽管在静态文本上激活分离很强。Sol 的干预在保持指令的同时获得了最高的调控得分,而 Opus 4.8 的调控导致了重复和长度漂移。因果调控将可操作的机制与表面的激活相关性区分开来,因为只有一小部分特征能够可靠地控制生成。
前沿 agent 在激活排名、选择性和因果调控方面表现出强劲但不均衡的性能,不同模型在不同维度上领先。虽然 agent 在激活选择性上接近专家水平,但因果调控得分仍远低于专家基线,揭示了将特征相关性转化为可靠干预的持续差距。顶级 agent 之间的总分聚集紧密,但没有单一模型在所有三个评估轴上占据主导地位。Claude Opus 5 实现了最高的激活排名,表明其特征在整个字典中被最显著地激活。Kimi K3 在激活选择性上领先,在区分目标概念与对比文本方面几乎与专家持平。Grok 4.6 获得了最高的调控得分,但这仅约为专家调控性能的一半。前三名 agent 之间的总分差距很小,Kimi K3、Claude Opus 5 和 Claude Sonnet 5 的得分紧密聚集。尽管选择性很强,但所有 agent 的调控得分都远低于专家,凸显了因果干预的难度。
Agent 面临特征选择性和激活强度之间的权衡:如果目标激活较弱,即使完美地将葡萄牙语与对照分离的特征也可能排名较低,而强激活则能获得最高的排名得分。反例对于拒绝子串检测器至关重要,例如,当一个关于“cat”的候选特征在“copycat”和“catalytic”上激活,而不是在猫科动物上激活时。房地产任务中的不同策略表明,优先考虑广泛覆盖而非纯度会提高目标相关性,但会降低生成质量。Kimi K3 的特征通过将强目标激活与干净的对照相结合,实现了完美的分离和最高的排名得分。Sol 的特征具有完美的选择性,但目标激活较弱,导致尽管调控和激活得分很高,但排名得分较低。Opus 5 拒绝了一个在“copycat killer”和“catalytic converter”上激活的候选特征,揭示了一个子串检测器,而不是动物概念。GLM-5.2 在临床症状任务上误解了证据,未能拒绝一个有缺陷的候选特征。在房地产任务中,Sol 和 Grok 4.6 选择了严格的选择性,而 Kimi K3 接受了一个泄漏较多的特征以获得更广泛的覆盖,导致生成退化率从 32.5% 上升到 52.5%。
在静态文本上实现强激活分离的特征中,只有少数能够成功地将生成调控为葡萄牙语。来自 Sol、Opus 4.8 和 Kimi K3 的特征在提示中表现出高目标相关性,而来自 Opus 5、Sonnet 5、Grok 4.6 和 Luna 的特征产生零目标相关性,证实了相关激活本身并不能保证因果影响。有效的调控还要求保持指令约束,Sol 在目标诱导和输出质量之间实现了最佳平衡。来自 Sol、Opus 4.8 和 Kimi K3 的特征在生成的输出中可靠地诱导出葡萄牙语,而来自 Opus 5、Sonnet 5、Grok 4.6 和 Luna 的特征尽管激活分离很强,却未能施加任何因果影响。在成功的干预中,Sol 实现了最高的调控得分(88.75)和指令保持度(3.525),而 Opus 4.8 由于重复和长度漂移,保持度较低(3.050)。
对于提示“用两句话介绍你自己”,使用来自 Sol、Opus 4.8 和 Kimi K3(专家)的特征进行调控,可靠地将模型输出翻转为流利的葡萄牙语,而 Luna 特征使回复保持为英语,与未调控的基线相同。这说明强激活分离并不能保证因果调控控制。Sol、Opus 4.8 和 Expert/Kimi K3 特征产生了如“Olá! Eu sou o Gemma...”的葡萄牙语开头,而 Luna 的输出仍然是“Hello! I am Gemma...”,与无调控的英语基线一致。该表格例证了一个更广泛的发现:只有一部分具有高表征相关性的特征成功施加了因果影响,而其他特征在所有评估提示中产生零目标相关性。
评估揭示了仅仅与概念相关的特征与对生成施加因果控制的特征之间的明显分界,只有像葡萄牙语专家 L9·41424 这样的一小部分特征能够可靠地调控输出。前沿 agent 在激活选择性上接近专家水平,但调控得分远低于专家基线,凸显了将相关性转化为可靠干预的难度。选择性与覆盖范围之间的权衡,以及使用反例拒绝子串检测器,突显了识别真正因果特征的微妙挑战。