机制可解释性与可解释性自动化
从 SAE、因果干预和计算电路到自动解释、研究 Agent 与激活语言化:46 项研究来源、评测证据与争议、视觉语音动作延伸,以及可执行的研究路线。
1. 核心判断与研究边界
机制可解释性(Mechanistic Interpretability,MI)的核心问题,是神经网络内部通过什么表征、信息传递路径和计算规则产生行为。可解释性自动化(Automated Interpretability)则试图让机器承担其中的观察、命名、定位、提出假设、设计实验、验证和总结。二者紧密相关,但自动生成一个合理的说明,不等于自动恢复了模型实际使用的机制。
截至 2026 年 9 月 12 日,较为稳健的判断是:特征描述和候选机制搜索已能大量自动执行;能够跨任务、跨分布、低成本地验证解释的系统仍不成熟。 研究前沿正从“发现一个可命名方向”转向“解释能否预测干预、是否优于行为基线、失败时能否自动修正”。SAEBench、MIB、AgenticInterpBench 和 CHIVE 分别提供了不同层面的检验,结果不支持用单一的自动解释分数代表整体进展。SAEBench、MIB、AgenticInterpBench、CHIVE
本报告以大语言模型为主,延伸到视觉语言、语音理解、语音生成与视觉语言动作模型。基础部分解释必要数学与实验逻辑;前沿部分区分正式论文、技术报告和近期预印本;实验路线与系统设计属于基于这些证据提出的研究建议,不代表已经完成的实验。
| 关键判断 | 证据支持到哪里 | 暂不能推出什么 |
|---|---|---|
| 稀疏表示能提供有用的研究坐标 | SAE 可提取便于描述和操纵的特征 | 存在唯一、完整的“概念词典” |
| 自动解释能减少人工浏览 | 解释可在留出数据上预测激活 | 特征在自然生成中承担所描述的计算 |
| 自动电路搜索能定位部分因果路径 | 在指定任务、模型与干预协议下恢复行为 | 找到了全模型的唯一算法 |
| Agent 能执行迭代研究 | 可生成对照、运行工具、修正候选假设 | 代码执行成功就代表实验设计有效 |
| 激活语言化有助于生成假设 | 能产生可读描述,在部分审计设置中有收益 | 描述就是内部思维的逐字转录 |
| 多模态解释已经有实证进展 | 可定位和干预部分视觉、声学、动作特征 | 已解释开放世界多模态推理全过程 |
表中的证据边界综合自 SAE 非规范性研究、特征自动解释、局部电路追踪和多模态干预工作;它是一套阅读框架,而非给方法排定绝对优劣。Leask 等、Paulo 等、Circuit Tracing、VLM SAE
2. 从解释行为到解释机制
2.1 四种容易混淆的解释
行为解释考察输入条件怎样改变输出。例如,改变问题的措辞后模型更容易出错。这是关于输入输出的经验关系,可以非常有价值,但没有直接定位内部实现。
表征解释考察内部状态包含什么信息。例如,一个线性探针能读出实体身份,一个 SAE 特征对某类语法结构激活。可读出性证明信息可被某个解码器利用;要判断原模型是否使用它,仍需额外实验。
机制解释进一步说明信息由谁读取、如何变换、经过什么路径影响输出。经典 Transformer 电路分析将注意力分成决定信息路由的 QK 部分和决定读写内容的 OV 部分,为此类问题提供了可操作的计算对象。A Mathematical Framework for Transformer Circuits
模型自述是模型生成的解释文本,可能帮助理解结果,也可能遗漏、重构或猜测原因。Activation Oracle 和 NLA 与普通自述的差别,在于它们实际接收内部激活,并通过训练学习解释它;但输入来自内部不意味着输出中的每句话都具有因果证据。Activation Oracles、NLA
2.2 “解释了多少”需要至少五个维度
本报告建议分别记录:可理解性、行为保真、干预预测、覆盖范围、解释复杂度。一个结论可能可读性强但覆盖窄,也可能能预测输出却依赖上千个难以命名的变量。不同研究优化的是不同维度,不能用漂亮图示抵消保真度不足,也不能因为局部结果不完整就否定其调试价值。
| 维度 | 可检验的问题 | 典型反例 |
|---|---|---|
| 可理解性 | 人能否依据说明预测激活或计算? | 标签很抽象,任何样本都说得通 |
| 行为保真 | 简化模型是否复现原模型的输出分布? | 正确率相同,但错误样本完全不同 |
| 干预预测 | 预先声明的干预效果是否实现? | 看到结果后才改写解释 |
| 覆盖范围 | 对多少样本、任务、模态、层有效? | 单一提示成立,改名后失效 |
| 复杂度 | 为了保真保留了多少变量与路径? | 几乎保留整网,却称为精简解释 |
机制可解释性还存在非唯一性问题。Méloux 等在布尔函数与小型 MLP 中枚举候选解释,发现多组电路、算法或对齐映射可同时满足所选标准。这并非证明真实模型无法理解,而是说明“符合实验”与“唯一真实机制”之间仍有距离。Everything, Everywhere, All at Once
3. 基础方法与实验逻辑
3.1 神经元、多义性与叠加
一个神经元可能同时参与多个互不相同的模式,这通常称为多义性(Polysemanticity)。叠加(Superposition)提供一种解释:模型借助稀疏激活,在有限维空间中表示多于维数的特征,并容忍它们之间的干扰。Toy Models of Superposition 在合成的小网络中展示了这一机制,不能直接把该玩具模型的全部假设视为所有语言模型的定理。Toy Models of Superposition
假设隐藏状态 \(h\in\mathbb R^d\) 可近似写为:
这里 \(d_i\) 是候选方向,\(z_i\) 是其系数,\(e\) 是未解释部分。若每个样本只有少量非零系数,就可能在过完备字典中恢复易于研究的结构。这个表示假设很有生产力,但方向是否稳定、是否可命名、是否承担因果功能,需要分开检验。
3.2 SAE 到底学到了什么
稀疏自编码器(Sparse Autoencoder,SAE)通常通过一个稀疏瓶颈重建隐藏状态:
经典目标可写为重建误差与稀疏惩罚之和。TopK 类方法则直接限制活跃维度,缓解稀疏度调节问题。Cunningham 等展示了语言模型激活上的可解释特征;Gao 等研究了规模、稀疏度和特征质量的关系,并将 SAE 扩展到千万级 latent。Sparse Autoencoders Find Highly Interpretable Features、Scaling and Evaluating Sparse Autoencoders
研究时应明确 SAE 的训练目标是近似某个隐藏状态分布。它并没有被直接要求发现真实概念,也没有被直接要求保持每项下游行为。因此,“重建很好”首先是表示压缩的证据;如果用它解释模型功能,还应检查替换激活后的模型损失、任务指标和具体干预效应。
| 方法家族 | 核心设计 | 适合观察的取舍 |
|---|---|---|
| ReLU + L1 SAE | 对 latent 幅度加惩罚 | 稀疏与重建的权衡、幅度收缩 |
| TopK SAE | 每个输入保留指定数量的活跃系数 | 控制稀疏度方便,但所有输入共享预算 |
| BatchTopK | 在批次层面分配激活预算 | 不同样本可使用不同数量的特征 |
| JumpReLU / 门控类 | 学习或分离激活门控 | 检测阈值与幅度估计如何相互影响 |
| Matryoshka 类 | 以嵌套字典组织不同尺度的表示 | 宽泛概念与细分概念的层次关系 |
这些架构应在相同 hook、语料、训练预算和实际 L0 范围内比较。SAEBench 的一个重要结果是:代理指标上的改进未必转化为实际任务收益,Matryoshka 类方法在特征解耦维度的表现也不能仅由重建分数推断。SAEBench
3.3 为什么激活修补是核心工具
激活修补(Activation Patching)在一次前向计算中,用另一输入产生的激活替换指定中间状态。设目标输入为 \(x\)、对照输入为 \(x'\),在位置 \(S\) 施加干预后,比较模型指标:
这里 \(m\) 可以是 logit difference、概率、损失或任务成功率。\(\Delta_S\) 的含义取决于输入对差异、位置选择、替换方式与指标。它不是脱离这些条件的“该模块重要性”。How to Use and Interpret Activation Patching
例如,要研究模型如何区分“把杯子交给小李”与“把杯子交给小王”,对照应尽量只改变接受者,而不是同时改变句式、长度与情境。这是本文用于说明实验设计的示例,并非文献报告的实验。如果干预整个 residual stream,可能一次替换了身份、语法和任务状态;更细的路径实验才有助于拆开这些作用。
| 实验 | 主要问题 | 解释时的限制 |
|---|---|---|
| 将正常激活放入受扰动运行 | 这些信息能否恢复目标行为? | 恢复截面不等于完整上游计算 |
| 将对照激活放入正常运行 | 该信息改变后行为是否被破坏? | 效果取决于对照;冗余路径可能补偿 |
| 屏蔽电路外组件 | 候选电路是否足够? | 必须写明屏蔽的替代值 |
| 屏蔽候选电路 | 它是否在当前分布承担重要作用? | 单个不必要不代表整体无作用 |
| 路径修补 | 影响是否经过指定中介? | 路径定义和冻结策略会影响结论 |
实践上应先粗粒度定位,再细粒度归因,最后验证组合干预。经典 IOI 工作展示了从行为任务出发研究注意力头之间功能分工的路线,但 IOI 是受控现象,不能代表整个自然语言理解。IOI Circuit
3.4 相关、可控、自然机制三个层次
“存在一个方向,沿它移动会改变输出”说明可控性;“原模型在自然样本中经常沿该方向变化”说明分布内相关;“上游读取某变量并通过此方向影响下游”才更接近机制链。强烈增加一个 latent 可能制造原本很少出现的状态,所以 steering 与自然机制验证应并列开展。
对子空间修补的批评指出,某些设置可能通过非预期通路产生预期效果;回应论文则认为,部分“解释幻觉”判据过强,且训练与评估协议会改变判断。这一争论支持更清晰地说明干预语义和泛化检验,而不是简单接受“修补成功即证明”或“所有修补都无效”。Makelov 等、Wu 等的回应
4. 从特征词典到计算电路
4.1 SAE、Transcoder 与 Crosscoder
SAE 重建某个位置的状态,transcoder 近似一个模块的输入到输出映射。对 MLP 而言,可以把密集的非线性计算近似为更宽但稀疏激活的网络,从而分析特征之间的读写关系。Dunefsky 等在不同规模语言模型上展示了这一方法及其电路分析用途。Transcoders Find Interpretable LLM Feature Circuits
Crosscoder 则联合处理多个层或多个模型的激活,以共享 latent 研究表征对应与差异。它适合研究微调前后、训练阶段之间的表示变化;不过联合重建的关联结构未必等同于模型真实因果顺序,尤其不能把跨模型特征的高相似度直接当作机制相同。Sparse Crosscoders
| 对象 | 近似关系 | 首要用途 | 必要补充 |
|---|---|---|---|
| SAE | 一个状态到自身 | 分解与浏览表示 | 功能验证、误差分析 |
| Transcoder | 模块输入到模块输出 | 分析特征间计算 | 替代模型保真检验 |
| Cross-layer transcoder | 跨层读取与写出 | 简化跨层计算路径 | 跳层近似与误差贡献 |
| Crosscoder | 多处状态的联合表示 | 模型差分、跨层对应 | 对齐稳定性与干预验证 |
4.2 稀疏特征电路
Sparse Feature Circuits 将 SAE 特征作为计算图节点,并将未被字典解释的残差纳入分析。Marks 等展示了利用特征电路研究与编辑模型行为的可能性,包括通过移除被判断为任务无关的特征改善分类器泛化,以及自动发现大量局部行为电路。Sparse Feature Circuits
这条路线的重要性在于把“哪些特征存在”与“它们怎样影响输出”连接起来。面向 in-context learning 的后续工作还研究了任务识别与任务执行特征之间的因果联系,说明特征电路可以用于回答具体算法问题,而不只是生成一份词典。Scaling Sparse Feature Circuit Finding for In-context Learning
4.3 Circuit Tracing 的贡献与局限
2025 年的 Circuit Tracing 使用更可解释的替代组件构建单个提示上的归因图,并配合可视化与干预检验。其核心价值是把跨层特征交互变成可逐步追踪的对象。需要注意,图来自特定输入下的替代模型,依赖近似、冻结部分量及误差补偿,不能直接视为全局源代码。Circuit Tracing
一个节点标签是“城市”,连向一个标签为“国家”的节点,并不足以证明图中存在可靠的地理查询算法。需要进一步验证:改动城市信息是否按预测改变国家输出;保留这条路径是否足够;在多个城市、语言、问法中是否成立;是否存在未解释误差节点承担关键作用。
4.4 注意力为什么仍是难点
仅对 MLP 做稀疏替代,并没有解释注意力路由本身如何形成。OpenMOSS 的 Complete Replacement Model(CRM)把 MLP transcoders 与 Low-Rank Sparse Attention(Lorsa)结合,覆盖两类计算块,并探索 QK 追踪与全局权重分析。这里的“Complete”是架构覆盖意义,原文仍明确指出局部冻结量和误差项的限制。Bridging the Attention Gap
还有一个更深的问题:即使节点都能命名,大的特征间权重也可能代表干扰而不是有效功能。2026 年一项小型 Transformer 研究通过输出与损失变化识别干扰权重,提醒研究者区分权重幅度、实际生效程度与对任务的帮助。Characterizing Interference Weights
因此,本文建议电路浏览器同时展示“连接强度、数据上的共同激活、实测干预效果、未解释误差”,不要只按最大的几条边自动生成机制叙述。
5. 自动化方法的五条主线
以下分类按自动化承担的研究工作划分,各类可以组合,不是线性替代关系。
flowchart TD
A[目标模型与行为问题] --> B[表征采样与候选发现]
B --> C[特征自动解释]
B --> D[自动电路搜索]
A --> E[激活语言化]
C --> F[竞争假设与实验设计]
D --> F
E --> F
F --> G[执行干预与对照]
G --> H[留出评估与反例]
H -->|修正| F
H --> I[限定范围的机制报告]
图 1:本文提出的综合工作流。特征名称、电路和语言化读数都先进入假设层,实验结果才决定哪些主张可以进入报告。
5.1 主线一:自动解释特征
Bills 等在 2023 年提出用语言模型生成神经元描述,再根据描述模拟其在未见文本上的激活。这个设计把“解释好不好”部分转化为可测的预测任务,是后续 auto-interp 的重要起点。它的评估对象是激活模式,不是整个模型的因果算法。Language Models Can Explain Neurons
Paulo 等把这一思路扩展到大量 SAE latent,提出生成与评估自然语言解释的开放流水线,并包含干预效果评分。其配套 Delphi 支持 SAE 和 transcoder 特征的解释与评分。应区分检测式评分与干预式评分,不能仅因为使用了同一个框架就认为每个解释都经过因果验证。Automatically Interpreting Millions of Features、Delphi
本文建议保存的最小解释单元,不只是一个标签,而是一个带边界的假设:它在哪些位置激活、对哪些反例不应激活、是否依赖语言或格式、哪些测试已经失败,以及解释是否包含多个并列含义。这能防止自动标签在后续研究中逐渐被误当作真实概念定义。
5.2 主线二:自动搜索电路
ACDC 自动化的是在给定行为数据与指标后寻找连接。EAP 用梯度近似降低逐条干预成本;EAP-IG 通过沿插值路径积累梯度改善近似。Edge Pruning 则把边的选择转为可优化的掩码问题。ACDC、EAP-IG、Edge Pruning
| 路线 | 如何获得候选电路 | 主要优势 | 主要风险 |
|---|---|---|---|
| ACDC | 迭代删边并观察性能 | 接近显式干预搜索 | 成本高,依赖遍历与阈值 |
| EAP / EAP-IG | 估计每条边的贡献,再选择 | 高效筛查大量路径 | 非线性、边交互与基线选择 |
| Edge Pruning | 优化稀疏边掩码 | 联合考虑边集合 | 优化目标与解释目标可能不一致 |
| 特征归因图 | 在稀疏替代表示上构图 | 节点较容易解释 | 替代误差与局部近似 |
| 形式化发现 | 使用验证器证明规定属性 | 有明确的保证范围 | 计算成本与模型适用范围 |
EAP-IG 的重要方法论提醒是:与人工电路重叠很多,不代表电路保真。Edge Pruning 的稀疏结果也只说明在其任务、数据和替代协议下保留了行为,不能把删边比例解释为“模型其余参数无用”。EAP-IG、Edge Pruning
2026 年的 Formal Mechanistic Interpretability 研究输入区域鲁棒性、鲁棒修补与不同最小性定义的保证,实验针对视觉模型。这提供了更严格的方向,但不是已经能证明任意大语言模型全局机制正确。Formal Mechanistic Interpretability
5.3 主线三:Agent 执行解释性实验
MAIA 将视觉语言模型与生成、编辑输入、寻找高激活样本等工具结合,让系统迭代测试视觉模型组件。它区别于一次性命名的关键是主动实验。其主要证据来自视觉特征与模型失败案例,不宜直接外推为大语言模型全流程研究能力。MAIA
2026 年的 InterpAgent 进一步将特征寻找与解释修正连接。FeatureExplainer 维护竞争假设并生成匹配对照;FeatureFinder 从激活结构中检索候选。值得注意的是,其主排序采用多指标评价,steering 测试可用但默认不参与排名。因此“修正后的解释胜出”主要是对应评价体系下的结果。Automated Interpretability and Feature Discovery with Agents
HyVE 聚焦已经定位的电路,循环执行观察、假设与验证。AgenticInterpBench 包含 84 个半合成电路与 163 项组件级标注;论文发现不同模型在标签、说明、任务推断和代码执行上的优势并不相同。这是“会解释已知电路”的测试,仍不是从任意真实模型自主发现完整算法。HyVE / AgenticInterpBench
5.4 主线四:把内部激活翻译成自然语言
Activation Oracles 接收模型激活和问题,通过监督训练学习回答内部状态相关问题;NLA 则通过“激活→文本→重建激活”的瓶颈联合训练语言化与重建模块。前者适于定向询问,后者可生成开放式描述。二者都提供比固定特征标签更灵活的接口,但语言化结果仍需要独立验证。Activation Oracles、NLA
这里的研究取舍可以写为:更丰富的表达能力,使假设更容易提出,也扩大了错误叙述的空间。本文建议把读数拆成原子主张,再逐条验证,而不是给一段流畅文字整体打“可信”标签。对于时间性主张,还要区分模型在行动前的状态与行动后的回顾表示。
5.5 主线五:训练时让模型更容易解释
另一条路线直接约束模型权重结构。Weight-sparse Transformers 通过大量零权重降低连接复杂度,使部分小任务电路更容易逐层理解,同时观察到能力与解释性的取舍及扩展困难。这与给密集模型训练一个 SAE 是不同问题:它改变了被研究模型本身。Weight-sparse Transformers Have Interpretable Circuits
本文的判断是,短期内“解释现有模型”与“训练可解释模型”应并行。前者更容易服务实际调试,后者可能提供机制验证所需的更清晰实验对象。比较两者时要同时报告能力、训练成本、可解释范围和迁移到真实密集模型后的保真程度。
6. 自动化前沿的实证比较
6.1 不同系统究竟自动化了哪一段
| 系统或研究 | 输入条件 | 自动完成的工作 | 主要输出 | 证据边界 |
|---|---|---|---|---|
| Neuron Explainer(2023) | 神经元及其激活样本 | 生成解释、模拟激活 | 描述与预测分数 | 单元描述,不等于因果链 |
| Delphi / Millions of Features(2025 正式发表) | SAE / transcoder 字典与激活 | 大批量生成、评分 | 特征解释库 | 取决于实际启用的评分器 |
| MAIA(2024) | 视觉模型组件与工具 | 主动生成、编辑、测试输入 | 实验驱动描述 | 主要是视觉模型场景 |
| InterpAgent(2026 预印本) | 字典或神经元与研究方向 | 候选寻找、竞争假设修正 | 假设与审计轨迹 | 主排序不默认依靠 steering |
| HyVE(2026 预印本) | 已定位电路 | 组件实验与角色归纳 | 组件与任务解释 | 半合成电路为主要基准 |
| SAEScientist-Bench(2026-09 预印本) | 给定目标概念、可查询 SAE | 自主寻找并提交特征 | 特征 ID 与研究过程 | 20 项单特征任务,专家参考有限 |
| Activation Oracles(2025 技术报告) | 内部激活与问题 | 回答激活相关问题 | 自然语言答案 | 读出内容不自动证明因果 |
| NLA(2026 技术报告) | 内部激活 | 生成自然语言瓶颈表示 | 文本说明 | 重建目标与机制目标有差距 |
| CHIVE(2026 技术报告) | 模型交互记录 | 发现异常、测试提示编辑 | 可验证反事实数据 | 属于行为因果调查,不直接定位内部路径 |
表中各系统的输入与边界依据其原始论文和官方项目说明;“自动化程度”没有单一标尺。例如,给定电路后解释它,与从行为现象出发定位电路,不能按输出长度直接比较。Neuron Explainer、Delphi 论文、MAIA、InterpAgent、HyVE、SAEScientist-Bench、AO、NLA、CHIVE
6.2 HyVE:实验执行能力与解释能力并不等价
下表保留 HyVE 原论文表 2 的四个维度,范围均为 0–1,越高越好。标签准确率、说明质量、任务推断准确率与代码执行成功率测量不同对象,不能求平均后宣称某模型整体更懂机制。
| HyVE backbone | 组件标签准确率 | 角色说明质量 | 任务推断准确率 | 代码执行成功率 |
|---|---|---|---|---|
| GPT-5.4 | 0.74 | 0.46 | 0.63 | 0.52 |
| Claude Sonnet 4.6 | 0.79 | 0.58 | 0.75 | 0.93 |
| Gemini 3.1 Pro | 0.76 | 0.59 | 0.83 | 0.80 |
| Qwen-3-Coder-30B-A3B | 0.67 | 0.25 | 0.25 | 0.62 |
图 2:根据 HyVE 原论文表 2 重绘。原表未给出这些汇总值的置信区间,因此图中不添加推测的误差棒。模型名称是该论文的实验配置标识,不代表当前模型市场排名。下载数据 CSV
角色说明与任务判断使用 LLM 评审,并以双评审较低分聚合;作者还对部分任务做了人工一致性检查。即使如此,说明质量仍包含评审依赖,代码成功率也仅代表调用未报错。本文的分析是,应将“实验是否真的测试了主张”单列成流程指标,否则运行能力的提升容易被误记为科学推断能力的提升。评测协议
6.3 SAEScientist-Bench:选择性高不等于干预效果强
2026 年 9 月 8 日发布的 SAEScientist-Bench 在 Gemma-2-9B-IT 的 131K+ 字典中设置 20 个目标概念任务,评测 10 种 Agent 配置。其主表中,最好的 Agent 选择性分数为 92.91,专家参考为 98.92;最好的 Agent steering 分数为 31.47,专家为 57.75。两个 Agent 最优值来自不同配置,不应拼成一个虚构系统。SAEScientist-Bench 表 1
该基准的 Rank、Activation、Steering 不是同一种量:Rank 相对专家归一化、可超过 100;Activation 是 AUROC 的变换;Steering 是扣除基线与随机方向控制后的生成评分增益。其专家特征、干预幅度校准和 Agent harness 也存在协议差异。近期预印本提供的是研究线索,不能直接解释为通用科研能力的百分比。指标与实验协议
6.4 CHIVE:为何需要没有内部工具的强基线
CHIVE 自动提出并执行提示编辑,以实测结果评估行为解释。在其评测中,配有 SAE、NLA 或 Activation Oracle 的预测 Agent 未超过只看交互记录的基线;作者在多个目标与预测模型设置中检验了这一结果。其结论针对所测的反事实预测任务,不是对所有内部工具的普遍否定。CHIVE
这一结果与部分审计任务中激活语言化有收益并不矛盾。审计可能需要发现被隐藏的信息;反事实预测要求识别导致行为变化的条件。读出一个概念与预测它的因果影响是不同任务。本文建议所有自动化研究都保留行为基线,并按发现异常、定位变量、预测干预、修复行为分别统计工具增益。
7. 如何评测可解释性自动化
7.1 基准的不同层级
| 基准 | 主要评测对象 | 适合回答的问题 | 不适合单独回答的问题 |
|---|---|---|---|
| InterpBench | 已知电路的半合成 Transformer | 方法能否恢复已知结构? | 对真实模型开放任务是否同样有效? |
| SAEBench | SAE 的多维质量 | 字典改进是否有实用收益? | 自动研究 Agent 是否会设计实验? |
| MIB | 电路与因果变量定位 | 定位方法在统一协议下如何表现? | 所有模型、任务的普适排名是什么? |
| AgenticInterpBench | 已定位组件的解释 | Agent 能否归纳和验证组件作用? | 能否自己选择问题并完成全链路研究? |
| SAEScientist-Bench | 目标概念的特征发现与 steering | 找到的特征是否选择性强且可控? | 能否发现长链算法或完整机制? |
| CHIVE | 自然行为的反事实预测 | 内部读数能否提供额外预测价值? | 能否直接恢复内部电路? |
InterpBench 利用 SIIT 训练保留指定电路的半合成模型,提供稀缺的结构参照。MIB 则包含电路定位与因果变量定位两个赛道;其论文中监督式 DAS 在后一赛道表现较强,SAE 未优于神经元基线,说明方法选择取决于是否有目标变量监督与具体任务。InterpBench、MIB
7.2 分开测量预测与干预
建议对一个候选解释保留四套独立输出:激活预测、行为预测、干预方向预测、干预幅度预测。二分类“激活或不激活”可能掩盖强度与位置错误;只测输出是否变了,则可能奖励破坏模型的操作。更理想的评价是提前写明哪个变量会改变、改变方向、在哪些样本不该改变,以及允许的非目标损失。
以下是本文提出的一组记录指标,属于实验协议建议:
| 指标组 | 建议记录 | 实际意义 |
|---|---|---|
| 表示质量 | L0、重建误差、替换后损失 | 坐标是否过粗或严重失真 |
| 说明质量 | 留出检测、难负例、位置预测 | 文字是否压缩了真实激活规律 |
| 干预效果 | 目标效果、随机方向、反向与零操作 | 是否超出任意扰动带来的变化 |
| 电路质量 | 保真—大小曲线、删除与保留实验 | 是否以较少结构复现原模型 |
| 稳定性 | seed、样本 bootstrap、提示改写 | 结论是否由偶然选择驱动 |
| 研究过程 | 无效实验、代码错误、错误结论率 | 自动化的失败发生在哪一步 |
| 实际效用 | 调试时间、修复收益、非目标退化 | 内部工具是否改善最终工作 |
| 成本 | 调用次数、tokens、运行时间、人工审核 | 效果是否值得投入 |
7.3 不要只报告一个保真率
作为实验设计示例,可以将某一任务指标的恢复比例写成:
其中 \(F_C\) 是保留候选电路的运行,\(F_{base}\) 是协议规定的替代基线。这不是跨论文通用标准;必须明确 \(m\) 的方向与基线。当分母很小,比例不稳定;当它超过 1,也不能自动理解为“解释超过 100%”,而应检查非线性、抑制路径与替代效应。
除了这个比例,应该报告原始指标、输出分布差异、不同电路大小上的曲线,以及任务外控制。对于备份或并行路径,单个组件删除无效果并不排除其参与计算;组合删除的结论也不能无条件分摊给每个成员。Patching 方法讨论
7.4 探索集与确认集必须隔离
Agent 会根据反馈反复修改假设,因此它见过的测试集很快变成训练信号。本文建议三段数据隔离:发现集用于生成候选;验证集用于调参和选择;冻结测试集只在最终提交后评估。不同层、字典、阈值、干预幅度的选择也属于搜索,不能只把文字提示视为调参。
对成千上万特征同时检验时,还要处理多重比较。可以在发现阶段使用 FDR 控制筛查候选,但最终因果主张仍应由独立数据与效应量支持。统计显著性不能替代机制说明:一个几乎没有实用影响的小差异,在足够大样本下也可能很显著。
8. 主要争议与失败模式
8.1 字典不是自然界的元素周期表
Leask 等利用 SAE stitching 和 meta-SAE 说明,不同大小字典中的特征可能新增、替换或分解,难以视为唯一完备的原子概念。实践中的后果是,特征 ID 必须绑定模型、层、字典版本和训练条件;不能把两个 SAE 中名字相同的 latent 当成同一对象。SAE 非规范性
本文建议区分三种稳定性:方向相近、激活样本相近、干预结果相近。三者可以不一致。研究模型升级时,优先寻找“功能匹配的一组特征”,而不是要求一个旧 ID 找到唯一新 ID。
8.2 解释可以比行为更脆弱
Li 等发现,在其评测设置中,小输入扰动能够显著改变 SAE 概念解释,同时基础模型输出变化不大。这对把单个概念读数直接用作监控告警提出挑战。该结果说明需要测试解释稳定性,不意味着所有 SAE 表征在所有输入下都失效。Interpretability Illusions with SAEs
同时,简化模型在分布内近似很好,也可能在系统泛化测试中与原模型分离。Friedman 等在受控任务中展示了这一问题。一个解释在已观察数据上更简洁、更合逻辑,并不能保证它准确描述真实模型的边界行为。Interpretability Illusions in Simplified Models
8.3 可控方向不一定是唯一语义开关
一个方向可能同时影响主题、风格、拒答倾向或生成熵。把输出变化概括成“打开了某概念”,容易掩盖副作用。本文建议干预报告包括强度扫描、负向干预、范数匹配随机方向、语义相近方向,以及不涉及目标概念的任务保持情况。
理想的成功结果是:低幅度干预产生可预测、局部、可逆的目标变化,而且影响随上下文满足预期条件。若只有极强扰动才能见效,并伴随重复或任务失败,更合理的描述是“找到了可诱发该输出的方向”,而不是“定位了正常生成时的控制模块”。
8.4 语言化模型带来了第二层解释问题
将激活翻译为自然语言,意味着目标模型之外又引入一个解释模型。研究者还需要知道解释模型何时依靠激活,何时依靠提示语义猜测。可以比较真实激活、打乱激活、零激活与只给文本的条件,并检验读数对输入交换是否敏感。
NLA 原始研究讨论了虚构细节、语言瓶颈退化和成本;因此将其读数作为候选线索比较合适。本文的建议是,审计界面应保留激活的来源位置、生成时刻、读数版本以及验证状态,避免把未经验证的自述传播成事实。NLA 局限
8.5 自动化可能扩大确认偏误
人类可能挑选令人信服的例子;Agent 则可能快速生成大量支持自己假设的例子。若生成对照、选择结果、写解释和评分都使用同一套偏好,流水线会显得一致,却未必接近真实机制。本文建议将实验执行和评分约束为独立协议,保留被否定的假设,并要求解释承担对未见实验的预测责任。
9. 从语言模型延伸到多模态
9.1 多模态解释的研究对象
“多模态可解释性”至少有四个层面:感知编码器学到了什么;模态接口保留或丢失什么;语言主干如何使用模态证据;生成或动作模块如何实现输出。只解释一个视觉 encoder 的特征,不能覆盖视觉问答全过程;只解释一个声学 latent,也不能证明它参与了语言规划。
flowchart LR
A[图像或音频] --> B[感知编码器]
B --> C[Projector 或模态接口]
C --> D[语言主干]
T[文本指令] --> D
D --> E[回答或工具决策]
D --> F[语音或动作生成]
B -.观察.-> B1[视觉区域与声学事件]
C -.观察.-> C1[跨模态对应与信息损失]
D -.观察.-> D1[证据融合与推理路径]
F -.观察.-> F1[时序结构与控制变量]
图 3:多模态解释的研究切片,由本文归纳。实际模型可能省略或合并部分模块;应以其真实计算图确定采样点。
9.2 视觉语言模型
Pach 等将 SAE 应用于 CLIP 等视觉语言表示,结合人类感知评价研究单义性,并展示对视觉编码器施加 SAE 干预可影响 LLaVA 输出。它表明视觉表示中的方向可以具有下游作用,但未自动恢复完整跨模态推理链。Sparse Autoencoders Learn Monosemantic Features in VLMs
2026 年 7 月的结构化 SAE 工作对 Qwen2.5-VL 引入图像 patch 的语义与空间先验,以改善跨模态概念一致性。这里应区分“表示更符合预先设定的结构”与“发现模型原本唯一的结构”;后者仍需独立因果证据。Structured SAEs Across Modalities
本文建议 VLM 实验至少分开四类变量:真实视觉属性、图中文字、问题措辞、常识先验。一个所谓“红色”特征可能响应图像颜色,也可能只响应问题中的“红色”一词。通过保持问题不变而替换图像、保持图像不变而改问题、加入图文冲突,可以识别这些不同解释。
9.3 语音理解与 ASR
AudioSAE 在 Whisper 与 HuBERT 编码器各层训练 SAE,评估稳定性与实际应用;论文报告在其设置中通过特征 steering 降低 Whisper 的错误语音检测,且 WER 增幅很小。其跨 seed 一致性结果也是协议内的经验测量,不意味着全部音频概念都稳定可恢复。AudioSAE,EACL 2026
2026 年 5 月的另一项 Whisper SAE 工作展示了语言与非语言特征、跨语言 steering;神经音频 codec 研究则比较了口音信息如何出现在不同表示中。它们的模型与任务不同,应避免把所有音频 SAE 结果合并成一个成熟度数字。Whisper SAE、Neural Audio Codecs 与口音
语音自动解释需要保留时间结构。只提供转写文本会丢掉语速、重音、笑声与说话人线索;只给最高激活音频片段,又可能忽略上下文。建议同时存储音频时间窗、转写对齐、层位置、说话人和录音条件,并在相同文本、不同声学条件以及相同声学条件、不同文本之间构造对照。
9.4 语音生成与 TTS
2026 年 6 月针对 CosyVoice3 的研究,根据激活发生在文本前缀、语音位置或两者,选择文本窗口、短音频片段或混合证据进行自动解释。作者还展示了笑声、语速等方向的控制;这些是特定模型和干预条件下的实证,不应推断为任意 TTS 模型的通用旋钮。Interpreting and Steering a TTS Language Model
这一设计对自动化的启示是:解释器应按证据模态路由,而不是先把所有证据变成文本。本文建议在评价生成控制时同时测内容保持、声学属性变化、音质、说话人相似度与自然度,避免把“笑声变多”而“词语说错”计为完整成功。
9.5 视觉语言动作模型
Swann 等在 VLA 隐状态上训练 SAE,研究跨任务语义与运动特征,并在 LIBERO 和真实 DROID 硬件上验证部分干预。动作场景的关键区别是闭环:改变一次动作会改变下一时刻观测,继而改变整条轨迹。SAEs in VLA Models
因此本文建议分开短时动作效应与长时任务效应。一个方向让机械臂转向某物体,可能来自视觉注意、目标选择、坐标表示或控制输出层;需要跨层中介与轨迹对照才能区分。成功率提高是实用结果,但机制解释还应说明在什么状态下、通过哪一中间变量产生改善。
9.6 语音 Agent 的优先研究问题
对于语音输入、语言推理、工具调用、语音回复连接的系统,本文建议优先研究“证据在哪里改变了决策”:听到否定词是否改变工具参数;同一句话的疑问语气是否改变行动策略;文本和声音冲突时模型依据谁。它们都能构造明确对照,比“寻找规划概念”更容易获得可证伪的结果。
| 问题 | 关键对照 | 内部观察 | 外部判据 |
|---|---|---|---|
| 语音内容是否正确进入主干? | 同内容音频与转写 | 接口前后表示 | 内容理解与参数正确性 |
| 模型是否依赖说话方式? | 同文本不同韵律 | 声学与主干特征 | 澄清、确认或直接执行 |
| 图文或音文冲突如何解决? | 单模态与冲突双模态 | 融合路径 | 对正确证据的依赖 |
| 工具错误如何被识别? | 相同请求,不同工具返回 | 决策前后状态 | 重试、修正或错误传播 |
| 输出语音是否改变语义? | 相同主干计划、不同生成条件 | 生成模块特征 | 转写一致与语用变化 |
这是一份待执行的实验矩阵,不是既有模型已经具备这些机制的声明。
10. 自动化研究系统的设计
本节提出一个面向复现与可靠验证的系统方案。它综合上述方法,但并非声称已有单个开源工具实现全部能力。
10.1 先标准化实验对象
每个研究对象应绑定五项身份:模型权重版本、tokenizer 或模态前处理版本、hook 位置、字典或替代模型版本、数据版本。对于自回归生成,还应记录是否使用缓存、干预发生在 prefill 还是 decode、影响哪些 token。否则同一个“第 12 层”在不同适配器里可能并非同一张量。
实验接口应返回结构化测量值,而不是仅返回自然语言总结。一个候选特征至少包含 top samples、随机激活样本、难负例、实际 L0、激活分布、解释版本和已执行测试。异常、超时、模型执行失败应作为独立状态,不能自动映射为“假设不成立”。
10.2 将提出假设、执行实验与判定分开
flowchart TD
A[问题与预算] --> B[候选检索]
B --> C[提出多个可区分假设]
C --> D[提交实验计划与预期结果]
D --> E[确定性执行器]
E --> F[原始数值与运行状态]
F --> G[独立评估协议]
G --> H{证据是否充分}
H -->|否| C
H -->|是| I[冻结测试集]
I --> J[主张与证据对应报告]
图 4:建议的自动化研究架构。图中的“独立”主要指职责与信息边界,既可以由一个 Agent 分阶段执行,也可以由多个角色实现;不以角色数量作为质量保证。
确定性执行器负责张量替换、范数控制、种子、对齐和数值计算;Agent 负责选取问题与解释结果。这样可以把“工具实现有误”与“科学假设不对”区分开。为了测试 Agent 的实质贡献,应比较固定实验菜单、规则搜索、一次性解释和主动迭代,并控制总预算。
10.3 主张必须连接到证据
建议每条结论使用下面的简化结构。这是报告数据格式示例,不依赖特定软件库:
{
"claim": "候选特征响应目标语义,而非固定字面片段",
"scope": "指定模型、字典、层、语言与任务分布",
"alternatives": ["字面片段检测", "文档格式检测"],
"predictions": ["同义改写保持激活", "字面相同但语义无关时不激活"],
"evidence_ids": ["heldout-contrast-01", "paraphrase-02"],
"intervention_status": "尚未检验",
"conclusion_status": "表征假设得到支持,因果功能未定"
}
报告系统不能因为表征测试通过,就自动把 intervention_status 升级。若测试结果相互冲突,应保留竞争解释或收窄范围。对需要人工介入的条目,优先交付具体矛盾与原始证据,而不是要求人重新阅读整条聊天轨迹。
10.4 成本应按有效结论计算
一个更有意义的研究成本指标是:
这是本文建议的核算方式,不是已建立的领域标准。分母应限于通过预设门槛且有适用范围的结论,不能把生成的标签数计入。还应另报失败率与待定率,以防系统通过只研究极简单问题来降低平均成本。
在实际流程中,可以先用低成本统计筛查或一次性解释完成初步分类,将预算投向高价值、分歧大或与故障相关的候选。若主动迭代没有提高冻结测试上的表现,则不应仅因轨迹更长而认为研究更深入。
11. 工具生态与选型
以下入口按 2026 年 9 月检索结果列出。它们承担不同工作,不应假设任意模型、任意 SAE 与任意电路工具可无缝互换。复现论文时优先固定论文对应版本,再决定是否迁移到当前主分支。
| 工具或资源 | 主要用途 | 适合的起点 | 使用时重点核验 |
|---|---|---|---|
| TransformerLens | 语言模型内部读取与干预 | 受控文本任务、注意力电路 | 模型支持、hook 语义、权重转换 |
| SAELens | SAE 训练、加载和分析 | 文本 SAE 实验 | 字典与模型层的严格匹配 |
| OpenMOSS Llamascopium | SAE 与相关解释方法 | 稀疏表示及替代模型研究 | 原 Language-Model-SAEs 已重定向至此 |
| Delphi | 解释生成与评分 | 批量特征自动解释 | 当前分支与论文复现分支差异 |
| Gemma Scope / Scope 2 | 已训练字典和 transcoders | 减少从零训练成本 | Gemma 2 与 Gemma 3 资源不可混用 |
| MIB | 统一机制定位评测 | 比较定位方法 | 模型—任务对与赛道设置 |
| EAP-IG 复现代码 | 梯度近似电路搜索 | 已定义的文本行为 | 子模块版本与归因指标 |
| Edge Pruning | 边掩码优化 | 比较稀疏保真曲线 | transformers 版本适配提示 |
| NLA 官方配套代码 | 激活语言化研究 | 复现语言瓶颈读出 | 检查训练目标、模型权重与成本 |
| AudioSAE | 音频 SAE 展示与权重 | Whisper / HuBERT 分析 | 帧与时间窗对齐、音频前处理 |
| CircuitKIT | 发现、评估与干预接口整合 | 关注工作流复用 | 新近工具;论文称 source-available,应核验许可 |
Gemma Scope 2 的官方说明覆盖 Gemma 3 各层的 SAE 和 transcoders,并包含 Matryoshka、skip-transcoder 和 cross-layer 相关资源。它降低了进入门槛,但字典现成并不意味着任务评测也现成。Gemma Scope 官方说明
本文建议按问题选栈:已知行为定位优先干预与电路工具;大量候选浏览优先现成 SAE 和自动解释;多模态问题先保证时间、空间、token 对齐,再选择字典;开放式内部读出可试 AO/NLA,但必须保留只看输入输出的基线。
12. 研究机会与优先级
本节为研究判断,不是对论文接受概率或实验成功率的预测。优先级主要依据问题能否明确定义、是否能取得可信负结果,以及能否沿用现成模型资源。
12.1 优先方向一:解释能否预测干预
问题。 一个高 auto-interp 分数的特征解释,是否更能预测该特征被抑制、增强或替换后的行为?
实验。 选择若干任务、层和字典,为特征生成文本描述;在不展示实测干预结果的情况下,要求解释模型预测目标变化及副作用。对照包括无解释、随机解释、只给高激活样本、只看模型输入输出,以及人为精选说明。
贡献判据。 重点报告分数与干预预测之间的条件关系,而非寻找一个漂亮相关系数。如果描述只对激活有效,应该明确解释与控制之间的缺口。若某种加入下游信息的方法能改善预测,应再检查其是否只是泄漏了输出答案。
12.2 优先方向二:主动实验是否值得其成本
问题。 多轮 Agent 能否用同样预算,比一次性解释加固定对照更快排除错误机制?
实验。 固定目标模型、数据和预算,比较随机探测、固定菜单、启发式选题、主动竞争假设。测量每轮排除的错误假设、最终错误主张率与运行成本,并加入“允许返回不确定”的设置。
贡献判据。 结果应按难度分层。如果多轮只对多义特征或难负例有收益,可设计选择性升级策略。若没有收益,也可以通过错误分类说明瓶颈是实验计划、执行接口、读数理解还是停止决策。
12.3 优先方向三:多模态语义与表面线索解耦
问题。 自动解释器是否将转写词汇、图中文字或声学伪相关误认作跨模态概念?
实验。 建立图像—文本或音频—文本的控制矩阵,系统改变目标语义与干扰变量。对候选 latent 同时测跨模态检测与局部干预,在未见说话人、未见场景和冲突输入上评价。
贡献判据。 高质量结果应显示哪些解释可跨模态迁移、哪些只在单一证据通道成立。比起简单报告“存在共享特征”,更有价值的是验证共享特征是否承担模型决策中的证据传递。
12.4 优先方向四:训练过程与机制来源
问题。 某种训练数据改变后,是已有机制变强、新机制形成,还是模型改用另一条路径?
MDA 使用 influence functions 将可解释单元追溯到训练样本,并通过数据移除或增加检验机制形成变化。这是从静态结构走向训练因果来源的重要路线,但不能将其在 Pythia 与特定头上的结果无条件推广到全部能力。Mechanistic Data Attribution
建议实验。 对训练阶段或微调前后做功能对齐;先确认行为变化,再观察特征与电路,最后干预训练数据或模型内部验证中介。需要区分 SAE 重新训练造成的字典漂移与模型自身变化。仅凭独立字典里某个标签首次出现,不能宣称概念在该时刻诞生。
12.5 研究选择矩阵
| 方向 | 主要成本 | 关键依赖 | 可交付的最小结果 | 优先级判断 |
|---|---|---|---|---|
| 自动解释与干预预测 | 多次前向与解释调用 | 现成模型与 SAE | 一套受控评测和失败类型 | 高 |
| 主动实验成本收益 | Agent 重复运行 | 稳定执行器与冻结测试 | 预算—有效结论曲线 | 高 |
| 语音或视觉混淆控制 | 数据配对与模态处理 | 可访问的编码器/主干 | 明确的一条跨模态因果链 | 高,适合领域团队 |
| checkpoint 机制演化 | 激活与版本存储 | 多阶段权重 | 功能匹配与变化验证 | 中高 |
| 通用全模型电路恢复 | 大规模替代训练与图搜索 | 算力、验证体系 | 先限定一个行为分布 | 长期 |
| 任意自然语言机制证明 | 理论与形式化求解 | 明确语义及可扩展验证器 | 受限模型上的保证 | 长期 |
优先级不是领域重要性排名。长期方向很重要,但如果缺少可验证中间目标,自动化容易退化成生产不可检验的叙述。
13. 十二周实验路线
这份路线面向已有模型推理与基础 Python 能力的研究团队。它是一份建议计划,未预设具体设备预算,也不承诺在十二周内获得论文级结论。
| 阶段 | 核心工作 | 必须提交的证据 | 继续推进条件 |
|---|---|---|---|
| 第 1–2 周 | 一个小文本模型、一个明确行为、修补复现 | 正常/对照/零操作与双向修补 | hook 正确,结果可重复 |
| 第 3–4 周 | 现成或自训 SAE,多维质量检查 | 重建、L0、损失与随机特征审计 | 表示可用,误差未掩盖目标行为 |
| 第 5–6 周 | 一次性解释与固定难负例 | 冻结测试、失败分类 | 说明能泛化到未见样本 |
| 第 7–8 周 | 主动假设修正与独立执行 | 等预算基线、原始实验记录 | 有可测增益或清晰负结果 |
| 第 9–10 周 | 干预预测与局部电路 | 随机方向、组合干预、任务保持 | 机制主张范围可界定 |
| 第 11–12 周 | 扩展第二模型或一个多模态接口 | 迁移、混淆控制、完整复现包 | 能说明泛化和失败边界 |
每个阶段都应允许“没有证据支持当前假设”成为正式产物。若第二阶段发现 SAE 重建严重损害目标行为,就应先修复或更换表示,而不是继续让 Agent 给失真的特征取名字。若主动循环没有比固定实验更好,下一阶段应研究失败原因,而不是无限增加步骤。
一个合格的最终研究包应包含:问题与适用范围、数据划分、模型与字典版本、干预定义、原始测量、解释与证据对应、成功与失败案例,以及能够重新计算主要结论的脚本。图表只展示经过这些记录支持的汇总。
14. 阅读路线与开放问题
建议先沿四条线阅读,每条线都同时配一篇局限或评测材料。
- 理解计算对象:Transformer Circuits Framework → IOI → Activation Patching 方法讨论。目标是看懂信息如何流动,以及实验究竟改变了什么。
- 理解表示分解:Toy Models of Superposition → SAE 基础与 scaling → SAEBench → SAE 非规范性。目标是理解字典的用处与边界。
- 理解自动化:Neuron Explainer → Delphi → MAIA → InterpAgent / HyVE → CHIVE。目标是分清命名、实验、验证和实际效用。
- 理解跨层与多模态:Transcoders → Sparse Feature Circuits → Circuit Tracing / CRM → VLM SAE / AudioSAE / TTS SAE。目标是把局部表示转为具体机制问题。
未来最值得持续追踪的开放问题包括:自动化能否发现人类没有预先命名的计算变量;不同字典间的机制是否有稳定等价关系;解释模型如何报告不可语言化的信息;局部电路能否组合为跨样本的算法;以及内部工具能否稳定改善模型调试、数据选择与训练决策。
本报告的研究立场是:让解释承担预测责任,让自动化承担验证责任。 机制可解释性的价值来自可积累、可反驳、可迁移的内部计算知识。自动化最有希望的作用,是降低获得这类知识的成本,并让错误解释更快暴露。
15. 参考文献与来源
检索截止为 2026 年 9 月 12 日。正文引用均指向原始论文、研究团队报告或官方代码;近期预印本按页面所示版本理解,未经复核的榜单宣传和二手综述不作为核心结论依据。下表的日期优先记录初版年份,必要时补正式发表或使用版本信息;网站与代码资源以检索时状态为准。
代码资源的发布者、入口与用途另见第 11 节。图 1、图 3、图 4 为本文综合绘制的概念流程图,不包含测量数据;图 2 为已明确标注来源的数值重绘。