机制可解释性

机制可解释性与可解释性自动化

从 SAE、因果干预和计算电路到自动解释、研究 Agent 与激活语言化:46 项研究来源、评测证据与争议、视觉语音动作延伸,以及可执行的研究路线。

2026-09-12 Mechanistic Interpretability AutoInterp SAE Circuit Tracing Multimodal

1. 核心判断与研究边界

机制可解释性(Mechanistic Interpretability,MI)的核心问题,是神经网络内部通过什么表征、信息传递路径和计算规则产生行为。可解释性自动化(Automated Interpretability)则试图让机器承担其中的观察、命名、定位、提出假设、设计实验、验证和总结。二者紧密相关,但自动生成一个合理的说明,不等于自动恢复了模型实际使用的机制。

截至 2026 年 9 月 12 日,较为稳健的判断是:特征描述和候选机制搜索已能大量自动执行;能够跨任务、跨分布、低成本地验证解释的系统仍不成熟。 研究前沿正从“发现一个可命名方向”转向“解释能否预测干预、是否优于行为基线、失败时能否自动修正”。SAEBench、MIB、AgenticInterpBench 和 CHIVE 分别提供了不同层面的检验,结果不支持用单一的自动解释分数代表整体进展。SAEBenchMIBAgenticInterpBenchCHIVE

本报告以大语言模型为主,延伸到视觉语言、语音理解、语音生成与视觉语言动作模型。基础部分解释必要数学与实验逻辑;前沿部分区分正式论文、技术报告和近期预印本;实验路线与系统设计属于基于这些证据提出的研究建议,不代表已经完成的实验。

关键判断 证据支持到哪里 暂不能推出什么
稀疏表示能提供有用的研究坐标 SAE 可提取便于描述和操纵的特征 存在唯一、完整的“概念词典”
自动解释能减少人工浏览 解释可在留出数据上预测激活 特征在自然生成中承担所描述的计算
自动电路搜索能定位部分因果路径 在指定任务、模型与干预协议下恢复行为 找到了全模型的唯一算法
Agent 能执行迭代研究 可生成对照、运行工具、修正候选假设 代码执行成功就代表实验设计有效
激活语言化有助于生成假设 能产生可读描述,在部分审计设置中有收益 描述就是内部思维的逐字转录
多模态解释已经有实证进展 可定位和干预部分视觉、声学、动作特征 已解释开放世界多模态推理全过程

表中的证据边界综合自 SAE 非规范性研究、特征自动解释、局部电路追踪和多模态干预工作;它是一套阅读框架,而非给方法排定绝对优劣。Leask 等Paulo 等Circuit TracingVLM SAE

2. 从解释行为到解释机制

2.1 四种容易混淆的解释

行为解释考察输入条件怎样改变输出。例如,改变问题的措辞后模型更容易出错。这是关于输入输出的经验关系,可以非常有价值,但没有直接定位内部实现。

表征解释考察内部状态包含什么信息。例如,一个线性探针能读出实体身份,一个 SAE 特征对某类语法结构激活。可读出性证明信息可被某个解码器利用;要判断原模型是否使用它,仍需额外实验。

机制解释进一步说明信息由谁读取、如何变换、经过什么路径影响输出。经典 Transformer 电路分析将注意力分成决定信息路由的 QK 部分和决定读写内容的 OV 部分,为此类问题提供了可操作的计算对象。A Mathematical Framework for Transformer Circuits

模型自述是模型生成的解释文本,可能帮助理解结果,也可能遗漏、重构或猜测原因。Activation Oracle 和 NLA 与普通自述的差别,在于它们实际接收内部激活,并通过训练学习解释它;但输入来自内部不意味着输出中的每句话都具有因果证据。Activation OraclesNLA

2.2 “解释了多少”需要至少五个维度

本报告建议分别记录:可理解性、行为保真、干预预测、覆盖范围、解释复杂度。一个结论可能可读性强但覆盖窄,也可能能预测输出却依赖上千个难以命名的变量。不同研究优化的是不同维度,不能用漂亮图示抵消保真度不足,也不能因为局部结果不完整就否定其调试价值。

维度 可检验的问题 典型反例
可理解性 人能否依据说明预测激活或计算? 标签很抽象,任何样本都说得通
行为保真 简化模型是否复现原模型的输出分布? 正确率相同,但错误样本完全不同
干预预测 预先声明的干预效果是否实现? 看到结果后才改写解释
覆盖范围 对多少样本、任务、模态、层有效? 单一提示成立,改名后失效
复杂度 为了保真保留了多少变量与路径? 几乎保留整网,却称为精简解释

机制可解释性还存在非唯一性问题。Méloux 等在布尔函数与小型 MLP 中枚举候选解释,发现多组电路、算法或对齐映射可同时满足所选标准。这并非证明真实模型无法理解,而是说明“符合实验”与“唯一真实机制”之间仍有距离。Everything, Everywhere, All at Once

3. 基础方法与实验逻辑

3.1 神经元、多义性与叠加

一个神经元可能同时参与多个互不相同的模式,这通常称为多义性(Polysemanticity)。叠加(Superposition)提供一种解释:模型借助稀疏激活,在有限维空间中表示多于维数的特征,并容忍它们之间的干扰。Toy Models of Superposition 在合成的小网络中展示了这一机制,不能直接把该玩具模型的全部假设视为所有语言模型的定理。Toy Models of Superposition

假设隐藏状态 \(h\in\mathbb R^d\) 可近似写为:

\[ h\approx\sum_{i=1}^{m}z_i d_i+e,\qquad m>d. \]

这里 \(d_i\) 是候选方向,\(z_i\) 是其系数,\(e\) 是未解释部分。若每个样本只有少量非零系数,就可能在过完备字典中恢复易于研究的结构。这个表示假设很有生产力,但方向是否稳定、是否可命名、是否承担因果功能,需要分开检验。

3.2 SAE 到底学到了什么

稀疏自编码器(Sparse Autoencoder,SAE)通常通过一个稀疏瓶颈重建隐藏状态:

\[ z=f(W_{enc}h+b_{enc}),\qquad \hat h=W_{dec}z+b_{dec}. \]

经典目标可写为重建误差与稀疏惩罚之和。TopK 类方法则直接限制活跃维度,缓解稀疏度调节问题。Cunningham 等展示了语言模型激活上的可解释特征;Gao 等研究了规模、稀疏度和特征质量的关系,并将 SAE 扩展到千万级 latent。Sparse Autoencoders Find Highly Interpretable FeaturesScaling and Evaluating Sparse Autoencoders

研究时应明确 SAE 的训练目标是近似某个隐藏状态分布。它并没有被直接要求发现真实概念,也没有被直接要求保持每项下游行为。因此,“重建很好”首先是表示压缩的证据;如果用它解释模型功能,还应检查替换激活后的模型损失、任务指标和具体干预效应。

方法家族 核心设计 适合观察的取舍
ReLU + L1 SAE 对 latent 幅度加惩罚 稀疏与重建的权衡、幅度收缩
TopK SAE 每个输入保留指定数量的活跃系数 控制稀疏度方便,但所有输入共享预算
BatchTopK 在批次层面分配激活预算 不同样本可使用不同数量的特征
JumpReLU / 门控类 学习或分离激活门控 检测阈值与幅度估计如何相互影响
Matryoshka 类 以嵌套字典组织不同尺度的表示 宽泛概念与细分概念的层次关系

这些架构应在相同 hook、语料、训练预算和实际 L0 范围内比较。SAEBench 的一个重要结果是:代理指标上的改进未必转化为实际任务收益,Matryoshka 类方法在特征解耦维度的表现也不能仅由重建分数推断。SAEBench

3.3 为什么激活修补是核心工具

激活修补(Activation Patching)在一次前向计算中,用另一输入产生的激活替换指定中间状态。设目标输入为 \(x\)、对照输入为 \(x'\),在位置 \(S\) 施加干预后,比较模型指标:

\[ \Delta_S=m\!\left(F(x;h_S\leftarrow h_S(x'))\right)-m(F(x)). \]

这里 \(m\) 可以是 logit difference、概率、损失或任务成功率。\(\Delta_S\) 的含义取决于输入对差异、位置选择、替换方式与指标。它不是脱离这些条件的“该模块重要性”。How to Use and Interpret Activation Patching

例如,要研究模型如何区分“把杯子交给小李”与“把杯子交给小王”,对照应尽量只改变接受者,而不是同时改变句式、长度与情境。这是本文用于说明实验设计的示例,并非文献报告的实验。如果干预整个 residual stream,可能一次替换了身份、语法和任务状态;更细的路径实验才有助于拆开这些作用。

实验 主要问题 解释时的限制
将正常激活放入受扰动运行 这些信息能否恢复目标行为? 恢复截面不等于完整上游计算
将对照激活放入正常运行 该信息改变后行为是否被破坏? 效果取决于对照;冗余路径可能补偿
屏蔽电路外组件 候选电路是否足够? 必须写明屏蔽的替代值
屏蔽候选电路 它是否在当前分布承担重要作用? 单个不必要不代表整体无作用
路径修补 影响是否经过指定中介? 路径定义和冻结策略会影响结论

实践上应先粗粒度定位,再细粒度归因,最后验证组合干预。经典 IOI 工作展示了从行为任务出发研究注意力头之间功能分工的路线,但 IOI 是受控现象,不能代表整个自然语言理解。IOI Circuit

3.4 相关、可控、自然机制三个层次

“存在一个方向,沿它移动会改变输出”说明可控性;“原模型在自然样本中经常沿该方向变化”说明分布内相关;“上游读取某变量并通过此方向影响下游”才更接近机制链。强烈增加一个 latent 可能制造原本很少出现的状态,所以 steering 与自然机制验证应并列开展。

对子空间修补的批评指出,某些设置可能通过非预期通路产生预期效果;回应论文则认为,部分“解释幻觉”判据过强,且训练与评估协议会改变判断。这一争论支持更清晰地说明干预语义和泛化检验,而不是简单接受“修补成功即证明”或“所有修补都无效”。Makelov 等Wu 等的回应

4. 从特征词典到计算电路

4.1 SAE、Transcoder 与 Crosscoder

SAE 重建某个位置的状态,transcoder 近似一个模块的输入到输出映射。对 MLP 而言,可以把密集的非线性计算近似为更宽但稀疏激活的网络,从而分析特征之间的读写关系。Dunefsky 等在不同规模语言模型上展示了这一方法及其电路分析用途。Transcoders Find Interpretable LLM Feature Circuits

Crosscoder 则联合处理多个层或多个模型的激活,以共享 latent 研究表征对应与差异。它适合研究微调前后、训练阶段之间的表示变化;不过联合重建的关联结构未必等同于模型真实因果顺序,尤其不能把跨模型特征的高相似度直接当作机制相同。Sparse Crosscoders

对象 近似关系 首要用途 必要补充
SAE 一个状态到自身 分解与浏览表示 功能验证、误差分析
Transcoder 模块输入到模块输出 分析特征间计算 替代模型保真检验
Cross-layer transcoder 跨层读取与写出 简化跨层计算路径 跳层近似与误差贡献
Crosscoder 多处状态的联合表示 模型差分、跨层对应 对齐稳定性与干预验证

4.2 稀疏特征电路

Sparse Feature Circuits 将 SAE 特征作为计算图节点,并将未被字典解释的残差纳入分析。Marks 等展示了利用特征电路研究与编辑模型行为的可能性,包括通过移除被判断为任务无关的特征改善分类器泛化,以及自动发现大量局部行为电路。Sparse Feature Circuits

这条路线的重要性在于把“哪些特征存在”与“它们怎样影响输出”连接起来。面向 in-context learning 的后续工作还研究了任务识别与任务执行特征之间的因果联系,说明特征电路可以用于回答具体算法问题,而不只是生成一份词典。Scaling Sparse Feature Circuit Finding for In-context Learning

4.3 Circuit Tracing 的贡献与局限

2025 年的 Circuit Tracing 使用更可解释的替代组件构建单个提示上的归因图,并配合可视化与干预检验。其核心价值是把跨层特征交互变成可逐步追踪的对象。需要注意,图来自特定输入下的替代模型,依赖近似、冻结部分量及误差补偿,不能直接视为全局源代码。Circuit Tracing

一个节点标签是“城市”,连向一个标签为“国家”的节点,并不足以证明图中存在可靠的地理查询算法。需要进一步验证:改动城市信息是否按预测改变国家输出;保留这条路径是否足够;在多个城市、语言、问法中是否成立;是否存在未解释误差节点承担关键作用。

4.4 注意力为什么仍是难点

仅对 MLP 做稀疏替代,并没有解释注意力路由本身如何形成。OpenMOSS 的 Complete Replacement Model(CRM)把 MLP transcoders 与 Low-Rank Sparse Attention(Lorsa)结合,覆盖两类计算块,并探索 QK 追踪与全局权重分析。这里的“Complete”是架构覆盖意义,原文仍明确指出局部冻结量和误差项的限制。Bridging the Attention Gap

还有一个更深的问题:即使节点都能命名,大的特征间权重也可能代表干扰而不是有效功能。2026 年一项小型 Transformer 研究通过输出与损失变化识别干扰权重,提醒研究者区分权重幅度、实际生效程度与对任务的帮助。Characterizing Interference Weights

因此,本文建议电路浏览器同时展示“连接强度、数据上的共同激活、实测干预效果、未解释误差”,不要只按最大的几条边自动生成机制叙述。

5. 自动化方法的五条主线

以下分类按自动化承担的研究工作划分,各类可以组合,不是线性替代关系。

flowchart TD
    A[目标模型与行为问题] --> B[表征采样与候选发现]
    B --> C[特征自动解释]
    B --> D[自动电路搜索]
    A --> E[激活语言化]
    C --> F[竞争假设与实验设计]
    D --> F
    E --> F
    F --> G[执行干预与对照]
    G --> H[留出评估与反例]
    H -->|修正| F
    H --> I[限定范围的机制报告]

图 1:本文提出的综合工作流。特征名称、电路和语言化读数都先进入假设层,实验结果才决定哪些主张可以进入报告。

5.1 主线一:自动解释特征

Bills 等在 2023 年提出用语言模型生成神经元描述,再根据描述模拟其在未见文本上的激活。这个设计把“解释好不好”部分转化为可测的预测任务,是后续 auto-interp 的重要起点。它的评估对象是激活模式,不是整个模型的因果算法。Language Models Can Explain Neurons

Paulo 等把这一思路扩展到大量 SAE latent,提出生成与评估自然语言解释的开放流水线,并包含干预效果评分。其配套 Delphi 支持 SAE 和 transcoder 特征的解释与评分。应区分检测式评分与干预式评分,不能仅因为使用了同一个框架就认为每个解释都经过因果验证。Automatically Interpreting Millions of FeaturesDelphi

本文建议保存的最小解释单元,不只是一个标签,而是一个带边界的假设:它在哪些位置激活、对哪些反例不应激活、是否依赖语言或格式、哪些测试已经失败,以及解释是否包含多个并列含义。这能防止自动标签在后续研究中逐渐被误当作真实概念定义。

5.2 主线二:自动搜索电路

ACDC 自动化的是在给定行为数据与指标后寻找连接。EAP 用梯度近似降低逐条干预成本;EAP-IG 通过沿插值路径积累梯度改善近似。Edge Pruning 则把边的选择转为可优化的掩码问题。ACDCEAP-IGEdge Pruning

路线 如何获得候选电路 主要优势 主要风险
ACDC 迭代删边并观察性能 接近显式干预搜索 成本高,依赖遍历与阈值
EAP / EAP-IG 估计每条边的贡献,再选择 高效筛查大量路径 非线性、边交互与基线选择
Edge Pruning 优化稀疏边掩码 联合考虑边集合 优化目标与解释目标可能不一致
特征归因图 在稀疏替代表示上构图 节点较容易解释 替代误差与局部近似
形式化发现 使用验证器证明规定属性 有明确的保证范围 计算成本与模型适用范围

EAP-IG 的重要方法论提醒是:与人工电路重叠很多,不代表电路保真。Edge Pruning 的稀疏结果也只说明在其任务、数据和替代协议下保留了行为,不能把删边比例解释为“模型其余参数无用”。EAP-IGEdge Pruning

2026 年的 Formal Mechanistic Interpretability 研究输入区域鲁棒性、鲁棒修补与不同最小性定义的保证,实验针对视觉模型。这提供了更严格的方向,但不是已经能证明任意大语言模型全局机制正确。Formal Mechanistic Interpretability

5.3 主线三:Agent 执行解释性实验

MAIA 将视觉语言模型与生成、编辑输入、寻找高激活样本等工具结合,让系统迭代测试视觉模型组件。它区别于一次性命名的关键是主动实验。其主要证据来自视觉特征与模型失败案例,不宜直接外推为大语言模型全流程研究能力。MAIA

2026 年的 InterpAgent 进一步将特征寻找与解释修正连接。FeatureExplainer 维护竞争假设并生成匹配对照;FeatureFinder 从激活结构中检索候选。值得注意的是,其主排序采用多指标评价,steering 测试可用但默认不参与排名。因此“修正后的解释胜出”主要是对应评价体系下的结果。Automated Interpretability and Feature Discovery with Agents

HyVE 聚焦已经定位的电路,循环执行观察、假设与验证。AgenticInterpBench 包含 84 个半合成电路与 163 项组件级标注;论文发现不同模型在标签、说明、任务推断和代码执行上的优势并不相同。这是“会解释已知电路”的测试,仍不是从任意真实模型自主发现完整算法。HyVE / AgenticInterpBench

5.4 主线四:把内部激活翻译成自然语言

Activation Oracles 接收模型激活和问题,通过监督训练学习回答内部状态相关问题;NLA 则通过“激活→文本→重建激活”的瓶颈联合训练语言化与重建模块。前者适于定向询问,后者可生成开放式描述。二者都提供比固定特征标签更灵活的接口,但语言化结果仍需要独立验证。Activation OraclesNLA

这里的研究取舍可以写为:更丰富的表达能力,使假设更容易提出,也扩大了错误叙述的空间。本文建议把读数拆成原子主张,再逐条验证,而不是给一段流畅文字整体打“可信”标签。对于时间性主张,还要区分模型在行动前的状态与行动后的回顾表示。

5.5 主线五:训练时让模型更容易解释

另一条路线直接约束模型权重结构。Weight-sparse Transformers 通过大量零权重降低连接复杂度,使部分小任务电路更容易逐层理解,同时观察到能力与解释性的取舍及扩展困难。这与给密集模型训练一个 SAE 是不同问题:它改变了被研究模型本身。Weight-sparse Transformers Have Interpretable Circuits

本文的判断是,短期内“解释现有模型”与“训练可解释模型”应并行。前者更容易服务实际调试,后者可能提供机制验证所需的更清晰实验对象。比较两者时要同时报告能力、训练成本、可解释范围和迁移到真实密集模型后的保真程度。

6. 自动化前沿的实证比较

6.1 不同系统究竟自动化了哪一段

系统或研究 输入条件 自动完成的工作 主要输出 证据边界
Neuron Explainer(2023) 神经元及其激活样本 生成解释、模拟激活 描述与预测分数 单元描述,不等于因果链
Delphi / Millions of Features(2025 正式发表) SAE / transcoder 字典与激活 大批量生成、评分 特征解释库 取决于实际启用的评分器
MAIA(2024) 视觉模型组件与工具 主动生成、编辑、测试输入 实验驱动描述 主要是视觉模型场景
InterpAgent(2026 预印本) 字典或神经元与研究方向 候选寻找、竞争假设修正 假设与审计轨迹 主排序不默认依靠 steering
HyVE(2026 预印本) 已定位电路 组件实验与角色归纳 组件与任务解释 半合成电路为主要基准
SAEScientist-Bench(2026-09 预印本) 给定目标概念、可查询 SAE 自主寻找并提交特征 特征 ID 与研究过程 20 项单特征任务,专家参考有限
Activation Oracles(2025 技术报告) 内部激活与问题 回答激活相关问题 自然语言答案 读出内容不自动证明因果
NLA(2026 技术报告) 内部激活 生成自然语言瓶颈表示 文本说明 重建目标与机制目标有差距
CHIVE(2026 技术报告) 模型交互记录 发现异常、测试提示编辑 可验证反事实数据 属于行为因果调查,不直接定位内部路径

表中各系统的输入与边界依据其原始论文和官方项目说明;“自动化程度”没有单一标尺。例如,给定电路后解释它,与从行为现象出发定位电路,不能按输出长度直接比较。Neuron ExplainerDelphi 论文MAIAInterpAgentHyVESAEScientist-BenchAONLACHIVE

6.2 HyVE:实验执行能力与解释能力并不等价

下表保留 HyVE 原论文表 2 的四个维度,范围均为 0–1,越高越好。标签准确率、说明质量、任务推断准确率与代码执行成功率测量不同对象,不能求平均后宣称某模型整体更懂机制。

HyVE backbone 组件标签准确率 角色说明质量 任务推断准确率 代码执行成功率
GPT-5.4 0.74 0.46 0.63 0.52
Claude Sonnet 4.6 0.79 0.58 0.75 0.93
Gemini 3.1 Pro 0.76 0.59 0.83 0.80
Qwen-3-Coder-30B-A3B 0.67 0.25 0.25 0.62

HyVE 各维度评测,四个并列坐标面板分别展示组件标签、角色说明、任务推断和代码执行分数

图 2:根据 HyVE 原论文表 2 重绘。原表未给出这些汇总值的置信区间,因此图中不添加推测的误差棒。模型名称是该论文的实验配置标识,不代表当前模型市场排名。下载数据 CSV

角色说明与任务判断使用 LLM 评审,并以双评审较低分聚合;作者还对部分任务做了人工一致性检查。即使如此,说明质量仍包含评审依赖,代码成功率也仅代表调用未报错。本文的分析是,应将“实验是否真的测试了主张”单列成流程指标,否则运行能力的提升容易被误记为科学推断能力的提升。评测协议

6.3 SAEScientist-Bench:选择性高不等于干预效果强

2026 年 9 月 8 日发布的 SAEScientist-Bench 在 Gemma-2-9B-IT 的 131K+ 字典中设置 20 个目标概念任务,评测 10 种 Agent 配置。其主表中,最好的 Agent 选择性分数为 92.91,专家参考为 98.92;最好的 Agent steering 分数为 31.47,专家为 57.75。两个 Agent 最优值来自不同配置,不应拼成一个虚构系统。SAEScientist-Bench 表 1

该基准的 Rank、Activation、Steering 不是同一种量:Rank 相对专家归一化、可超过 100;Activation 是 AUROC 的变换;Steering 是扣除基线与随机方向控制后的生成评分增益。其专家特征、干预幅度校准和 Agent harness 也存在协议差异。近期预印本提供的是研究线索,不能直接解释为通用科研能力的百分比。指标与实验协议

6.4 CHIVE:为何需要没有内部工具的强基线

CHIVE 自动提出并执行提示编辑,以实测结果评估行为解释。在其评测中,配有 SAE、NLA 或 Activation Oracle 的预测 Agent 未超过只看交互记录的基线;作者在多个目标与预测模型设置中检验了这一结果。其结论针对所测的反事实预测任务,不是对所有内部工具的普遍否定。CHIVE

这一结果与部分审计任务中激活语言化有收益并不矛盾。审计可能需要发现被隐藏的信息;反事实预测要求识别导致行为变化的条件。读出一个概念与预测它的因果影响是不同任务。本文建议所有自动化研究都保留行为基线,并按发现异常、定位变量、预测干预、修复行为分别统计工具增益。

7. 如何评测可解释性自动化

7.1 基准的不同层级

基准 主要评测对象 适合回答的问题 不适合单独回答的问题
InterpBench 已知电路的半合成 Transformer 方法能否恢复已知结构? 对真实模型开放任务是否同样有效?
SAEBench SAE 的多维质量 字典改进是否有实用收益? 自动研究 Agent 是否会设计实验?
MIB 电路与因果变量定位 定位方法在统一协议下如何表现? 所有模型、任务的普适排名是什么?
AgenticInterpBench 已定位组件的解释 Agent 能否归纳和验证组件作用? 能否自己选择问题并完成全链路研究?
SAEScientist-Bench 目标概念的特征发现与 steering 找到的特征是否选择性强且可控? 能否发现长链算法或完整机制?
CHIVE 自然行为的反事实预测 内部读数能否提供额外预测价值? 能否直接恢复内部电路?

InterpBench 利用 SIIT 训练保留指定电路的半合成模型,提供稀缺的结构参照。MIB 则包含电路定位与因果变量定位两个赛道;其论文中监督式 DAS 在后一赛道表现较强,SAE 未优于神经元基线,说明方法选择取决于是否有目标变量监督与具体任务。InterpBenchMIB

7.2 分开测量预测与干预

建议对一个候选解释保留四套独立输出:激活预测、行为预测、干预方向预测、干预幅度预测。二分类“激活或不激活”可能掩盖强度与位置错误;只测输出是否变了,则可能奖励破坏模型的操作。更理想的评价是提前写明哪个变量会改变、改变方向、在哪些样本不该改变,以及允许的非目标损失。

以下是本文提出的一组记录指标,属于实验协议建议:

指标组 建议记录 实际意义
表示质量 L0、重建误差、替换后损失 坐标是否过粗或严重失真
说明质量 留出检测、难负例、位置预测 文字是否压缩了真实激活规律
干预效果 目标效果、随机方向、反向与零操作 是否超出任意扰动带来的变化
电路质量 保真—大小曲线、删除与保留实验 是否以较少结构复现原模型
稳定性 seed、样本 bootstrap、提示改写 结论是否由偶然选择驱动
研究过程 无效实验、代码错误、错误结论率 自动化的失败发生在哪一步
实际效用 调试时间、修复收益、非目标退化 内部工具是否改善最终工作
成本 调用次数、tokens、运行时间、人工审核 效果是否值得投入

7.3 不要只报告一个保真率

作为实验设计示例,可以将某一任务指标的恢复比例写成:

\[ R(C)=\frac{m(F_C)-m(F_{base})}{m(F)-m(F_{base})}. \]

其中 \(F_C\) 是保留候选电路的运行,\(F_{base}\) 是协议规定的替代基线。这不是跨论文通用标准;必须明确 \(m\) 的方向与基线。当分母很小,比例不稳定;当它超过 1,也不能自动理解为“解释超过 100%”,而应检查非线性、抑制路径与替代效应。

除了这个比例,应该报告原始指标、输出分布差异、不同电路大小上的曲线,以及任务外控制。对于备份或并行路径,单个组件删除无效果并不排除其参与计算;组合删除的结论也不能无条件分摊给每个成员。Patching 方法讨论

7.4 探索集与确认集必须隔离

Agent 会根据反馈反复修改假设,因此它见过的测试集很快变成训练信号。本文建议三段数据隔离:发现集用于生成候选;验证集用于调参和选择;冻结测试集只在最终提交后评估。不同层、字典、阈值、干预幅度的选择也属于搜索,不能只把文字提示视为调参。

对成千上万特征同时检验时,还要处理多重比较。可以在发现阶段使用 FDR 控制筛查候选,但最终因果主张仍应由独立数据与效应量支持。统计显著性不能替代机制说明:一个几乎没有实用影响的小差异,在足够大样本下也可能很显著。

8. 主要争议与失败模式

8.1 字典不是自然界的元素周期表

Leask 等利用 SAE stitching 和 meta-SAE 说明,不同大小字典中的特征可能新增、替换或分解,难以视为唯一完备的原子概念。实践中的后果是,特征 ID 必须绑定模型、层、字典版本和训练条件;不能把两个 SAE 中名字相同的 latent 当成同一对象。SAE 非规范性

本文建议区分三种稳定性:方向相近、激活样本相近、干预结果相近。三者可以不一致。研究模型升级时,优先寻找“功能匹配的一组特征”,而不是要求一个旧 ID 找到唯一新 ID。

8.2 解释可以比行为更脆弱

Li 等发现,在其评测设置中,小输入扰动能够显著改变 SAE 概念解释,同时基础模型输出变化不大。这对把单个概念读数直接用作监控告警提出挑战。该结果说明需要测试解释稳定性,不意味着所有 SAE 表征在所有输入下都失效。Interpretability Illusions with SAEs

同时,简化模型在分布内近似很好,也可能在系统泛化测试中与原模型分离。Friedman 等在受控任务中展示了这一问题。一个解释在已观察数据上更简洁、更合逻辑,并不能保证它准确描述真实模型的边界行为。Interpretability Illusions in Simplified Models

8.3 可控方向不一定是唯一语义开关

一个方向可能同时影响主题、风格、拒答倾向或生成熵。把输出变化概括成“打开了某概念”,容易掩盖副作用。本文建议干预报告包括强度扫描、负向干预、范数匹配随机方向、语义相近方向,以及不涉及目标概念的任务保持情况。

理想的成功结果是:低幅度干预产生可预测、局部、可逆的目标变化,而且影响随上下文满足预期条件。若只有极强扰动才能见效,并伴随重复或任务失败,更合理的描述是“找到了可诱发该输出的方向”,而不是“定位了正常生成时的控制模块”。

8.4 语言化模型带来了第二层解释问题

将激活翻译为自然语言,意味着目标模型之外又引入一个解释模型。研究者还需要知道解释模型何时依靠激活,何时依靠提示语义猜测。可以比较真实激活、打乱激活、零激活与只给文本的条件,并检验读数对输入交换是否敏感。

NLA 原始研究讨论了虚构细节、语言瓶颈退化和成本;因此将其读数作为候选线索比较合适。本文的建议是,审计界面应保留激活的来源位置、生成时刻、读数版本以及验证状态,避免把未经验证的自述传播成事实。NLA 局限

8.5 自动化可能扩大确认偏误

人类可能挑选令人信服的例子;Agent 则可能快速生成大量支持自己假设的例子。若生成对照、选择结果、写解释和评分都使用同一套偏好,流水线会显得一致,却未必接近真实机制。本文建议将实验执行和评分约束为独立协议,保留被否定的假设,并要求解释承担对未见实验的预测责任。

9. 从语言模型延伸到多模态

9.1 多模态解释的研究对象

“多模态可解释性”至少有四个层面:感知编码器学到了什么;模态接口保留或丢失什么;语言主干如何使用模态证据;生成或动作模块如何实现输出。只解释一个视觉 encoder 的特征,不能覆盖视觉问答全过程;只解释一个声学 latent,也不能证明它参与了语言规划。

flowchart LR
    A[图像或音频] --> B[感知编码器]
    B --> C[Projector 或模态接口]
    C --> D[语言主干]
    T[文本指令] --> D
    D --> E[回答或工具决策]
    D --> F[语音或动作生成]
    B -.观察.-> B1[视觉区域与声学事件]
    C -.观察.-> C1[跨模态对应与信息损失]
    D -.观察.-> D1[证据融合与推理路径]
    F -.观察.-> F1[时序结构与控制变量]

图 3:多模态解释的研究切片,由本文归纳。实际模型可能省略或合并部分模块;应以其真实计算图确定采样点。

9.2 视觉语言模型

Pach 等将 SAE 应用于 CLIP 等视觉语言表示,结合人类感知评价研究单义性,并展示对视觉编码器施加 SAE 干预可影响 LLaVA 输出。它表明视觉表示中的方向可以具有下游作用,但未自动恢复完整跨模态推理链。Sparse Autoencoders Learn Monosemantic Features in VLMs

2026 年 7 月的结构化 SAE 工作对 Qwen2.5-VL 引入图像 patch 的语义与空间先验,以改善跨模态概念一致性。这里应区分“表示更符合预先设定的结构”与“发现模型原本唯一的结构”;后者仍需独立因果证据。Structured SAEs Across Modalities

本文建议 VLM 实验至少分开四类变量:真实视觉属性、图中文字、问题措辞、常识先验。一个所谓“红色”特征可能响应图像颜色,也可能只响应问题中的“红色”一词。通过保持问题不变而替换图像、保持图像不变而改问题、加入图文冲突,可以识别这些不同解释。

9.3 语音理解与 ASR

AudioSAE 在 Whisper 与 HuBERT 编码器各层训练 SAE,评估稳定性与实际应用;论文报告在其设置中通过特征 steering 降低 Whisper 的错误语音检测,且 WER 增幅很小。其跨 seed 一致性结果也是协议内的经验测量,不意味着全部音频概念都稳定可恢复。AudioSAE,EACL 2026

2026 年 5 月的另一项 Whisper SAE 工作展示了语言与非语言特征、跨语言 steering;神经音频 codec 研究则比较了口音信息如何出现在不同表示中。它们的模型与任务不同,应避免把所有音频 SAE 结果合并成一个成熟度数字。Whisper SAENeural Audio Codecs 与口音

语音自动解释需要保留时间结构。只提供转写文本会丢掉语速、重音、笑声与说话人线索;只给最高激活音频片段,又可能忽略上下文。建议同时存储音频时间窗、转写对齐、层位置、说话人和录音条件,并在相同文本、不同声学条件以及相同声学条件、不同文本之间构造对照。

9.4 语音生成与 TTS

2026 年 6 月针对 CosyVoice3 的研究,根据激活发生在文本前缀、语音位置或两者,选择文本窗口、短音频片段或混合证据进行自动解释。作者还展示了笑声、语速等方向的控制;这些是特定模型和干预条件下的实证,不应推断为任意 TTS 模型的通用旋钮。Interpreting and Steering a TTS Language Model

这一设计对自动化的启示是:解释器应按证据模态路由,而不是先把所有证据变成文本。本文建议在评价生成控制时同时测内容保持、声学属性变化、音质、说话人相似度与自然度,避免把“笑声变多”而“词语说错”计为完整成功。

9.5 视觉语言动作模型

Swann 等在 VLA 隐状态上训练 SAE,研究跨任务语义与运动特征,并在 LIBERO 和真实 DROID 硬件上验证部分干预。动作场景的关键区别是闭环:改变一次动作会改变下一时刻观测,继而改变整条轨迹。SAEs in VLA Models

因此本文建议分开短时动作效应与长时任务效应。一个方向让机械臂转向某物体,可能来自视觉注意、目标选择、坐标表示或控制输出层;需要跨层中介与轨迹对照才能区分。成功率提高是实用结果,但机制解释还应说明在什么状态下、通过哪一中间变量产生改善。

9.6 语音 Agent 的优先研究问题

对于语音输入、语言推理、工具调用、语音回复连接的系统,本文建议优先研究“证据在哪里改变了决策”:听到否定词是否改变工具参数;同一句话的疑问语气是否改变行动策略;文本和声音冲突时模型依据谁。它们都能构造明确对照,比“寻找规划概念”更容易获得可证伪的结果。

问题 关键对照 内部观察 外部判据
语音内容是否正确进入主干? 同内容音频与转写 接口前后表示 内容理解与参数正确性
模型是否依赖说话方式? 同文本不同韵律 声学与主干特征 澄清、确认或直接执行
图文或音文冲突如何解决? 单模态与冲突双模态 融合路径 对正确证据的依赖
工具错误如何被识别? 相同请求,不同工具返回 决策前后状态 重试、修正或错误传播
输出语音是否改变语义? 相同主干计划、不同生成条件 生成模块特征 转写一致与语用变化

这是一份待执行的实验矩阵,不是既有模型已经具备这些机制的声明。

10. 自动化研究系统的设计

本节提出一个面向复现与可靠验证的系统方案。它综合上述方法,但并非声称已有单个开源工具实现全部能力。

10.1 先标准化实验对象

每个研究对象应绑定五项身份:模型权重版本、tokenizer 或模态前处理版本、hook 位置、字典或替代模型版本、数据版本。对于自回归生成,还应记录是否使用缓存、干预发生在 prefill 还是 decode、影响哪些 token。否则同一个“第 12 层”在不同适配器里可能并非同一张量。

实验接口应返回结构化测量值,而不是仅返回自然语言总结。一个候选特征至少包含 top samples、随机激活样本、难负例、实际 L0、激活分布、解释版本和已执行测试。异常、超时、模型执行失败应作为独立状态,不能自动映射为“假设不成立”。

10.2 将提出假设、执行实验与判定分开

flowchart TD
    A[问题与预算] --> B[候选检索]
    B --> C[提出多个可区分假设]
    C --> D[提交实验计划与预期结果]
    D --> E[确定性执行器]
    E --> F[原始数值与运行状态]
    F --> G[独立评估协议]
    G --> H{证据是否充分}
    H -->|否| C
    H -->|是| I[冻结测试集]
    I --> J[主张与证据对应报告]

图 4:建议的自动化研究架构。图中的“独立”主要指职责与信息边界,既可以由一个 Agent 分阶段执行,也可以由多个角色实现;不以角色数量作为质量保证。

确定性执行器负责张量替换、范数控制、种子、对齐和数值计算;Agent 负责选取问题与解释结果。这样可以把“工具实现有误”与“科学假设不对”区分开。为了测试 Agent 的实质贡献,应比较固定实验菜单、规则搜索、一次性解释和主动迭代,并控制总预算。

10.3 主张必须连接到证据

建议每条结论使用下面的简化结构。这是报告数据格式示例,不依赖特定软件库:

{
  "claim": "候选特征响应目标语义,而非固定字面片段",
  "scope": "指定模型、字典、层、语言与任务分布",
  "alternatives": ["字面片段检测", "文档格式检测"],
  "predictions": ["同义改写保持激活", "字面相同但语义无关时不激活"],
  "evidence_ids": ["heldout-contrast-01", "paraphrase-02"],
  "intervention_status": "尚未检验",
  "conclusion_status": "表征假设得到支持,因果功能未定"
}

报告系统不能因为表征测试通过,就自动把 intervention_status 升级。若测试结果相互冲突,应保留竞争解释或收窄范围。对需要人工介入的条目,优先交付具体矛盾与原始证据,而不是要求人重新阅读整条聊天轨迹。

10.4 成本应按有效结论计算

一个更有意义的研究成本指标是:

\[ C_{validated}=\frac{C_{sampling}+C_{discovery}+C_{testing}+C_{review}}{N_{supported\ claims}}. \]

这是本文建议的核算方式,不是已建立的领域标准。分母应限于通过预设门槛且有适用范围的结论,不能把生成的标签数计入。还应另报失败率与待定率,以防系统通过只研究极简单问题来降低平均成本。

在实际流程中,可以先用低成本统计筛查或一次性解释完成初步分类,将预算投向高价值、分歧大或与故障相关的候选。若主动迭代没有提高冻结测试上的表现,则不应仅因轨迹更长而认为研究更深入。

11. 工具生态与选型

以下入口按 2026 年 9 月检索结果列出。它们承担不同工作,不应假设任意模型、任意 SAE 与任意电路工具可无缝互换。复现论文时优先固定论文对应版本,再决定是否迁移到当前主分支。

工具或资源 主要用途 适合的起点 使用时重点核验
TransformerLens 语言模型内部读取与干预 受控文本任务、注意力电路 模型支持、hook 语义、权重转换
SAELens SAE 训练、加载和分析 文本 SAE 实验 字典与模型层的严格匹配
OpenMOSS Llamascopium SAE 与相关解释方法 稀疏表示及替代模型研究 原 Language-Model-SAEs 已重定向至此
Delphi 解释生成与评分 批量特征自动解释 当前分支与论文复现分支差异
Gemma Scope / Scope 2 已训练字典和 transcoders 减少从零训练成本 Gemma 2 与 Gemma 3 资源不可混用
MIB 统一机制定位评测 比较定位方法 模型—任务对与赛道设置
EAP-IG 复现代码 梯度近似电路搜索 已定义的文本行为 子模块版本与归因指标
Edge Pruning 边掩码优化 比较稀疏保真曲线 transformers 版本适配提示
NLA 官方配套代码 激活语言化研究 复现语言瓶颈读出 检查训练目标、模型权重与成本
AudioSAE 音频 SAE 展示与权重 Whisper / HuBERT 分析 帧与时间窗对齐、音频前处理
CircuitKIT 发现、评估与干预接口整合 关注工作流复用 新近工具;论文称 source-available,应核验许可

Gemma Scope 2 的官方说明覆盖 Gemma 3 各层的 SAE 和 transcoders,并包含 Matryoshka、skip-transcoder 和 cross-layer 相关资源。它降低了进入门槛,但字典现成并不意味着任务评测也现成。Gemma Scope 官方说明

本文建议按问题选栈:已知行为定位优先干预与电路工具;大量候选浏览优先现成 SAE 和自动解释;多模态问题先保证时间、空间、token 对齐,再选择字典;开放式内部读出可试 AO/NLA,但必须保留只看输入输出的基线。

12. 研究机会与优先级

本节为研究判断,不是对论文接受概率或实验成功率的预测。优先级主要依据问题能否明确定义、是否能取得可信负结果,以及能否沿用现成模型资源。

12.1 优先方向一:解释能否预测干预

问题。 一个高 auto-interp 分数的特征解释,是否更能预测该特征被抑制、增强或替换后的行为?

实验。 选择若干任务、层和字典,为特征生成文本描述;在不展示实测干预结果的情况下,要求解释模型预测目标变化及副作用。对照包括无解释、随机解释、只给高激活样本、只看模型输入输出,以及人为精选说明。

贡献判据。 重点报告分数与干预预测之间的条件关系,而非寻找一个漂亮相关系数。如果描述只对激活有效,应该明确解释与控制之间的缺口。若某种加入下游信息的方法能改善预测,应再检查其是否只是泄漏了输出答案。

12.2 优先方向二:主动实验是否值得其成本

问题。 多轮 Agent 能否用同样预算,比一次性解释加固定对照更快排除错误机制?

实验。 固定目标模型、数据和预算,比较随机探测、固定菜单、启发式选题、主动竞争假设。测量每轮排除的错误假设、最终错误主张率与运行成本,并加入“允许返回不确定”的设置。

贡献判据。 结果应按难度分层。如果多轮只对多义特征或难负例有收益,可设计选择性升级策略。若没有收益,也可以通过错误分类说明瓶颈是实验计划、执行接口、读数理解还是停止决策。

12.3 优先方向三:多模态语义与表面线索解耦

问题。 自动解释器是否将转写词汇、图中文字或声学伪相关误认作跨模态概念?

实验。 建立图像—文本或音频—文本的控制矩阵,系统改变目标语义与干扰变量。对候选 latent 同时测跨模态检测与局部干预,在未见说话人、未见场景和冲突输入上评价。

贡献判据。 高质量结果应显示哪些解释可跨模态迁移、哪些只在单一证据通道成立。比起简单报告“存在共享特征”,更有价值的是验证共享特征是否承担模型决策中的证据传递。

12.4 优先方向四:训练过程与机制来源

问题。 某种训练数据改变后,是已有机制变强、新机制形成,还是模型改用另一条路径?

MDA 使用 influence functions 将可解释单元追溯到训练样本,并通过数据移除或增加检验机制形成变化。这是从静态结构走向训练因果来源的重要路线,但不能将其在 Pythia 与特定头上的结果无条件推广到全部能力。Mechanistic Data Attribution

建议实验。 对训练阶段或微调前后做功能对齐;先确认行为变化,再观察特征与电路,最后干预训练数据或模型内部验证中介。需要区分 SAE 重新训练造成的字典漂移与模型自身变化。仅凭独立字典里某个标签首次出现,不能宣称概念在该时刻诞生。

12.5 研究选择矩阵

方向 主要成本 关键依赖 可交付的最小结果 优先级判断
自动解释与干预预测 多次前向与解释调用 现成模型与 SAE 一套受控评测和失败类型
主动实验成本收益 Agent 重复运行 稳定执行器与冻结测试 预算—有效结论曲线
语音或视觉混淆控制 数据配对与模态处理 可访问的编码器/主干 明确的一条跨模态因果链 高,适合领域团队
checkpoint 机制演化 激活与版本存储 多阶段权重 功能匹配与变化验证 中高
通用全模型电路恢复 大规模替代训练与图搜索 算力、验证体系 先限定一个行为分布 长期
任意自然语言机制证明 理论与形式化求解 明确语义及可扩展验证器 受限模型上的保证 长期

优先级不是领域重要性排名。长期方向很重要,但如果缺少可验证中间目标,自动化容易退化成生产不可检验的叙述。

13. 十二周实验路线

这份路线面向已有模型推理与基础 Python 能力的研究团队。它是一份建议计划,未预设具体设备预算,也不承诺在十二周内获得论文级结论。

阶段 核心工作 必须提交的证据 继续推进条件
第 1–2 周 一个小文本模型、一个明确行为、修补复现 正常/对照/零操作与双向修补 hook 正确,结果可重复
第 3–4 周 现成或自训 SAE,多维质量检查 重建、L0、损失与随机特征审计 表示可用,误差未掩盖目标行为
第 5–6 周 一次性解释与固定难负例 冻结测试、失败分类 说明能泛化到未见样本
第 7–8 周 主动假设修正与独立执行 等预算基线、原始实验记录 有可测增益或清晰负结果
第 9–10 周 干预预测与局部电路 随机方向、组合干预、任务保持 机制主张范围可界定
第 11–12 周 扩展第二模型或一个多模态接口 迁移、混淆控制、完整复现包 能说明泛化和失败边界

每个阶段都应允许“没有证据支持当前假设”成为正式产物。若第二阶段发现 SAE 重建严重损害目标行为,就应先修复或更换表示,而不是继续让 Agent 给失真的特征取名字。若主动循环没有比固定实验更好,下一阶段应研究失败原因,而不是无限增加步骤。

一个合格的最终研究包应包含:问题与适用范围、数据划分、模型与字典版本、干预定义、原始测量、解释与证据对应、成功与失败案例,以及能够重新计算主要结论的脚本。图表只展示经过这些记录支持的汇总。

14. 阅读路线与开放问题

建议先沿四条线阅读,每条线都同时配一篇局限或评测材料。

  1. 理解计算对象:Transformer Circuits Framework → IOI → Activation Patching 方法讨论。目标是看懂信息如何流动,以及实验究竟改变了什么。
  2. 理解表示分解:Toy Models of Superposition → SAE 基础与 scaling → SAEBench → SAE 非规范性。目标是理解字典的用处与边界。
  3. 理解自动化:Neuron Explainer → Delphi → MAIA → InterpAgent / HyVE → CHIVE。目标是分清命名、实验、验证和实际效用。
  4. 理解跨层与多模态:Transcoders → Sparse Feature Circuits → Circuit Tracing / CRM → VLM SAE / AudioSAE / TTS SAE。目标是把局部表示转为具体机制问题。

未来最值得持续追踪的开放问题包括:自动化能否发现人类没有预先命名的计算变量;不同字典间的机制是否有稳定等价关系;解释模型如何报告不可语言化的信息;局部电路能否组合为跨样本的算法;以及内部工具能否稳定改善模型调试、数据选择与训练决策。

本报告的研究立场是:让解释承担预测责任,让自动化承担验证责任。 机制可解释性的价值来自可积累、可反驳、可迁移的内部计算知识。自动化最有希望的作用,是降低获得这类知识的成本,并让错误解释更快暴露。

15. 参考文献与来源

检索截止为 2026 年 9 月 12 日。正文引用均指向原始论文、研究团队报告或官方代码;近期预印本按页面所示版本理解,未经复核的榜单宣传和二手综述不作为核心结论依据。下表的日期优先记录初版年份,必要时补正式发表或使用版本信息;网站与代码资源以检索时状态为准。

编号 作者或发布者 原始来源 日期、版本与用途
1 Elhage 等 / Anthropic A Mathematical Framework for Transformer Circuits 2021;QK、OV 与计算路径基础
2 Elhage 等 Toy Models of Superposition 2022;叠加的玩具模型证据
3 Wang 等 Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small 2022 初版;IOI 电路
4 Cunningham 等 Sparse Autoencoders Find Highly Interpretable Features in Language Models 2023;语言模型 SAE
5 Gao 等 / OpenAI Scaling and Evaluating Sparse Autoencoders 2024 初版、ICLR 2025;TopK 与规模化
6 Heimersheim、Nanda How to Use and Interpret Activation Patching 2024;干预语义与指标
7 Makelov 等 Is This the Subspace You Are Looking For? An Interpretability Illusion for Subspace Activation Patching 2023 初版、ICLR 2024;子空间修补争议
8 Wu 等 A Reply to Makelov et al. (2023)'s “Interpretability Illusion” Arguments 2024;对应反驳与协议讨论
9 Dunefsky、Chlenski、Nanda Transcoders Find Interpretable LLM Feature Circuits 2024、NeurIPS 2024;稀疏模块替代
10 Anthropic Interpretability Team Sparse Crosscoders for Cross-Layer Features and Model Diffing 2024;跨层与跨模型表示
11 Marks 等 Sparse Feature Circuits: Discovering and Editing Interpretable Causal Graphs in Language Models 2024 初版、ICLR 2025;特征电路
12 Kharlapenko 等 Scaling Sparse Feature Circuit Finding for In-context Learning 2025;任务识别与执行特征
13 Ameisen 等 / Anthropic Circuit Tracing: Revealing Computational Graphs in Language Models 2025-03-27;替代模型与局部归因图
14 Shu 等 / OpenMOSS Bridging the Attention Gap: Complete Replacement Models for Complete Circuit Tracing 2026 技术报告;注意力与 MLP 替代
15 Turner、Wu、Batson Characterizing Interference Weights in a Tiny Language Model 2026-08-21;权重幅度与功能区分
16 Bills 等 / OpenAI Language Models Can Explain Neurons in Language Models 2023;自动描述与激活模拟
17 Paulo、Mallen、Juang、Belrose Automatically Interpreting Millions of Features in Large Language Models ICML 2025;自动解释与评分
18 Conmy 等 Towards Automated Circuit Discovery for Mechanistic Interpretability 2023、NeurIPS 2023;ACDC
19 Hanna、Pezzelle、Belinkov Have Faith in Faithfulness: Going Beyond Circuit Overlap When Finding Model Mechanisms 2024 v2、COLM 2024;EAP-IG
20 Bhaskar、Wettig、Friedman、Chen Finding Transformer Circuits with Edge Pruning 2024、NeurIPS 2024;可学习边掩码
21 Hadad、Katz、Bassan Formal Mechanistic Interpretability: Automated Circuit Discovery with Provable Guarantees ICLR 2026;形式化保证及视觉模型实验
22 Rott Shaham 等 A Multimodal Automated Interpretability Agent 2024;MAIA
23 Marin-Llobet、Ferrando Automated Interpretability and Feature Discovery in Language Models with Agents 2026-05-02 v1 预印本;InterpAgent
24 Khan、Kohli、Yao、Sun、Yao Can Language Model Agents Be Helpful Circuit Explainers in Mechanistic Interpretability? 2026-06-23 v1 预印本;HyVE,图 2 数据来自表 2
25 Tan、He、Zhao、Liu SAEScientist-Bench: Can AI Agents Conduct Autonomous SAE Interpretability Research? 2026-09-08 v1 预印本;选择性与 steering
26 Karvonen、Chua 等 Activation Oracles: Training and Evaluating LLMs as General-Purpose Activation Explainers 2025-12-19;监督式激活问答
27 Fraser-Taliente、Kantamneni、Ong 等 Natural Language Autoencoders Produce Unsupervised Explanations of LLM Activations 2026-05-07;语言瓶颈与局限
28 Gao、Rajaram、Coxon 等 / OpenAI Weight-sparse Transformers Have Interpretable Circuits 2025;训练时结构约束
29 Karvonen、Ong、Kantamneni、Marks Would This Change Your Answer? Evaluating Explanations of LLM Behavior in the Wild with Counterfactual Experiments 2026-08-21;CHIVE 与工具增益负结果
30 Gupta、Arcuschin、Kwa、Garriga-Alonso InterpBench: Semi-Synthetic Transformers for Evaluating Mechanistic Interpretability Techniques 2024、NeurIPS 2024;已知电路参照
31 Karvonen 等 SAEBench: A Comprehensive Benchmark for Sparse Autoencoders in Language Model Interpretability 2025;多维 SAE 评价
32 Mueller 等 MIB: A Mechanistic Interpretability Benchmark ICML 2025;电路与因果变量定位
33 Leask 等 Sparse Autoencoders Do Not Find Canonical Units of Analysis 2025、ICLR 2025;字典非规范性
34 Méloux、Maniu、Portet、Peyrard Everything, Everywhere, All at Once: Is Mechanistic Interpretability Identifiable? 2025;非唯一性
35 Li、Srinivas、Bhalla、Lakkaraju Interpretability Illusions with Sparse Autoencoders: Evaluating Robustness of Concept Representations 2025;解释鲁棒性
36 Friedman、Lampinen、Dixon、Chen、Ghandeharioun Interpretability Illusions in the Generalization of Simplified Models 2023;简化表示泛化
37 Pach、Karthik、Bouniot、Belongie、Akata Sparse Autoencoders Learn Monosemantic Features in Vision-Language Models 2025 v3、NeurIPS 2025;VLM 特征与干预
38 Liao、Yang、Wei When Structured Sparse Autoencoders Learn Consistent Concepts Across Modalities 2026-07-09 预印本;空间结构先验
39 Aparin 等 AudioSAE: Towards Understanding of Audio-Processing Models with Sparse AutoEncoders EACL 2026;Whisper、HuBERT
40 Pluth、Houghton、Zhou、Gurbani Mechanistic Interpretability of ASR Models Using Sparse Autoencoders 2026-05-12 预印本;Whisper SAE
41 Wang 等 Towards Interpretable Framework for Neural Audio Codecs via Sparse Autoencoders: A Case Study on Accent Information 2026-03-18 预印本;codec 与口音
42 Koriagin、Aparin、Balagansky、Gavrilov Interpreting and Steering a Text-to-Speech Language Model with Sparse Autoencoders 2026-06-08 v1 预印本;模态感知 auto-interp
43 Swann、McGranahan、Buurmeijer、Kennedy、Schwager Sparse Autoencoders Reveal Interpretable and Steerable Features in VLA Models 2026-06-06 v2;动作与闭环控制
44 Chen、Luo、Pan Mechanistic Data Attribution: Tracing the Training Origins of Interpretable LLM Units 2026-06-07 v2;页面注明 ICML 2026 Oral
45 Seth、Gosalia、Kasliwal、Sankarapu CircuitKIT: Circuit Discovery, Evaluation, and Application Toolkit for Mechanistic Interpretability 2026-07-21 预印本;工作流基础设施
46 Google DeepMind Gemma Scope 官方资源页;Gemma Scope 与 Scope 2

代码资源的发布者、入口与用途另见第 11 节。图 1、图 3、图 4 为本文综合绘制的概念流程图,不包含测量数据;图 2 为已明确标注来源的数值重绘。