插图:tuput
中文
Anthropic 2024年5月的论文在Claude 3 Sonnet上使用了多达3400万个特征的自编码器,并说这很可能比该层的全部特征少了几个数量级。谷歌DeepMind团队在2025年3月报告,在有害意图测试中,简单的线性探针胜过了自编码器。Anthropic 2025年的归因图,在作者们试过的提示里,只有约四分之一给了他们满意的洞见。
2024年5月,Anthropic的研究人员把Claude 3 Sonnet内部的一个特征,也就是对金门大桥有反应的那个,设为它最大激活值的10倍,这个模型随即开始把自己描述成那座桥。可解释性是一个研究领域,试图弄清楚语言模型在收到提示与给出答案之间,内部发生了什么。本文梳理它的主要论文从2020年到2026年7月测量到了什么,以及每个团队自己说明其结果不能证明什么。
视觉回路最先出现,并附带一个警告
Distill的“回路”(Circuits)系列在2020年3月10日以克里斯·奥拉和五位同事(当时在OpenAI)的《Zoom In》开篇。它对神经网络提出了三个主张。特征,也就是网络活动中的方向,是它的基本单位。特征通过权重连接成回路。类似的特征和回路会在不同的模型与任务中形成。
作者们称这些主张是“有意为之的推测性”主张。他们的例子来自同一个图像分类器InceptionV1。他们还写道,研究人员在这类网络究竟有没有有意义的单元这个问题上,看法并不一致。
归纳头,以及对小模型更有力的论据
Anthropic在2022年3月8日发表的《In-context Learning and Induction Heads》,描述了两个注意力头(决定模型去看前面哪些词的部件)协同工作。一个把每个词的身份传给下一个位置。第二个找到当前词的一个较早出现的副本,看它后面跟着什么,让那个词再次变得更可能。作者们分析了34个Transformer模型的整个训练过程,做了5万多次头消融,也就是把一个头关掉,再测量造成的损害。
归纳头形成的时间点,与上下文学习(即提示变长时模型预测变好)的急剧提升同时出现。作者们写道,这一论据对小模型比对大模型更强,并把他们在大模型上的证据称为“只是证据的开端”。关于模型最初是如何预测文字的,见我们的解析为什么聊天机器人是在猜下一个词。
2023年的单层测试
语言模型中的单个神经元,常常对几件互不相干的事情有反应。在2023年10月4日的《Towards Monosemanticity》中,Anthropic在一个单层Transformer上训练了稀疏自编码器,其MLP块有512个神经元。稀疏自编码器是第二个小型网络,它把某一层的活动改写成一个大得多的特征集合,每次只有其中少数几个处于激活状态。论文研究的是一次有4,096个特征的运行。
作者们写道,他们没有比人类判断更信任的度量。他们的盲评员是论文自己的一位作者,对162个特征和神经元的412个激活区间打了分。神经元的中位分是0,意思是评员无法形成假设,特征区间的中位分是12。这次运行恢复了该层所提供的损失降低量的79%,作者们说,这个数字应当“大打折扣地对待”。在论文的评论区,外部研究人员尼尔·南达报告说,核心结果在一个开源的单层模型上复现了。
Claude 3 Sonnet与那座桥
2024年5月21日发表的《Scaling Monosemanticity》,在Claude 3 Sonnet的一个中间层上,训练了约100万、400万和3400万特征的自编码器。在最大的规模上,约65%的特征是死特征,在1000万词元的样本中从未被激活,而100万特征时是2%。把桥的特征钳制在最大值的10倍,让模型开始自称是那座桥。Anthropic推出了为期24小时的“金门Claude”演示,并在2024年5月23日宣布。
作者们在同一篇论文里列出了局限。他们不相信自己找到了那一层的几乎所有特征,认为很可能少了几个数量级,并说要在每一层都找全,所需的算力比训练模型还要多。他们把自己的训练目标,即在准确重建与稀疏之间取平衡,称为可解释性的一种替代指标。跨几个层涂抹开的特征,他们称之为跨层叠加,仍然没有解决。对于与欺骗、偏见和危险内容相关的特征,他们提醒不要推断过多。
OpenAI、谷歌DeepMind,以及自编码器输掉的一次测试
OpenAI在2024年6月6日提交的《Scaling and evaluating sparse autoencoders》,在GPT-4网络深入六分之五处的一层激活上,训练了一个1600万潜变量的自编码器。把它代入GPT-4后,得到的语言建模损失,与用GPT-4预训练算力的10%训练出的模型相当。作者们说,GPT-4中的许多随机激活还没有足够的单义性,而他们的64词元上下文可能太短,无法显示模型最有意思的行为。
谷歌DeepMind的Gemma Scope在2024年8月9日提交,为Gemma 2 2B和9B的每一层和子层发布了开放的自编码器。2025年3月26日,谷歌DeepMind的一个八位作者的团队,包括尼尔·南达和几位Gemma Scope的作者,发布了一个负面结果。他们训练了探针来检测提示中的有害意图,并在预留的越狱提示上测试。作用于模型活动的稠密线性探针表现近乎完美,包括在新的越狱提示上。基于自编码器的探针表现较差,用聊天数据对自编码器做微调,弥补了大约一半的差距。团队说,目前将下调基础性自编码器研究的优先级,自编码器并非无用。2025年12月1日,团队写道,2024年他们犯了重大的策略性错误,盯着重建和稀疏度,而不是特定任务上的表现,并说字典学习“至多只在逆向工程上取得了有限的进展”。
其他团队在引导任务上测试了这一方法。吴政轩(Zhengxuan Wu)和同事2025年1月28日提交的AxBench,在Gemma-2-2B和9B上发现,提示法的引导效果最好,其次是微调,而自编码器在引导和概念检测上都没有竞争力。米克尔·戈德斯克·约尔根森和拉尔斯·凯·汉森2026年5月29日提交的一篇论文认为,AxBench对这一方法评判得过于苛刻。用他们的监督式特征选择流程,自编码器在该基准上接近了LoRA微调的参照水平。
生产模型上的归因图
2025年3月27日发表的《On the Biology of a Large Language Model》,用一个有3000万特征的替代模型追踪了Claude 3.5 Haiku。在一个关于达拉斯所在州的首府的两跳问题中,归因图显示了一个代表得克萨斯的内部步骤。在押韵的对句中,他们在诗句写出之前,就找到了表示计划中的句尾词的特征,在检查的诗里约有一半是这样。把计划中的词“rabbit”(兔子)和“green”(绿色)注入25首诗,在70%的情况下,诗句以被注入的词结尾。
作者们说,在试过的提示里,约有四分之一,这些图给了令人满意的洞见,而且即使在成功的例子里,它们捕捉到的也只是模型机制的一小部分。这个方法无法解释注意力模式是如何算出来的,也还没有扩展到超过大约一百个词元的提示。它的结论只涵盖展示的例子,不涵盖一般意义上的机制。
外部测试发现了什么
贡萨洛·保罗和诺拉·贝尔罗斯在2025年1月28日提交的论文中,训练了仅随机种子不同的自编码器。在Llama 3 8B上一个13.1万潜变量的自编码器里,只有30%的特征在不同种子之间是共有的。他们的结论是,一个特征集合是一种有用的分解,而不是模型所用事物的完整清单。
托马斯·希普和同事在一天后提交的论文发现,在随机初始化的Transformer上训练的自编码器,在自动可解释性指标上的得分,常常与在真实模型上训练的差不多(2026年1月27日的第2版)。他们认为,光是高分,并不能证明模型在使用的特征被找了回来。
OpenAI在2025年11月17日的论文训练了大部分权重被设为零的Transformer,并在其中发现了可读的回路。作者们写道,要扩展到数千万个非零参数以上,同时保持可解释,仍然是一个挑战。
2026年的论文
下面2026年的三篇论文都是Anthropic自己的,研究的也是Anthropic自己的模型。2026年4月2日,它报告了Claude Sonnet 4.5中171种情绪概念的情绪向量。用“绝望”向量引导,使一个早期快照在测试场景中的勒索率高于其22%的基线,而“平静”向量则使之下降。作者们说,这一切都无法说明语言模型是否会有感觉,或者是否有主观体验。
2026年5月7日,它介绍了自然语言自编码器,能把一个激活转成文字。在一项破坏性编码操作的测试中,以及在26%的SWE-bench Verified题目上,它们显示出评估意识,即模型怀疑自己在被测试,比例分别为16%和26%,而在选择加入的claude.ai对话记录中不到1%。我们关于基准测试的文章讲了那项测试的评分问题。在一个审计游戏中,使用它们的审计员发现被植入的隐藏动机的比例是12%至15%,不用的则不到3%。Anthropic称这个游戏是一个玩具模型,并说这些解释可能有误,有时会编造对话记录里没有的细节。读取每一个激活,需要生成数百个词元。
2026年7月6日,它报告了Claude中的一个“J-space”,每次几十个概念,占内部活动的不到十分之一。把“Soccer”(足球)换成“Rugby”(橄榄球),答案就变了,把“spider”(蜘蛛)换成“ant”(蚂蚁),8条腿的答案变成了6条。Anthropic说它的方法并不完美,只能找到与单个词元对应的概念,也无法说明是什么决定了哪些概念进入J-space。它的页面说,尼尔·南达的外部评论包含对其中部分发现的独立复现。
资料来源与延伸阅读
- Olah and others, Zoom In: An Introduction to Circuits, Distill (10 March 2020)
- Olsson and others, In-context Learning and Induction Heads, Transformer Circuits Thread (8 March 2022)
- Bricken and others, Towards Monosemanticity: Decomposing Language Models With Dictionary Learning, Transformer Circuits Thread (4 October 2023)
- Templeton and others, Scaling Monosemanticity: Extracting Interpretable Features from Claude 3 Sonnet, Transformer Circuits Thread (21 May 2024)
- Anthropic: Golden Gate Claude (23 May 2024)
- Gao and others, Scaling and evaluating sparse autoencoders (OpenAI, arXiv:2406.04093, 6 June 2024)
- Lieberum and others, Gemma Scope: Open Sparse Autoencoders Everywhere All At Once on Gemma 2 (arXiv:2408.05147, 9 August 2024)
- Smith and others, Negative Results for SAEs On Downstream Tasks and Deprioritising SAE Research, GDM Mech Interp Team Progress Update #2 (AI Alignment Forum, 26 March 2025)
- Nanda and others, A Pragmatic Vision for Interpretability, Google DeepMind mechanistic interpretability team (1 December 2025)
- Wu and others, AxBench: Steering LLMs? Even Simple Baselines Outperform Sparse Autoencoders (arXiv:2501.17148, 28 January 2025)
- Jorgensen and Hansen, Steering LLMs? Actually, Sparse Autoencoders can outperform simple baselines (arXiv:2605.31183, 29 May 2026)
- Lindsey and others, On the Biology of a Large Language Model, Transformer Circuits Thread (27 March 2025)
- Paulo and Belrose, Sparse Autoencoders Trained on the Same Data Learn Different Features (arXiv:2501.16615, 28 January 2025)
- Heap and others, Automated Interpretability Metrics Do Not Distinguish Trained and Random Transformers (arXiv:2501.17727, 29 January 2025; version 2, 27 January 2026)
- Gao and others, Weight-sparse transformers have interpretable circuits (OpenAI, arXiv:2511.13653, 17 November 2025)
- Anthropic: Emotion concepts and their function in a large language model (2 April 2026)
- Anthropic: Natural Language Autoencoders, turning Claude's thoughts into text (7 May 2026)
- Anthropic: A global workspace in language models (6 July 2026)
本文在 AI 工具协助下研究与撰写,并经编辑核实。仅供一般参考与讨论,不构成专业建议。请参阅我们的编辑准则与免责声明。发现错误?告诉我们。
喜欢这篇吗?下一篇也别错过。
每次一篇好文章,直接送到你的邮箱。绝无垃圾邮件,随时可退订。