什么是稀疏自编码器?
稀疏自编码器(Sparse Autoencoder, SAE)是一种神经网络结构,用于从数据中发现稀疏的、可解释的潜在特征。在大模型可解释性领域,SAE 被用来"反编译"模型内部的神经网络激活——将模型在某一层的高维激活向量分解为少量的、有明确语义含义的"特征"。
SAE 的工作原理
SAE 将模型某一层的神经激活作为输入,经过一个编码器(将高维激活压缩到稀疏的潜在特征空间),然后通过一个解码器重建原始激活。训练目标是让重建的激活尽可能接近原始激活,同时编码器输出的特征向量保持高度的稀疏性(大部分特征为 0,只有少数特征非零)。
SAE 在大模型可解释性中的应用
Anthropic 在 2023-2024 年使用 SAE 成功从 Claude 模型中提取了数百万个可解释的特征——如"旧金山的金门大桥""法律文本中的'therefore'""JavaScript 代码中的 for 循环"等。这些特征不是人为标注的,而是 SAE 自动从模型内部发现的。
SAE 的意义
SAE 是目前少数能够"打开 AI 黑箱"的工具之一。通过 SAE 提取的特征,研究人员可以理解模型在生成回答时内部"想"了什么,从而更好地诊断模型的错误、偏见和安全漏洞。SAE 被认为是实现 AI 对齐的关键技术路径之一。