首页/AI 百科词条/激活引导(Activation Steering)
🚀 进阶概念

激活引导(Activation Steering)

激活引导Activation Steering表征工程表征操控特征编辑Representation Engineering

激活引导(Activation Steering)是一种通过干预模型内部神经元的激活值来改变模型行为的技术,可以在不微调模型的情况下控制模型的输出风格、去除偏见或增强特定能力。


什么是激活引导?

激活引导(Activation Steering)是一种新兴的 AI 模型控制技术。与微调(修改模型权重)不同,激活引导在推理时直接调整模型内部特定神经元或层的激活值,从而改变模型的输出行为。你可以把它想象成在 AI 的"大脑"中直接调节某些"思维开关"。

激活引导的工作原理

研究发现,大模型的内部神经元在表征某些概念时有明确的对应关系——某些神经元在模型读到"法律"相关文本时被激活,某些神经元在模型"感到不确定"时活跃。激活引导就是通过放大或抑制这些特定神经元的激活值,引导模型朝着期望的方向生成输出。

激活引导 vs 微调

微调在训练阶段修改模型的权重,是"永久性"的改变,需要训练数据和计算资源。激活引导在推理阶段调整激活值,是"临时性"的改变,不需要训练数据,可以在不同行为之间即时切换。

激活引导的应用

去偏见:在推理时抑制模型输出中包含种族或性别偏见的倾向。风格控制:引导模型以更正式或更口语化的风格输出。能力增强:增强模型的推理能力或创造性。安全控制:在推理时启用更强的安全约束。多行为切换:在同一模型上快速切换不同的行为模式。

与可解释性的关系

激活引导技术依赖于对模型内部表征的理解——你需要先知道哪些神经元对应什么概念,才能去调控它们。因此,激活引导与模型可解释性研究密切相关,是可解释性研究成果的直接应用。


相关术语

分享: