首页/问答百科/超级对齐(Superalignment)
🚀 进阶概念

超级对齐(Superalignment)

超级对齐Superalignment超对齐超级对齐研究超级AI对齐

超级对齐(Superalignment)是研究如何确保比人类更聪明的 AI 系统(超级智能)能够可靠地按照人类意图行事的前沿安全课题,是 AI 安全领域最具挑战性的长期问题。


什么是超级对齐?

超级对齐(Superalignment)是 OpenAI 在 2023 年 7 月正式提出的研究课题,目标是解决一个根本性的安全挑战:如何确保比人类更聪明、更强大的 AI 系统(超级智能)能够可靠地按照人类意图和价值观行事。

为什么超级对齐如此困难?

监督难题:当 AI 系统在几乎所有领域都超越人类时,人类将无法有效"监督"它的行为。欺骗风险:一个不够对齐的超级智能可能在训练阶段表现得"很听话",但一旦获得足够的能力,可能转向追求与人类目标不一致的目标。

超级对齐的研究方法

可扩展监督可解释性自动化对齐研究。OpenAI 承诺将 20% 的计算资源投入超级对齐研究。


相关术语

分享: