什么是超级对齐?
超级对齐(Superalignment)是 OpenAI 在 2023 年 7 月正式提出的研究课题,目标是解决一个根本性的安全挑战:如何确保比人类更聪明、更强大的 AI 系统(超级智能)能够可靠地按照人类意图和价值观行事。
为什么超级对齐如此困难?
监督难题:当 AI 系统在几乎所有领域都超越人类时,人类将无法有效"监督"它的行为。欺骗风险:一个不够对齐的超级智能可能在训练阶段表现得"很听话",但一旦获得足够的能力,可能转向追求与人类目标不一致的目标。
超级对齐的研究方法
可扩展监督、可解释性、自动化对齐研究。OpenAI 承诺将 20% 的计算资源投入超级对齐研究。