首页/AI 百科词条/推测解码(Speculative Decoding)
🔧 技术与方法

推测解码(Speculative Decoding)

推测解码推测性解码Speculative Decoding投机解码自回归加速

推测解码(Speculative Decoding)是一种加速大模型推理的技术,使用小型"草稿模型"快速生成候选 token 序列,再由大模型并行验证并修正,在保证输出质量不变的前提下将推理速度提升 2-3 倍。


什么是推测解码?

推测解码(Speculative Decoding)是一种无损的大模型推理加速技术。它的核心思想是"用便宜的小模型做草稿,用昂贵的大模型做审核"——先用一个小而快的草稿模型(Draft Model)生成一系列的候选 token,然后让目标大模型对这些 token 进行并行验证,一次性接受或修正多个 token。

为什么推测解码有效?

大模型推理的瓶颈在于自回归生成——每次只能生成一个 token,且每个 token 都需要一次完整的前向传播。推测解码通过并行验证打破了这种串行限制。小模型生成候选序列的成本很低,大模型一次验证可以处理多个 token,如果验证通过率高(小模型的预测与大模型一致),整体推理速度就能大幅提升。

应用场景

推测解码特别适合推理延迟敏感的应用,如实时对话、AI 客服、代码补全等场景。在理想条件下(草稿模型质量高),推测解码可以将推理速度提升 2-3 倍,且精度零损失。


相关术语

分享: