什么是推测解码?
推测解码(Speculative Decoding)是一种无损的大模型推理加速技术。它的核心思想是"用便宜的小模型做草稿,用昂贵的大模型做审核"——先用一个小而快的草稿模型(Draft Model)生成一系列的候选 token,然后让目标大模型对这些 token 进行并行验证,一次性接受或修正多个 token。
为什么推测解码有效?
大模型推理的瓶颈在于自回归生成——每次只能生成一个 token,且每个 token 都需要一次完整的前向传播。推测解码通过并行验证打破了这种串行限制。小模型生成候选序列的成本很低,大模型一次验证可以处理多个 token,如果验证通过率高(小模型的预测与大模型一致),整体推理速度就能大幅提升。
应用场景
推测解码特别适合推理延迟敏感的应用,如实时对话、AI 客服、代码补全等场景。在理想条件下(草稿模型质量高),推测解码可以将推理速度提升 2-3 倍,且精度零损失。