什么是提示词压缩?
提示词压缩(Prompt Compression)是一种在保持核心语义的前提下,减少提示词 token 数量的技术。大模型 API 按 token 计费,更长的提示词意味着更高的成本和更长的处理时间(以及可能突破上下文窗口限制)。提示词压缩通过去除冗余信息、精简表达方式、甚至使用特殊编码来让提示词"变短"。
提示词压缩的方法
词汇级压缩:移除停用词、冗余修饰词和非必要限定词。例如"请帮我分析一下这个问题的答案"→"分析该问题答案"。
语义级压缩:用更短的方式表达相同的意思。例如"请用通俗易懂的语言解释一下什么是 Transformer 模型"→"通俗解释 Transformer"。
结构化压缩:将自然语言描述转换为结构化模板填写的形式,去除固定词组。
AI 辅助压缩:使用专门的小型模型(如 LLMLingua)来压缩提示词,在不损失关键信息的前提下减少 50-80% 的 token 数。
提示词压缩 vs 提示词优化
提示词优化的目标是"让提示词更好用"(提升输出质量),提示词压缩的目标是"让提示词更短"(降低成本和延迟)。两者有时是矛盾的——更详细的提示词通常效果更好,但成本更高。实际应用中需要在效果、成本和延迟之间取得平衡。
常见的压缩场景
频繁调用的重复性提示词(如客服系统的提示词)、需要放入少量示例(Few-shot)的长提示词、RAG 系统中的上下文压缩(减少检索结果的 token 消耗)、对延迟敏感的应用(如实时对话)。