什么是上下文长度?
上下文长度(Context Length)是大语言模型能一次性处理的最大 token 数量限制。它决定了模型在一轮对话中能"看到"多少信息——包括用户的提示词、历史对话、上传的文档以及模型生成的回答。
上下文长度的核心影响
文档处理能力:上下文越长,模型能一次性处理的文档越大。Claude 的 200K 上下文可以一次处理《三体》三部曲。对话连续性:更长的上下文意味着模型能"记住"更早期的对话内容。任务复杂度:复杂任务需要更多的上下文来承载推理过程和信息。成本与速度:上下文越长,计算复杂度越高(O(n²)),推理速度越慢,成本越高。
主流模型的上下文长度
Claude 3.5 Sonnet:200K token。Gemini 1.5 Pro:1M token(约 75 万字)。GPT-4 Turbo:128K token。GPT-4o:128K token。通义千问:128K token。DeepSeek-V3:128K token。LLaMA 3:8K/128K token(不同版本)。
上下文长度的未来趋势
随着 KV 缓存优化(如 GQA、Flash Attention、PagedAttention)等技术的成熟,上下文长度正在快速扩展。Google Gemini 已实现 1M token 上下文,业界正朝着"无限上下文"的目标前进。