首页/AI 百科词条/上下文长度(Context Length)
📖 基础概念

上下文长度(Context Length)

上下文长度Context Length最大上下文序列长度max_tokens最大token数

上下文长度(Context Length)是指大模型单次推理能处理的最大 token 数量,包括输入和输出。更长的上下文让模型能处理更大的文档、更长的对话和更复杂的任务,但也会增加计算成本和延迟。


什么是上下文长度?

上下文长度(Context Length)是大语言模型能一次性处理的最大 token 数量限制。它决定了模型在一轮对话中能"看到"多少信息——包括用户的提示词、历史对话、上传的文档以及模型生成的回答。

上下文长度的核心影响

文档处理能力:上下文越长,模型能一次性处理的文档越大。Claude 的 200K 上下文可以一次处理《三体》三部曲。对话连续性:更长的上下文意味着模型能"记住"更早期的对话内容。任务复杂度:复杂任务需要更多的上下文来承载推理过程和信息。成本与速度:上下文越长,计算复杂度越高(O(n²)),推理速度越慢,成本越高。

主流模型的上下文长度

Claude 3.5 Sonnet:200K token。Gemini 1.5 Pro:1M token(约 75 万字)。GPT-4 Turbo:128K token。GPT-4o:128K token。通义千问:128K token。DeepSeek-V3:128K token。LLaMA 3:8K/128K token(不同版本)。

上下文长度的未来趋势

随着 KV 缓存优化(如 GQA、Flash Attention、PagedAttention)等技术的成熟,上下文长度正在快速扩展。Google Gemini 已实现 1M token 上下文,业界正朝着"无限上下文"的目标前进。


相关术语

分享: