首页/问答百科/Token(词元)
📖 基础概念

Token(词元)

Token词元令牌token大模型token

Token(词元)是大模型处理文本的最小单位,可以是一个词、一个字符或一个子词。大模型按 token 计费和使用,理解 token 概念有助于估算成本、优化提示词长度和控制输出。


什么是 Token?

Token(词元)是大模型处理文本时的最小基本单位。模型不是按"字"或"词"来理解文本的,而是将文本切分成一个个 token 来处理。一个 token 可以是一个完整的词(如"apple"),也可以是词的一部分(如"un"、"believe"、"able"),具体取决于分词器的规则。

Token 的粗略估算

不同语言和不同分词器的 token 化规则不同。对于英文,大约 1 个 token ≈ 0.75 个词(100 个词 ≈ 75 个 token)。对于中文,大约 1 个 token ≈ 1.5-2 个汉字(100 个汉字 ≈ 50-70 个 token)。

为什么 Token 很重要?

计费单位:几乎所有大模型 API 都按 token 计费,输入和输出 token 分别计算。了解 token 可以帮助估算使用成本。

上下文窗口:模型的上下文窗口限制(如 128K)是以 token 为单位计算的。

优化提示词:精简提示词可以节省 token 消耗,降低成本。一个 2000 token 的提示词比 4000 token 的便宜一半。

输出控制:通过 max_tokens 参数控制模型输出的长度,避免生成过长的内容。

Token 在不同模型中的差异

不同模型使用不同的分词器(Tokenizer),同一个文本在不同模型中的 token 数可能不同。例如,GPT 系列使用 Byte-Pair Encoding,Claude 使用 SentencePiece,中文和英文的 token 效率在不同模型中差异明显。


相关术语

分享: