Token
Token 是大语言模型处理文本的最小单位,模型的上下文长度与 API 计费都以 token 计算。
Token 指模型对文本切分后的基本单元,可能是一个单词、一个词根或几个字符。中文通常一个字对应一到两个 token。上下文窗口大小、生成长度限制以及绝大多数模型 API 的计费方式,都以 token 数量为基准。
理解 token 是控制 API 成本的前提:输入与输出通常分别计价,长对话会把历史消息一并计入输入 token。
不同模型使用不同的分词器,因此同一段文本在不同模型上的 token 数并不相同。
三件事都以 token 为单位计算,读数据时要分清:计费按输入与输出分别计价;**上下文窗口**限制的是单次请求的总量;最大输出长度限制的是这一次能生成多少。
一个常见误解是「中文更费 token」——不同模型的切分方式不同,与其记住某个换算比例,不如用接口返回的用量字段实测。