愚公移山

走进AI的语言世界:什么是Token

Token是连接人类语言与机器向量的桥梁

返回文章列表

什么是Token(词元)

你有没有想过,为什么 AI 能够理解文字?其实,AI 并不像我们一样直接"阅读"汉字。这里的 Token 就是它处理文本的最小颗粒度,它就像是一座桥梁,一头连着人类的语言,另一头连着机器的数学计算。

例如下图:我们人类看到的可能是一个完整的句子,但在 AI 的眼中,这些文字被切分成了不同的 Token 序列。这种切分方式直接决定了 AI 学习和记忆的效果。

token-split


Token:文字的"乐高积木"

Token 是 AI 处理文本的基本单元。就像积木一样,复杂的句子被拆解开来,再通过不同的组合构建出意义。它通常包含三个层次:完整的单词单个字符,以及介于两者之间的”子词”。

那么你可能会想,既然有单词,为什么不直接按单词切分呢?其实,直接用单词会导致词表过于臃肿,而且遇到生僻字就没辙了。

token-block

分词方法 颗粒度 核心特点
Word-level 语义最强,词表过大
Char-level 无生僻字,缺乏语义
BPE(主流) 适中 兼顾效率与语义表达

我们可以看上面这张对比表,Word-level 也就是词级切分,虽然语义完整但词表太庞大;Character-level 字符级切分虽然灵活,但会让 AI 很难把握整体意义。所以,像 BPE(Byte Pair Encoding,字节对编码) 这样的子词切分技术才成为了现在的大主流。

最后,中英文在切分上也有很大差异。英文通常是子词的组合,而中文则是在“字”与“词”的边界上寻找切分的最优解。


Token ≠ 字符 ≠ 字节

不少人会误以为,Token 等于对话输入框里的字符总数,这个认知其实并不准确。

以「订单创建成功」六个汉字举例:文本共计 6 个字符,UTF-8 编码占用 18 字节,但经过模型分词器拆分后,对应的 Token 数量通常在 4~8 个区间(取决于模型分词器)。由此可见,字符数、字节数、Token 数量三者不存在固定的换算比例。各大模型厂商标注的上下文窗口(128K、1M 等规格),计量单位统一为 Token。

举个直观例子:1M 上下文窗口,代表模型单次最多可承载 1000000 个 Token。结合中文分词规律,单个汉字约折合 1~2 个 Token,换算后全文上限大致在 50 万~100 万汉字,体量足以完整收录约 73 万字的《红楼梦》全文。

在日常使用 Claude Code 时,占用上下文 Token 配额的内容并非仅单次提问,历史对话记录、系统提示词、内置技能、执行指令、引入代码文件、读取文档以及模型输出内容,全部会计入总 Token 消耗

想知道大概会消耗多少上下文窗口?直接用模型的Tokenizer 工具来计算最准确


为什么Token很重要(成本与记忆)

首先是计费基准。我们在使用各种 AI 模型的 API 接口时,提供商并不是按字数收费,而是按 Token 数量计费。就像交电费一样,Token 就是那个计费度量衡,用得越多,账单就越长。

其次是记忆上限,也就是我们常说的上下文窗口(Context Window)。AI 并不是能记住无限的内容,它的内存空间是由 Token 数量限制的。如果对话太长超过了上限,AI 就会开始遗忘前面的信息,也就是所谓的“断片儿”。

这里还涉及到一个性能平衡的问题。Token 处理得越多,模型推理的时间就越久,你会发现 AI 回复变慢了,而且成本也随之飙升。所以,在提问时精简文字,其实是在帮 AI 提速省钱。

token-cost-memory

所以它不仅关乎 AI 的“智力”,还直接关乎我们的钱袋子。


目前的AI主要处理离散符号,就像把文章拆成一个个Token,每个Token都有固定的编号(Token ID),现如今AI技术正以迅猛态势持续迭代演进,我相信未来的AI终将突破符号层面的限制,直接原生处理像素画面、音视频数据流,迈入真正意义上的原生多模态时代!

理解Token,才能更聪明、更省钱地使用AI