为什么一句话能烧掉你 3 块钱?你注册了一个国外 AI 的 API,上去试了几次。聊了没几轮,一看用量统计——几千个 Token 就没了。Token 到底是什么?为什么它才是 AI 世界真正的"钱"?
答案是:Token 是 AI 看到文字的方式——不是字,不是词,是它自己切出来的"碎片"。这个碎片怎么切,直接决定了 AI 怎么理解你、怎么收你费、能记住多少东西。
上一篇(part1-01)我们聊了大模型的本质——猜下一个字。但其实它猜的不是"字",而是 Token。搞懂 Token,你就能理解 AI 一大半让人困惑的行为。
AI 眼里看到的不是文字
我们人类看到一句话,比如"今天天气真好",看到的是 6 个汉字。
但 AI 不是这么看的。它在处理你的文字之前,会先用一个叫"分词器"(Tokenizer)的工具,把文字切成一块一块的小碎片——这些碎片就叫 Token。
Token 到底长什么样?来看几个真实的例子:
你看到的:今天天气真好
AI 看到的:[今] [天] [天气] [真] [好] ← 5 个 Token
注意——"今天"不是一个整体,被拆成了"今"和"天";但"天气"作为一个常见词组,保留在了一起。
再看英文的例子:
你看到的:strawberry
AI 看到的:[straw] [berry] ← 2 个 Token
10 个字母,变成了 2 个 Token。"straw" 和 "berry" 各自是一个常见的英文词根,AI 的分词器学会了这种切法。
为什么这么切?因为 AI 的 Tokenizer 内部有一个"词汇手册"——大概 5 万到 20 万个条目——是在海量文字上统计出来的。出现频率越高的字词,越优先占一个独立位置。手册里没有的,就继续往下拆。
来对比一下常见字和生僻字:
常见字:我 → [我] ← 1 个 Token(词汇手册里有位置)
生僻字:龘 → [ ] [ ] [ ] ← 多个 Token(词汇手册里没有,拆成底层片段)
"龘"(三个龙,读 dá)在现代汉语里几乎用不到。Tokenizer 在训练时没见过它几次,它就很难作为一个完整条目进入词汇手册。那怎么办?往下拆——拆成更底层的字节或片段。一个生僻字,最后可能会变成多个 Token。
这就引出了一个关键结论:Token 不等于"字",也不等于"词"。 不同模型的分词器不一样,但大体规律是:高频内容更容易被合并成较少 Token,冷门字符、专业术语、特殊符号更容易被拆碎。
英文同理——短单词 "the""is""good" 是 1 个 Token,长单词 "unbelievable" 被切成 "un"+"believe"+"able" 三个 Token,因为 "believe" 在词汇手册里而 "unbelievable" 整体不够高频。
连标点和空格都占 Token。你写的每一个字符,AI 都在"消费"。
为什么 AI 数不清字母
知道了 Token 长什么样,你就能理解那个经典问题了——为什么 AI 数不清 "strawberry" 里有几个 r?
因为 AI 并不是先看到 s-t-r-a-w-b-e-r-r-y 这 10 个独立字母,再像人一样数一遍。它更自然看到的是 "straw" 和 "berry" 两个 Token。字母级别的信息没有作为最自然的基本单位暴露给模型。它可以间接推回来,但不像人类那样一眼看到每个字母。
这就好比你把一篇文章翻译成了摩尔斯电码,然后问别人"原文第 3 段有几个逗号"——他得先把电码还原回来才行,但他的"大脑"一直在电码层面工作,根本没有"逗号"这个概念。
同样的道理也解释了为什么 AI 写诗经常字数不对。你说"写一首五言绝句",它觉得自己在认真控制字数,但它控制的是 Token 数——而 Token 和你理解的"字"之间,并不是一对一的关系。
Token 就是 AI 的"钱"
现在说最实际的问题——钱。
用过 ChatGPT Plus 或者调过 API 的人,应该都在账单上见过"Token"这个词。AI 的定价,基本上就是按 Token 算的:你输入的文字消耗 Token,AI 回复的文字也消耗 Token。
来感受一下实际的价格(截至 2026 年 4 月):
GPT-5.5(OpenAI 旗舰):每 100 万输入 Token 约 5 美元,每 100 万输出 Token 约 30 美元。
Claude Sonnet 4.6:每 100 万输入 Token 3 美元,每 100 万输出 Token 15 美元。
DeepSeek-V4-Flash:每 100 万输入 Token 0.14 美元,每 100 万输出 Token 0.28 美元。
从 GPT-5.5 的 30 美元到 DeepSeek 的 0.28 美元,输出 Token 的价格差了一百倍。
等一下——你有没有注意到,输入 Token 和输出 Token 的价格不一样? 输出普遍比输入贵 2 到 6 倍?
原因出在 AI 的工作方式上。
输入 Token(你发给 AI 的文字): AI 一次性读进去,所有 Token 并行处理——就像你同时摊开 10 张纸,一眼扫过去。这个过程计算量相对小。
输出 Token(AI 回复你的文字): AI 是一个一个 Token 往外"蹦"的。它先生成第 1 个 Token,然后看着第 1 个 Token 生成第 2 个,再看着前两个生成第 3 个……如果 AI 回复 100 个 Token,就需要按顺序走 100 步。虽然系统会缓存前面的计算结果,但每一步仍然要基于前文继续推断,所以生成天然比一次性读取更贵。
所以输出 Token 贵,不是商家乱定价——生成比阅读贵,一个要"想",一个只需要"看"。
知道了这个,你的行为自然会变:把 Prompt 写精练,不光是为了让 AI 回答得更好——也是在省钱。你少说一句废话,省的是输入钱;你让 AI 别啰嗦、精简回复,省的是输出钱。
Token 还决定了 AI 的"记性"
Token 不光跟钱有关,还跟 AI 能记住多少东西有关。
每个大模型都有一个"上下文窗口"——就是它一次对话中能处理的 Token 总量上限。你的每一句话、AI 的每一句回复,全都在消耗这个额度。窗口满了,最早的对话就会被丢弃——AI 就"忘"了。
这就是为什么很多人在长对话中发现 AI 答非所问:不是 AI 在敷衍你,是它真的"看不到"你最早说的那些话了。每一轮对话都在往桌上堆文件,桌子就那么大,新文件放上来,旧文件就得掉下去。
这个上下文窗口具体有多大、为什么有的模型能读整本书、有的聊几轮就"失忆"——下一篇我们专门展开来讲。
搞懂 Token 之后,你的行为会自然改变
你会写更精练的 Prompt。 每一个多余的字都在消耗 Token——不光费钱,还在挤占 AI 的"记忆空间"。你会学着把真正重要的信息说清楚,把废话删掉。
你会理解 AI 的"抽风"行为。 数不对字母、写诗字数不对、长对话后期答非所问——这些不是 AI 在使坏,而是 Token 这一层机制带来的限制。知道了原因,你就不会把时间浪费在跟 AI "较真"上。
你会更懂比价和选型。 不同模型的 Token 单价差 10 倍很正常。同样一句中文,不同模型分出来的 Token 数也不一样。当你帮公司选 AI 产品或者自己调 API 时,Token 就是你必须算清楚的一笔账——输入多少、输出多少、单价多少,三笔算完才知道真实成本。
一句话总结
Token 是 AI 看待文字的最小单位——不是字,不是词,是它自己统计出来的碎片。Token 决定了 AI 怎么"看"世界、怎么计费、能记住多少。懂了 Token,你就懂了 AI 的半个底层逻辑。
下一篇我们来聊上下文窗口——AI 的"短期记忆"到底有多短。刚才说的"桌子放不下文件"、"聊着聊着就忘了",全都跟上下文窗口有关。搞懂了它,你就知道为什么有些 AI 能上传整本书,有些只能聊几轮就"失忆"了。
