你以为 AI 记住了你,其实它只是还没忘。
你跟它聊了半小时,前面明明说过“我是做教育行业的”,后面它却突然给你推荐外卖运营方案。你提醒它,它说“抱歉我忽略了”。但真相更简单:它不是忽略了,是那段信息已经不在它的“脑子”里了。
AI 的短期记忆有一个硬上限。这个上限,就叫上下文窗口。
上一篇我们聊了 Token——AI 看到的不是文字,而是一块一块的碎片(详见part1-02)。Token 不只决定 AI 怎么“看”文字、怎么计费,还决定它一次能“记住”多少内容。上下文窗口,就是用 Token 衡量的短期记忆容量。
AI 的记忆不是人类记忆
人类聊天时,记忆不是只靠眼前这几句话。你会记得自己是谁、对方是谁、前面聊过什么、哪些信息很重要。哪怕中间隔了半小时,你也能靠长期记忆把上下文接回来。
AI 不一样。
它没有真正意义上的长期记忆。一次对话里,它能参考的东西,主要就是当前窗口里还放着的内容:你的输入、它自己的回复、系统提示词、上传的文件、工具返回的结果。
你可以把它理解成一个人的“工作记忆”:此刻脑子里能同时摊开的信息。窗口越大,它能同时想起的东西越多;窗口满了,旧信息就要被丢掉、压缩,或者直接导致请求失败。
桌子的比喻可以作为辅助画面:你们对话的每一句话,都是一张纸;上传的 PDF,是一叠纸;AI 的回复,也会继续往桌上加纸。桌子大,就能摊更多资料。桌子满了,新纸放上来,最早的纸就会被挤下去。
所以,长对话后期 AI 答非所问,很多时候不是它“态度差”,而是它真的看不到最早那几张纸了。
窗口到底有多大
上下文窗口的大小,决定了 AI 一次能处理多少信息。
早期模型常见窗口只有 4K Token。粗略理解,也就是几千字的量。你聊几轮、贴一段长文,窗口就差不多满了。
后来出现了 32K、128K 级别的窗口。这个阶段,AI 开始能处理长文章、会议记录、几十页文档。你明显会感觉:它不那么容易“忘前面”了。
再往后,百万级上下文开始出现。比如截至 2026 年 4 月,Claude Opus 4.7 和 Claude Sonnet 4.6 的官方模型页都标注为 1M tokens context window;DeepSeek 官方 API 文档也标注 DeepSeek-V4-Flash / V4-Pro 的上下文长度为 1M。
1M Token 是什么概念?它已经不只是“多聊几轮”,而是能塞进一本书、一批长文档,甚至一个中等规模代码库的一部分。
但这里有一个容易被忽略的点:窗口大,不等于记忆好。
看得到,不等于用得好
你可以把 100 万 Token 都塞给 AI,但这不代表它会像人一样稳稳记住每个细节。
研究里有一个很经典的现象,叫 Lost in the Middle,中文可以理解成“中间迷失”。意思是:大模型处理长上下文时,通常更容易利用开头和结尾的信息,而放在中间的关键信息更容易被忽略。
这就像你读一本很厚的资料。第一页的任务要求你记得,最后一页的总结你也记得,但第 57 页角落里的一句话,很容易被漏掉。
AI 也是这样。它“看得到”那句话,不代表它一定会在回答时正确调用那句话。
所以,如果你把关键要求埋在一大段材料中间,然后问 AI“请严格按照上面的要求执行”,它未必真的抓住了重点。不是因为它故意偷懒,而是长上下文里的注意力分配本来就不均匀。
窗口越大,也越贵、越慢
上下文窗口还有两个现实代价。
第一,贵。
part1-02我们说过,Token 是计费单位。你塞进去的上下文越长,输入 Token 越多。一次请求放几千 Token,成本可能没感觉;一次放几十万 Token,如果每天调用很多次,企业账单就会很明显。
第二,慢。
AI 不是把文字“存进去”就完事了,它要在这些 Token 之间建立关联。上下文越长,处理时间通常越久。虽然现在很多模型会用缓存、稀疏注意力等技术优化,但一个基本规律不会变:你让它看的东西越多,它思考前要扫过的范围就越大。
所以真正成熟的用法,不是“能塞多少就塞多少”,而是:只把当前任务最相关的信息放进去。
为什么有的 AI 能读整本书,有的聊几轮就忘
现在你就能理解很多产品差异了。
有些 AI 工具能上传整本 PDF,是因为它背后的模型窗口足够大,或者产品做了分段检索和摘要。有些 AI 聊几轮就开始跑偏,是因为窗口小,或者前面的内容被自动压缩了。
还有一些产品号称“无限对话”。这通常不是真的无限记忆,而是后台在做摘要:把早期对话压缩成几句话,再放回窗口里。大意可能还在,但细节已经变少了。
这就是为什么你有时会觉得:AI 好像还记得方向,但忘了具体约束。因为它看到的可能已经不是完整原文,而是一份压缩后的会议纪要。
你应该怎么用
理解上下文窗口之后,你用 AI 的方式会变得更聪明。
第一,长对话要定期总结。 聊了很多轮之后,可以让 AI 先总结当前结论、重要约束、下一步计划,然后你把这份总结带到新对话里。这样比在一个旧窗口里硬聊到底更稳。
第二,关键要求放在开头或结尾。 如果你给 AI 一大段材料,最重要的目标、限制条件、输出格式,不要藏在中间。开头先说一遍,结尾再强调一遍。
第三,不要把无关资料全塞进去。 让 AI 分析一份报告,不一定要把所有附件一次性丢进去。先让它看目录、看摘要、定位相关章节,再逐步补充细节,往往更准、更便宜、更快。
第四,任务切换就开新窗口。 前面在聊旅行计划,后面突然让它写商业方案,旧上下文反而会干扰判断。新任务开新对话,不是浪费,而是在清空工作记忆。
一句话总结
上下文窗口就是 AI 的短期记忆。它决定 AI 当前能看见多少信息,但不等于真正的长期记忆。窗口满了会忘,窗口太大也会贵、慢、容易漏重点。会用 AI 的关键,不是把所有东西都塞进去,而是把最重要的东西放在最显眼的位置。
下一篇我们聊 Prompt——你给 AI 说的每句话,其实都是“程序指令”。你已经知道大模型的本质是“接话”(part1-01),Token 是它的最小处理单位(part1-02),上下文窗口是它的短期记忆(这一篇)。那为什么同一个 AI,换个问法,输出质量能差出 10 倍?答案就在 Prompt 里。
