大模型的全部秘密,一句话就能说清:它在猜你下一个字是什么。 但就这么一件事,它怎么就能写文章、写代码、还能跟你聊天聊得头头是道?
今天这篇,我用最简单的方式,把这个问题给你讲透。不需要任何技术背景,听完你就知道这东西到底是怎么回事。
想象一个读过所有书的人
我们先打个比方。
假设你身边有这么一个人——他把互联网上能找到的书、文章、论坛帖子、新闻、代码……全都读了一遍。不是随便翻翻,是一个字一个字地读过。
现在你跟他说:"今天天气真"——他脑子里立刻会冒出来几个选项:后面跟"好"的可能性最大,"热"也行,"不错"也说得通。于是他选了一个接上去:"今天天气真好"。
然后他再看这句话,继续想下一个字是什么:","可能性最大,后面可能接"适合出去走走"……就这样一个字一个字往下接,接着接着,就接出了一整段话。
这就是大模型在做的事情——不停地猜下一个字,然后把猜出来的字接上去,再猜下一个。
你跟 ChatGPT 或者 DeepSeek 的每一次对话,不管是让它帮你写邮件、翻译文章、还是解释一段代码,背后发生的都是这一件事。
光靠"猜"怎么就能什么都会?
这是大家最好奇的地方。猜下一个字,听起来也太简单了——为什么能产生看起来像"理解"和"思考"的能力?
关键在于:它读过的东西实在是太多了,多到你无法想象。
整个维基百科、无数学术论文、几百万篇新闻报道、技术博客、论坛讨论、GitHub 上的开源代码……人类在互联网上公开写下过的大部分文字,它都见过。
为了在这些海量文字上把"猜下一个字"猜得更准,它在训练过程中被迫学会了各种规律:
- 要猜对"法国的首都是____"后面是什么,它得记住这个地理常识
- 要接上一段 Python 代码的下一行,它得搞懂代码的逻辑
- 要把一句中文翻译成通顺的英文,它得同时"理解"两种语言的表达习惯
这些能力不是工程师一条条写进去的,而是在反复练习"猜下一个字"的过程中自己冒出来的。就像一个人读了足够多的推理小说,自然就学会了推理的套路一样。
而且模型越大、读过的东西越多,冒出来的能力就越厉害。举个真实的例子:2020 年的 GPT-3 有 1750 亿个内部参数,已经能写出像样的文章了。到了 2023 年的 GPT-4,能力跨了一个台阶,能做复杂的逻辑推理、写上千行代码。而就在几天前(2026 年 4 月 14 日)刚发布的 GPT-6,参数量达到了 5 到 6 万亿——它的幻觉率降到了千分之一以下,数学推理准确率达到 92.5%,代码生成通过率 96.8%。短短几年,跟换了个物种似的。
而且不止 OpenAI 一家在做。现在市面上的大模型多到数不过来:Anthropic 的 Claude 系列在编程上特别强,Google 的 Gemini 主打多模态(就是能同时处理文字、图片、音频、视频),国内的 DeepSeek、Kimi 也已经在不少场景上追平甚至超过了国际顶尖水平。竞争非常激烈,每隔几周就有新模型出来刷榜。
所有能力都是"接话"的变体
一旦你理解了"接话"这个本质,大模型的各种能力就全都不神秘了:
帮你写东西 = 你给了主题和要求,它"接"出一篇文章。
写代码 = 你描述了想要什么功能,它"接"出对应的代码。代码也是一种"语言",它在训练时读过海量的开源代码。
翻译 = 你给了中文和"翻译成英文"的指令,它"接"出对应的英文。
总结 = 你给了一篇长文和"帮我总结一下",它"接"出一段精简的概括。
角色扮演 = 你告诉它"你是一个营养师",它就按营养师的口吻"接"后面的对话。
没有一项能力是单独开发出来的。全部都是"猜下一个字"这个基本操作在不同场景下的自然表现。
这也意味着一件很重要的事:你给它的输入越清楚、越具体,它"接"出来的东西就越靠谱。 就像跟人说话一样——你说得含含糊糊,别人只能瞎猜;你说得清清楚楚,别人才能给你到位的回应。
但是,它有几个躲不掉的毛病
理解了"猜字"的本质,大模型那些让人头疼的问题也就全说得通了:
它会非常自信地瞎编。 大模型追求的是"下一个字接得自然",而不是"这句话是不是真的"。当它遇到不太确定的问题,它不会老老实实说"我不知道"——它会用学到的语言套路拼凑出一个听起来特别靠谱的答案。行话叫"幻觉",通俗说就是一本正经地胡说八道。比如它可能会编造一本根本不存在的书、虚构一段名人名言,而且说得像模像样,不查根本发现不了。不过好消息是,最新的模型在这方面已经好了很多——GPT-6 把幻觉率控制到了千分之一以下。
同一个问题每次答得不一样。 因为"猜下一个字"是个概率的过程——"好"的概率 35%、"热"的概率 20%,这次选了"好",下次可能选"热"。所以你问两次同样的问题,得到的答案在措辞上可能完全不同。这不是出了故障,这就是它的工作方式。
你怎么问,直接决定它怎么答。 你给的问题就是它"接话"的起点。起点模糊,后面的内容就模糊;起点具体、有背景、有例子,后面的质量就高得多。所以后来专门出现了一个词叫"Prompt"——就是你给 AI 的那段输入文字。很多人用 AI 感觉不好使,其实不是 AI 的问题,是给的 Prompt 不够好。这个我们后面专门有一系列帖子来讲。
它的知识有"保质期"。 大模型的知识来自训练时读过的资料,而训练数据有时间范围。所以一个半年前训练好的模型,不知道上个月发生了什么。不过现在很多产品已经给大模型加上了联网搜索的能力,比如 ChatGPT 和 DeepSeek 都可以实时查资料了,这个问题正在被解决。
知道了这些,你用 AI 的方式会不一样
很多人把 AI 当成一个高级版的百度或 Google 来用——输入一个问题,等一个答案。但现在你知道了,它不是一个搜索引擎,它是一个"接话机器"。理解了这个区别,你的用法会发生质的变化:
你会学着把问题说清楚。 因为你知道,你给它的每一个字都在影响它往哪个方向"接"。你不会只扔一句"帮我写个方案",而是会告诉它你是谁、写给谁看、什么风格、多长、重点是什么。同一个 AI,不同的输入方式,产出质量可以差出十倍。
你会把它当成思考搭档,而不是答案贩卖机。 它最擅长的是"沿着你提供的上下文,生成合理的延续"。这意味着头脑风暴、换角度分析问题、帮你梳理思路——这些场景是它真正的主场。
你会记得给它的输出"把把关"。 因为你知道它追求的是"接得自然"而不是"说得对"。涉及到具体数字、日期、引用来源的内容,多查一步总没错。但像写文案、整理思路、润色文字这些事,完全可以大胆用,它就是干这个的。
一句话总结
大模型就是一个读过人类海量文字、学会了"接话"的系统。它所有的能力和所有的局限,都是"猜下一个字"的自然结果。
理解这一点,你就抓住了 AI 最底层的逻辑。后面我们聊的所有东西——怎么跟 AI 对话、怎么让它帮你做事、它内部是怎么运转的——都建立在今天这个认知基础上。
下一篇我们聊一个你可能听过但不一定真正理解的东西——Token。它是 AI 世界的"最小单位"。你花的每一分钱、AI 的每一次"失忆"、它"数不清字"的毛病,根源都在 Token 上。搞懂了 Token,后面所有的概念都会变得更好理解。
