跳转至

第 1 章 大语言模型:它究竟是怎么运作的?

很多人第一次接触大语言模型(ChatGPT、Claude、DeepSeek 等)时,常常会产生一种强烈的神秘感:屏幕那头的 AI 仿佛真的能听懂人话,能帮你写文章、做翻译,甚至还能帮你解复杂的数学题和逻辑谜题。

它真的像人类一样拥有意识和思维吗?

要理解它的一切能力,以及它为什么偶尔会“发疯胡说”,甚至理解我们后续为什么需要 Agent,我们必须先打破对它的神秘滤镜,回到它最原始的物理本质。


1. 核心原理:一件简单到不可思议的事

尽管当今的大模型底层包含数百亿甚至数千亿参数,但它从头到尾做的事情,用一句话就能概括:

根据你给出的上一段话(上下文),预测下一个最可能出现的词(Token)。

它本质上不是在“理解你的心意,沉思片刻后给出智慧的回答”,而是在做一场概率填空游戏。

一个直观的例子

假设我们给模型输入半句话:

今天天气真____

模型看到这串文字后,会调动它在训练期间学到的全人类语言规律,给候选的下一个字排出一张概率表:

  • 好(概率约 75%)
  • 不错(概率约 14%)
  • 是(概率约 4%)
  • ……

它挑中了概率最高的“好”,把句子补成了“今天天气真正好”。接着,它把刚补出来的“好”追加到原句末尾,继续猜再下一个字。一个字接一个字,像滚雪球一样不断续写,最终汇成了你在屏幕上看到的整篇回答。

为什么同一句话问两次,答案会不一样?

既然是“概率表”,模型在生成文字时就不是机械固定的。虽然“好”的概率最高,但只要模型被允许保留一定的多样性,系统就可能像摇奖机一样抽中排在第二位的“不错”。

这就是为什么即使输入完全相同的提示,模型每次给出的回复都会有细微差别。你平时感觉模型“有时候聪明、有时候发挥失常”,最底层的根源就在这里。

小知识:Token 是什么?
计算机并不直接识别人类文字,而是把文本切分成被称为 Token 的小语言片段。在英文中,一个 Token 大约等于 3/4 个单词;在中文中,常用的词可能是一个 Token,而生僻字可能会被拆成两三个 Token。例如“今天天气真”这五个字,在模型眼里实际只有 3 个 Token。模型数不清某些单词里有几个特定字母,正是这种切分机制造成的。


2. 一个自然而然的疑问

了解了上面的原理,正常人都会产生一个巨大的疑问:

如果它仅仅是在猜下一个词,这不就是手机输入法的联想打字吗?这种机制怎么可能拥有推理能力?

输入法无论怎么联想,也绝对不可能帮你解开复杂的案件谜题或者写出严谨的学术论证。那么,大模型那种令人惊叹的“智力感”和“逻辑推理能力”,到底是从哪里冒出来的?

为了看清真相,我们来看一个侦探故事。


3. 一桩侦探小说:智力从何而来?

想象下面是一段短篇侦探小说的开头:

雨下了一整夜。凌晨三点,周老爷被发现死在反锁的书房里,后颈插着一支钢笔。死亡时间在凌晨两点到三点之间,那时候雨还没停。

庄园当晚只有四个人:发着高烧的周太太、侄子周明远、厨娘小雅,以及园丁老陈。

侦探在现场找到了三样关键物品:
1. 死者右手紧攥着的一小段红线——正是花房捆玫瑰用的红线;
2. 园丁老陈左手手套虎口处的裂口,裂口上挂着一模一样的红线头;
3. 老陈床边放着的一双胶靴。老陈声称自己整晚都在花房捆玫瑰枝,可昨夜大雨早已把去花房唯一的泥路变成了烂泥塘,他的靴底却干干净净,没有半点泥星。

侦探把手套和胶靴摆在桌上,目光扫过在场的四个人,缓缓开口道:“凶手就是____”

现在,故事在最关键的时刻戛然而止,我们让大模型来补全横线上的字。

第一次尝试:线索未点破时

在这个故事里,逻辑链其实已经闭环:老陈声称整晚在花房,但鞋底没泥证明他在撒谎;死者手里的红线与他手套的裂口吻合,说明案发时两人发生过拉扯。真凶显然是老陈。

但当模型直接面对这个空白时,它统计出的概率最高选项并不是“老陈”,而是:

  • “你”(概率超过 80%)
  • “老陈”(概率仅有 2% 左右)

为什么会这样?因为在模型读过的海量网络小说和悬疑故事中,侦探在宣布真相的最高潮,最经典、最戏剧化的台词永远是“凶手就是你!”。在没有进一步提示的情况下,语料库里的文体套路彻底压过了逻辑分析。

第二次尝试:当我们在上下文里把逻辑写透

接着,我们在故事结尾加上侦探的排除推理:

“……周太太整夜高烧在床,有医生证明;侄子有长途通话记录;厨娘一直在隔壁熟睡。全庄园只有一个人在撒谎——那就是声称整晚在花房、靴底却一尘不染的老陈。侦探盯着老陈,一字一句地说:‘凶手就是____’”

这时候,同样的空白处,概率分布瞬间发生了颠覆:

  • “老陈”(概率直接飙升到 84% 以上)
  • “你”(概率骤降至 9%)

结论:为了把词猜准,模型“被迫”学会了推理

这个对比揭示了大模型智力来源的核心秘密:

  1. 推理能力是猜词任务的副产品:人类语言中充斥着严密的逻辑与因果关系。模型在海量数据中训练时,要想把下一个词预测得足够准确,就必须学会理解前文的因果链条、代词指代和事实矛盾。它不是先拥有了人类理性才来回答问题,而是在数万亿次“强行猜词”的过程中,把逻辑推理作为一种最有效的预测规律刻进了网络参数里。
  2. 上下文的浓度决定了智力的上限:当上下文中的逻辑证据足够充分清晰时,概率的天平就会被狠狠压向真理;而当上下文模糊、线索不足时,模型就会被通俗套路和统计直觉带偏。
  3. “幻觉”与胡说八道的本质:如果强行让一个未经过深度思考的模型自由作答,它甚至会一边承认“老陈没有去花房”,一边突然转折写出“但真凶是侄子周明远,因为钢笔才是关键”。在它眼里,跌宕起伏的反转剧情和实事求是的证据链,本质上都只是“接下来读起来挺顺畅的字”。

4. 模型并不完美:厂商拿出的两剂解药

既然纯粹依靠单步预测下一个词容易被套路带偏、容易缺乏耐心,AI 研发者们是如何解决这个问题的?

行业内主要给出了两种解决方案:

解药一:把模型的大脑做大(增加参数量)

最直接的办法就是堆算力、增参数。从几十亿参数的小模型,做到数千亿甚至万亿参数的大模型。

更大的模型见过的规律更多,对复杂语境的捕捉能力更强,更不容易被简单的表面文字带跑。但这条路的代价是极为高昂的:模型体积越大,运行所需的芯片显存就越大,响应速度越慢,调用成本也呈指数级上升。

解药二:给模型一张草稿纸(思维链与深度思考)

另一种更具突破性的思路,是改变模型的作答方式——这就是近两年大火的“深度思考”(Reasoning / CoT)模式。

普通对话时,模型就像一个急性子学生,老师刚念完题,他就必须立刻张嘴吐出第一个字,因此极易凭直觉脱口而出错误答案。

而开启“深度思考”后,系统强制模型在给出最终答复前,先在后台进行一段长篇幅的自我推演(思维链)。

在上面那个未点破真相的侦探故事中: - 不开启思考:模型一口咬定凶手是侄子,胡编乱造反转剧情; - 开启思考后:模型在后台写下了上万字的分析草稿。你能看到它像真人侦探一样,反复审视每条证物,经历“老陈的靴子为什么是干净的?”→“难道他在撒谎?”→“线索会不会太刻意了,难道是陷阱?”→“不对,死者手里的红线无法伪造”等一系列自我怀疑与推导,最终在正文里准确得出结论:凶手就是园丁老陈。

思考的本质到底是什么?
千万不要以为模型在思考时突然觉醒了灵魂。它的底层机制依然是预测下一个词!
区别仅在于:它把原本脑子里的推导步骤,变成文字写在了草稿纸上。而它刚刚写下的推导文字,立刻成为了新的上下文;它看着自己前面写出的严密分析,再顺理成章地预测出最终结论。
所谓的思考,就是让“预测下一个词”这个简单轮子,多滚了上万步。


5. 尾声与悬念:从“会说话的大脑”到“能干活的双手”

学到这里,我们已经建立起了关于大语言模型最坚固的认知底座:

  1. 它的本质是一个基于上下文预测下一个词的超级概率机;
  2. 它的“智力”来自于在全人类语言规律中掌握的深层逻辑连接;
  3. 它可以通过“思考机制”,利用草稿纸逐步推导复杂问题。

但请大家退后一步,冷静地看一看我们现在的成果:

无论这个模型多么博学,论证多么雄辩,逻辑推导多么精妙,它做完这一切后,输出给你的自始至终只有一串屏幕上的文字。

它无法替你打开电脑上的 Excel 整理表格;它无法替你登录教务系统自动抢课;它写出了一段完美的代码,却不能自己点击运行、查看报错并自动修好;它分析了股市动态,却无法替你发出买卖指令。

它是一个拥有极高智商、能言善辩,但没有眼睛、没有手脚、被关在封闭聊天框里的“缸中之脑”。

如果我们希望它走出聊天框,真正帮我们写程序、管文件、查网页、自动完成一整天繁琐的日常工作,我们需要做什么?

这就是本课程从下一章开始要带你进入的真正核心领域——Agent(智能体)。

下一章,我们将看看工程师们是如何打破聊天框的墙壁,给这个只会吐字的大脑,装上真正的“手和脚”。