IV
VOLUME IV

大语言模型

彻底引爆 AI 革命:从注意力到 ChatGPT,再到推理与智能体

2017 年,一篇横空出世的论文喊出“注意力就是一切”,彻底颠覆了整个人工智能领域!在这一卷,我们将亲手拆解现代大模型的完整秘密:让词与词自由沟通的注意力、宏伟的 Transformer 架构、千亿级参数的大规模预训练,以及让人工智能学会听懂人话、安全对齐的秘密技巧。

开始第一课 →
整套课程 · 五部分,一条路
卷一基础数学把万物化为数字
卷二神经网络让机器学会思考
卷三自然语言处理让机器听懂人话
卷四 · 你在这里大语言模型蜕变成超级智能
卷五附录3D全景与原典
这一卷的故事

《Attention Is All You Need》的核心主张极其简单:不需要循环,让每个词同时「查询」所有其他词。这个操作完全可以并行,让 GPU 的成千上万个核心第一次能被充分利用。参数量从亿级突破到千亿、万亿——规模本身就是一种能力,这是研究者在之前几十年都没有预料到的。

一个 Transformer Block = 多头注意力(多种关系同时建模)+ FFN(逐位置深加工)+ 残差连接(梯度高速公路)+ LayerNorm(数值稳定)。把它叠 96 层,配上合适的分词器和位置编码,就是 GPT-3 的主体。解码器优先(GPT 风格)和编码器优先(BERT 风格)是两种截然不同的设计选择,决定了模型能做什么。

但一个能「续写文本」的模型不等于「有帮助的助手」。预训练给了知识,监督微调(SFT)教会了对话格式,RLHF用人类的偏好判断进一步打磨——这三步连在一起,才造就了 ChatGPT。

在规模与效率之间,工程师发明了一系列折中方案:FlashAttention 让注意力在 GPU 片上缓存内完成、不反复读写慢速显存;MoE 让模型有更多参数但每次只激活一小部分;知识蒸馏让大模型的能力传给小模型。到这一卷的前半部分结束,ChatGPT 不再是魔法。

但故事并没有停在 ChatGPT。2024 年以来,大模型又长出了几条新的主线:靠可验证奖励训练出「先想再答」的推理模型;给注意力和显存「瘦身」,把上下文推向百万;用量化与投机解码把推理成本一压再压;让模型看得见、听得懂、画得出;再给它装上手脚,变成会调用工具、能把事办完的智能体。这一卷的后半段,就带你走完这些新范式,并在最后一课望向更远的地方。

承上启下
← 你带着什么走进这一卷

卷三结尾留下的难题——「必须按顺序读、无法并行」——就是这一卷的开场。一个叫「注意力」的想法,把它干净利落地解决了。

这一卷又交给后面什么 →

这是最后一卷。读完它你会发现:从卷一第一课那个向量,到 ChatGPT,是一条没有断点的路——AI 不是魔法,是一连串可以追溯的数学与工程决策。

课程路径 · 17 课
25
注意力机制不再只挤进一个记忆瓶口:让每个词回头看,按相关程度提取信息。
读 →
26
多头注意力在多组子空间中并行观察,组合不同角度的上下文信息。
读 →
27
Transformer 架构把注意力、前馈网络与稳定通路,组装成完整的 Transformer。
读 →
28
Tokenizer 分词器文本如何被切成 token,再变成模型能接收的数字?
读 →
29
编码器、解码器与大语言模型同样的积木,不同的排列:理解 BERT、GPT 与编码器解码器。
读 →
30
残差连接与层归一化用残差通路传递信号,用归一化控制尺度,让深层网络更容易训练。
读 →
31
预训练 · 监督微调 · 强化学习从预测下一个词,到模仿示范与学习偏好,模型怎样成为助手?
读 →
32
KV 缓存、稀疏注意力与 FlashAttention减少重复计算和数据搬运,给注意力与生成过程提速。
读 →
33
MoE 混合专家架构每次只调用部分专家,让总容量与单次计算量不再同步增长。
读 →
34
模型蒸馏把大模型的输出分布当作教材,让小模型学习其中的知识。
读 →
35
串讲:从 N-gram 到 Transformer把表示、计算、概率与学习串起来,重走语言模型的演进道路。
读 →
36
推理模型:让模型「先想再答」从思维链与可验证奖励,理解模型为什么能花更多计算去推理。
读 →
37
注意力瘦身术与长上下文从 GQA、MLA 到线性注意力,理解长上下文的计算与显存账。
读 →
38
推理提速:量化与投机解码用更少的位数存权重,让小模型打草稿、大模型验收。
读 →
39
多模态大模型:看图、听声、画画把视觉和声音变成模型可以处理的表示,连接不同模态。
读 →
40
智能体:从会说话到会做事模型、工具与循环,怎样组成一个能执行任务的系统?
读 →
41
前沿与未来:下一程从新的表示与推理路径出发,看看前沿还在解决哪些问题。
读 →