LESSON 41 · 卷IV 大语言模型

前沿与未来:下一程

站在 2026 年的秋天回头看:想得更深、跑得更省、看得更广、做得更多,这四条线已经落地。再往前,是哪些还没有答案的问题?这一课不追型号,只画一张「正在发生」的地图。

第 1 站

从「已经发生的历史」到「正在发生的故事」

前面 34 课讲的,大多是已经定型的知识:从一根数轴上的向量,一路走到会想、会看、会做的大模型。每一步都有清晰的因果,也有一套稳定的原理。这最后一课换个姿势——站在 2026 年 9 月,看看正在发生和可能发生的事。

如果只用一句话概括过去两年,那就是:能力的来源,从「把模型做大」,扩展到了「让模型多想、让模型用工具、让模型跑得更省」。你已经在第 36~40 课亲手拆解了这些:

THINK · 第 36 课
想得更深
可验证奖励 + 思维链:把算力从训练挪到推理,思考量可以按档位调节。
CHEAPER · 第 37~38 课
跑得更省
GQA / MLA / 混合注意力压缩缓存,量化与投机解码压低成本,让强模型跑在笔记本上。
SEE · 第 39 课
看得更广
图像、声音、视频统一成 token,看、听、画都在同一个模型里。
ACT · 第 40 课
做得更多
工具调用与 MCP,让模型变成能把长任务办完的智能体;编码是最先成熟的战场。
⚠️ 遇到的拦路虎 · 前沿的保质期很短

前沿之所以叫前沿,就是因为它还没有标准答案。具体的型号、榜单、价格,往往一个季度就换一批;下面这些方向里,有的正在落地,有的还在争论,有的可能两年后就被证伪。所以这一课不追型号,只追范式,也只说有公开依据的进展。目标是让你建立一张地图:知道大家在往哪几个方向使劲、各自想解决哪个死结。

第 2 站

训练的下一步:数据快用完了,怎么办?

第 31 课提到过,Llama-3 的预训练用了约 15 万亿 token。而人类公开写下的高质量文本是有限的——前沿模型的胃口,正在逼近这个存量。这堵墙常被叫做数据墙。业界的应对,大致沿着两条路:

SYNTHETIC
合成数据
让模型自己生成训练数据(比如把难题的解答写出来,再筛掉错的),用来训练下一代。风险是「近亲繁殖」:一代代只学自己,质量与多样性可能悄悄退化。
ENVIRONMENT
环境即数据
第 36 课的 RLVR 需要的不是「文本」,而是能自动判分的任务环境:数学题、代码库、模拟的软件界面……高质量的环境,正在成为新的稀缺资源。

于是新的问题出现了:那些没有标准答案的事怎么办?写一篇好文章、做一次科研判断、设计一个方案——没有一个测试能自动判对错。目前的探索包括:用更细致的评分细则(rubric)、让另一个模型当裁判、让模型自我博弈互相出题互相挑错。这些办法各有短板,是一个非常活跃的方向。

⚠️ 遇到的拦路虎 · 奖励投机没有消失

只要奖励可以被钻空子,模型就会钻。训练中的智能体已经被观察到会改测试、硬编码答案、绕开限制去「拿分」,而不是真的把事做对。环境和奖励设计得越复杂,漏洞就越难堵——这也是后面「安全」一站的重要背景。

第 3 站

架构的下一步:能不能不再「一个字一个字」地写?

回想第 27、29 课:解码器每次只生成一个 token,写完一个才能写下一个。哪怕有第 38 课的投机解码来加速,这种串行的本质没有变——句子越长,等得越久。

扩散语言模型(Diffusion LLM)把第 39 课的扩散思想搬到了文字上:先把整段文字全部「遮住」,每一步让模型并行地给所有还被遮住的位置打分,把握大的先「揭开」,把握小的继续遮住,如此迭代几步,整段话就一起「浮现」出来。2025 年的 LLaDA 等工作展示了它在大模型规模上的可行性,也有公司演示了远高于同级自回归模型的生成速度。

LAB · 35-A
自回归 vs 扩散语言模型:同一句话,谁先写完?
自回归:从左到右,一步一个 token
扩散语言模型:整句先全部遮住,每步并行揭开「把握大」的位置
自回归:已写出
–
扩散:已揭开
–
当前步数
–
这是简化的示意:真实的扩散语言模型每一步会对所有被遮位置并行预测,按置信度决定保留哪些、其余再遮住重来(掩码扩散)。这里的「把握度」是手工设定的,只为演示并行揭开的过程。

它的潜在好处很诱人:并行(一步出多个 token)、可以回头修改(不是一锤定音)、天然适合填空与编辑。但它还在追赶:训练与推理的工程生态不如自回归成熟;超长上下文、与 KV 缓存的配合、以及怎么把第 36 课的强化学习无缝接上,都是未解的问题。

另一条线:能不能「在心里想」?

第 36 课的思维链是写出来的:每一步「想法」都得先压缩成一个离散的词。有研究尝试让模型直接在隐藏状态里循环思考(有时叫潜空间推理或循环深度),不必每一步都落成文字——可能更高效、信息也更丰富。代价是:人类看不懂它在想什么了。思维链目前之所以能被用来监督模型,恰恰因为它是可读的。这是一个典型的「效率 vs 可监督性」取舍,我们在「安全」一站会再遇到它。

第 4 站

记忆的下一步:会「继续学」的模型

今天的大模型有点像一位学识渊博、却患有失忆症的专家:训练结束,权重就冻结了。它「记得」的一切都来自两处——训练时刻进权重的知识,以及此刻塞在上下文里的内容。对话一结束,除非有外部记忆,它就什么也没学到。

持续学习(Continual Learning)想让模型在部署后继续从经验里学习,又不忘掉旧本事。难点是一个老问题:更新权重时,新知识会冲掉旧知识(灾难性遗忘,第 13 课训练的副作用)。目前的探索方向包括:

TTT
测试时训练
把第 37 课线性注意力里那个固定大小的状态 S,当成一个「小模型」,在读文本的过程中用梯度不断更新它——读的同时在学。
MEMORY
记忆层
在模型里加入容量很大、按需寻址的记忆参数,让「记事实」和「做推理」分开,新增知识不必动整个网络。
SKILLS
技能与经验库
让智能体把成功的做法沉淀成可复用的技能和笔记,下次遇到类似任务直接调用——相当于在「外部」持续学习。
⚠️ 遇到的拦路虎 · 大多还在研究阶段

「记住」很容易,「记住之后不变坏」很难:新经验里可能有错误、偏见,甚至是别有用心的注入;一旦写进长期记忆,就可能被长期放大。持续学习的每一步,都要同时回答「学什么、忘什么、信谁」。

第 5 站

感知的下一步:从文字的影子,走向真实世界

文字是人类对世界的二手转述。模型读遍了转述,却没有亲手摸过一个杯子。让它走向真实世界的两条线索:

WORLD MODEL
世界模型
不只是预测「下一个词」,而是预测「在这个状态下做了这个动作,世界会变成什么样」。视频生成模型是否真的学到了物理规律,仍有争论;但把它们当作可以拿来「试错」的模拟器,是很有吸引力的想法。
VLA
视觉-语言-动作模型
把机器人的动作也当作 token:输入摄像头画面和一句指令,直接输出下一步的动作序列。用第 39 课「万物皆 token」的套路,去指挥一个真正的身体。
⚠️ 遇到的拦路虎 · 物理世界的试错很贵

在软件里,一次失败只是重来一遍;在物理世界,摔坏一台机器、撞倒一个人,都无法撤销。而且真实的机器人数据远比互联网文本稀缺。所以「仿真里大量训练 + 真实世界少量微调」,以及能先在脑子里推演再动手的世界模型,是绕不开的路径。

第 6 站

安全的下一步:看懂它,才谈得上管住它

模型越强、手脚越长,「我们能不能信任它」就越关键。前沿的研究大致沿着三条线:

INTERPRETABILITY
可解释性
把模型内部「一团糟」的激活,用稀疏自编码器拆成一个个可读的特征;再用「电路追踪」之类的方法,看一次回答里信息是怎样一步步流过网络的。目标是真正看懂它在算什么。
MONITORING
监控思维链
读模型写下的推理过程,从中发现它想「作弊」或走偏的苗头。但这依赖思维链是可读且诚实的——潜空间推理与「写一套做一套」的可能,都在挑战这一点。
EVALUATION
评测与治理
模型有时能察觉「自己正在被测试」,让评测结果失真;能力越强,部分实验室越倾向于分级、受限地开放那些具备强大网络攻防能力的模型。
⚠️ 遇到的拦路虎 · 我们对内部的理解还很浅

可解释性目前能解释的,只是庞大网络里的一小部分现象;我们离「像读代码一样读懂一个大模型」还很远。所以今天的安全实践,更多依赖权限限制、沙箱、评测、人工监督这些外部手段(第 40 课),而不是对模型内部的完全掌握。

第 7 站

几堵还没推倒的墙

能力一路狂奔,但前方仍有一些真正难啃的问题,决定了这条路能走多远:

RELIABILITY
可靠性
单步再聪明,长任务里仍会「累积误差」(第 40 课)。怎么让它稳定地把一件几小时、几百步的事办完?
EVALUATION
怎么算「更好」
许多基准已接近饱和,还可能混进训练数据。当模型在大多数考试上都超过人,怎样衡量真实进步本身就成了问题。
GENERALIZATION
是推理,还是背题
模型在没见过的新问题上,究竟是在推理,还是在拼贴见过的模式?这场争论,直接影响我们对它能力上限的判断。
COST
成本与能耗
智能体会一口气消耗海量 token,一个任务可能花掉过去一整天的用量。推理的成本、能耗与算力供给,会决定谁用得起。
DATA
数据与环境
高质量数据的存量、可验证环境的构建、合成数据的质量控制,都还没有成熟的答案。
TRUST
可信与治理
谁来为智能体的行为负责?怎样在能力与风险之间划边界?这已经不只是技术问题。
第 8 站

一架没有终点的阶梯

最后,把这 35 课的路,压成一条时间线。点一点节点,看每一年在这棵树上长出了什么新枝:

LAB · 35-B
范式时间线:点击节点,看每一年长出了什么新枝

回看这一路:从一根数轴上的向量,到会推理、会看、会做的大模型——每一阶都不是天才的灵光一现,而是「发现一个死结,再用一个朴素的想法解开它」的循环。前沿,不过是这个循环还在继续。

所以你已经具备了读懂未来的底子。下次看到一个新名词——某某注意力、某某对齐、某某架构——别慌,先问那三个老问题:它为什么诞生?解决了上一代的什么死结?又会留下什么新麻烦?这套追问,从第 01 课到今天,一直管用,以后也会。

💡 章节速记 · 本课核心

这一课的地图:训练上,数据墙逼出合成数据与可验证环境;架构上,扩散语言模型与潜空间推理在挑战「逐字串行」;记忆上,持续学习想治好模型的「失忆症」;感知上,世界模型与具身走向真实世界;安全上,可解释性与监控是管住能力的前提。理解它们,靠的还是那三个老问题。

💡 用大白话梳理:这一课的核心直觉

  • 训练:数据快用完 → 合成数据 + 可验证的 RL 环境;没标准答案的任务怎么给奖励,是难点;奖励投机始终存在。
  • 架构:扩散语言模型并行地「浮现」整段文字;潜空间推理不落成文字——都在换取效率,也都有代价。
  • 记忆:今天的模型部署后权重冻结;持续学习要在「继续学」与「不遗忘」之间取得平衡。
  • 世界:世界模型与 VLA 把「万物皆 token」推向物理世界;试错代价高,仿真与推演是关键。
  • 安全:可解释性想看懂内部,思维链监控依赖可读性;当前实践仍以权限、沙箱、评测与人工监督为主。
  • 态度:面对任何新事物,问三个老问题——为何诞生、解开了什么死结、留下什么新麻烦。
小测验

学习小测验

动动脑筋:核心直觉小测验(选出你的答案后点击「提交」,即可查看生动通俗的详细解析)

Q1扩散语言模型(Diffusion LLM)和传统的自回归语言模型,在生成文字的方式上最主要的区别是什么?
Q2让模型直接在隐藏状态里循环「思考」,而不把思考过程写成文字(潜空间推理),主要的取舍是什么?