III
VOLUME III

自然语言处理

教会机器听懂人类语言的几十年接力赛

人类的文字充满隐喻和上下文,电脑怎么理解“苹果”究竟是能吃的水果还是手机?这一卷我们将回溯自然语言处理的黄金三十年:从最笨拙的“成语接龙统计”,到给每个词找到一个奇妙的思维坐标(词向量),再到给网络装上带有记忆阀门的循环管道。每一代技术,都是为了解开上一代留下的死结。

开始第一课 →
整套课程 · 五部分,一条路
卷一基础数学把万物化为数字
卷二神经网络让机器学会思考
卷三 · 你在这里自然语言处理让机器听懂人话
卷四大语言模型蜕变成超级智能
卷五附录3D全景与原典
这一卷的故事

神经网络可以学习任何函数,但语言有特殊的挑战:它是序列的,每个词的意思取决于上下文;它是稀疏的,可能的词组合几乎无限多;它是语义的,「猫」和「小猫」在字符上毫无关联,但意思几乎相同。

最早的语言模型(N-gram)选择忽略这一切:光靠数数——历史数据里这两个词之后最常见的词是什么?这个方法在短距离搭配上表现不错,支撑了手机输入法和早期语音识别几十年。但它记性只有几个词,而且把「猫」和「小猫」当成完全不同的符号。

词向量解决了符号问题:把每个词变成一组数字,让意思相近的词数字也相近。一个精妙的训练技巧让这些数字自动编码词义——「国王 − 男人 + 女人 ≈ 女王」不是人为设计,是从语料里自然浮现的。接上神经网络后,模型第一次能举一反三:即使没见过「黑洞运转的___」,也能从「天体运转」推断答案。

RNN 给网络装上了记忆向量;LSTM 给记忆装上了阀门,防止重要信息被稀释。到这一卷结束,你会看到一个悬而未决的问题:无论 LSTM 多精巧,它仍然必须一步一步地读——无法并行,限制了模型规模的天花板。这个问题要等下一卷解决。

承上启下
← 你带着什么走进这一卷

带着卷二那台「会学习的机器」,这一卷只追问一件事:怎么让它读懂语言?你会看到三十年里,工程师如何一代代逼近答案。

这一卷又交给后面什么 →

故事会停在一个悬念上:LSTM 再精巧,也必须一个词一个词地读,无法并行——这道天花板,正是卷四第一课要砸开的。

课程路径 · 5 课
20
语言的概率游戏:N-gram根据已经出现的词,统计下一个词的条件概率。
读 →
21
词向量相似的上下文,让词语在向量空间里找到自己的位置。
读 →
22
前馈神经网络语言模型把词向量交给神经网络,让没见过的组合也有机会被预测。
读 →
23
RNN 循环神经网络给网络一条循环传递的隐藏状态,让前文影响后文。
读 →
24
LSTM 长短期记忆网络用门控与细胞状态,缓解长序列里记忆与梯度的衰减。
读 →