Skip to content

寒冬、热潮与范式转移

本页从「历史演进」的维度解释 AI 七十余年的兴衰节奏:为什么有两次寒冬、三次热潮,以及各技术在时间轴上应归入哪个时代。完整事件时间线见总时间线。

AI 的兴衰遵循一个简单模式:承诺过多 → 兑现不了 → 经费削减(寒冬)→ 技术积累突破 → 新一轮热潮 → 又开始过度承诺。每一轮热潮都由”旧范式的瓶颈被新技术突破”驱动,每一轮寒冬都源于”热潮中的承诺未能兑现”。

如果你是计算机专业但第一次接触 AI,可以把这个过程类比为一座钟摆:一端是”盲目乐观”(觉得 AGI——通用人工智能——马上就要实现了),另一端是”过度悲观”(觉得 AI 是骗局)。真实的进展总是在钟摆的两极之间,寒冬中积累的技术往往比热潮中的喧嚣更重要。

注意循环:寒冬不意味着研究停止——恰恰相反,寒冬中往往孕育了下一轮热潮的核心技术(如 1974-1980 寒冬中发展了反向传播理论;1987-1993 寒冬中 SVM/AdaBoost 崛起)。

第一次热潮(1956–1974):符号主义的黄金期

Section titled “第一次热潮(1956–1974):符号主义的黄金期”

符号主义(Symbolicism):AI 最古老的研究范式,认为智能的本质是对符号的操作和推理——就像人用语言和逻辑思考一样。方法是将知识编码为符号和规则(“如果 X,则 Y”),然后用搜索和推理引擎来处理。代表技术包括专家系统、逻辑编程、知识图谱等。

1956 年达特茅斯会议之后,AI 迎来了第一个黄金期。研究者在搜索与规划、定理证明、自然语言理解等方向上取得了一系列令人振奋的成果:

  • Logic Theorist(1956):Newell 和 Simon 编写的程序,能自动证明数学定理。Simon 夸张地说:“我们解决了心身问题。”
  • GPS(General Problem Solver, 1959):Newell 和 Simon 试图设计一个能解决任何问题的通用框架——通过”手段-目的分析”(means-ends analysis),即不断缩小当前状态和目标状态之间的差距。
  • Samuel 的跳棋程序(1959):Arthur Samuel 编写的程序不仅能下跳棋,还能从对局中学习改进——他首次提出了”机器学习”(Machine Learning)这个术语。到 1960 年代,这个程序已经能击败可靠的业余棋手。
  • SHRDLU(1971):Terry Winograd 的程序能理解关于积木世界的英语指令并执行操作。这是自然语言理解的里程碑。

这一时期的 AI 研究获得了政府和军方的大量资助——DARPA(美国国防高级研究计划局)在 1960 年代几乎无条件地资助 AI 研究,其负责人 J. C. R. Licklider 的信条是”投资人,不投项目”(fund people, not projects)。研究者因此拥有极大的自由度。

但这种自由也催生了过度乐观的预言:

  • 1958 年,Newell 和 Simon 预言”十年内计算机将成为国际象棋冠军”(实际在 1997 年才实现)。
  • 1965 年,Simon 预言”二十年内机器将能做人能做的任何工作”。
  • 1970 年,Minsky 告诉《Life》杂志:“在三到八年内,我们将拥有一台具有人类平均智能的机器。”

这些预言的落空,是第一次寒冬的重要诱因。

组合爆炸(Combinatorial Explosion):当问题的规模增大时,需要搜索的可能解数量呈指数级增长。例如,国际象棋每步约有 35 种合法走法,向前看 7 步就需要搜索 35⁷ ≈ 640 亿种局面。对于更复杂的现实问题(如自然语言理解、视觉识别),搜索空间更是天文数字。符号主义 AI 的搜索算法在面对这种规模时力不从心——速度再快的计算机也不可能穷举。

许多在”玩具世界”(toy world,如只有几个积木的虚拟世界)中运行良好的算法,一旦面对真实世界的问题就崩溃了。Lighthill 在他的报告中正是以此为核心论据批评 AI。

第一次寒冬(约 1974–1980):三份报告击碎了 AI

Section titled “第一次寒冬(约 1974–1980):三份报告击碎了 AI”

第一次寒冬不是由单一事件引起的,而是多份负面评估报告同时出现的结果:

1. ALPAC 报告(1966):机器翻译的死刑

Section titled “1. ALPAC 报告(1966):机器翻译的死刑”

冷战期间,美国急需自动翻译俄语科技文献。1954 年的 Georgetown-IBM 实验成功地翻译了 49 个精选俄语句子,媒体大肆报道(“机器人脑翻译俄语”)。但研究人员低估了词义消歧(word-sense disambiguation)的难度——同一个词在不同语境下有完全不同的意思。

著名的(可能是杜撰的)例子:将英语”The spirit is willing but the flesh is weak”(心有余而力不足)翻译成俄语再翻回来,变成了”The vodka is good but the meat is rotten”(伏特加不错但肉烂了)。这就是缺乏常识知识(commonsense knowledge)导致的荒谬错误。

1966 年,ALPAC(自动语言处理咨询委员会)报告的结论是:机器翻译比人工翻译更贵、更慢、更不准确。美国国家科学院在投入了约 2000 万美元后终止了所有经费,机器翻译研究因此停滞了近十年。这也是后来人们所说的常识知识问题(commonsense knowledge problem)——要准确理解语言,AI 需要关于世界的大量背景知识,而这些知识难以用手写规则全部编码。

2. 《Perceptrons》(1969):连接主义的挫折

Section titled “2. 《Perceptrons》(1969):连接主义的挫折”

Minsky 和 Papert 出版的这本书严格证明了单层感知机(perceptron,Rosenblatt 提出的一种简单神经网络)存在根本性局限——它连简单的 XOR(异或)函数都无法表示。虽然多层网络理论上可以克服这些局限,但当时没有人知道如何有效地训练多层网络(反向传播算法尚未被广泛认识)。

这本书的影响是深远的:它不仅切断了连接主义(connectionism)研究的经费,还让整整一代研究者远离了神经网络。Rosenblatt 在《Perceptrons》出版后不久因游艇事故去世,未能看到自己的研究方向在 1980 年代复兴。

3. Lighthill 报告(1973):英国 AI 的至暗时刻

Section titled “3. Lighthill 报告(1973):英国 AI 的至暗时刻”

1973 年,英国数学家 James Lighthill 受议会委托评估英国 AI 研究的进展。他得出的结论极其负面:

  • AI 未能实现”宏伟目标”,只解决了”玩具问题”。
  • 组合爆炸是致命伤——大多数 AI 算法在面对真实世界规模的问题时都会崩溃。
  • “AI 在做的事没有一项不能被其他学科完成”——即 AI 没有独立存在的价值。

在随后的 BBC 电视辩论中,Lighthill 与 AI 研究者 Michie、McCarthy 和 Gregory 展开了激烈交锋。McCarthy 后来辩称”组合爆炸问题从一开始就被认识到了”,但报告的结论已成定局。英国政府几乎完全停止了对 AI 的资助,仅保留了爱丁堡、埃塞克斯和苏塞克斯三所大学的研究经费。

1969 年的 Mansfield 修正案要求 DARPA 只资助”与军事任务直接相关的定向研究”,不再支持基础性探索。研究者之前过度乐观的承诺未能兑现——例如,CMU 的语音理解研究项目(SUR)花了五年时间和数百万美元,只开发出能在特定词汇范围内识别英语的系统,远未达到 DARPA 期望的”飞行员语音指令”水平。

据 Hans Moravec 回忆,DARPA 内部甚至有人说”要给这些人一个教训,把他们每年两百万美元的合同砍到几乎为零”。到 1974 年,AI 研究经费大幅缩水。

值得注意的是,历史学家 Thomas Haigh 在 2023 年发表于 Communications of the ACM 的文章中提出了不同观点。他用 ACM SIGART(AI 特别兴趣组)的会员数作为衡量指标:1973 年(Lighthill 报告发表时)SIGART 有 1,241 名会员,到 1978 年——即所谓”寒冬最深处”——会员数增长到了 3,500 人,增长了近三倍。这意味着所谓的”寒冬”主要影响的是大型实验室和政府资助的大项目,而整个领域的研究者数量和发现速度实际上在加速。换句话说,“寒冬”更多是资金和公众形象的问题,而非学术研究的停滞。

第二次热潮(1980–1987):专家系统的商业化

Section titled “第二次热潮(1980–1987):专家系统的商业化”

专家系统(Expert System):一种将领域专家的知识编码为”如果…则…”规则(产生式规则),然后通过推理引擎(inference engine)自动推理的系统。它由两个核心部分组成:知识库(存储规则和事实)和推理引擎(根据规则推导新结论或做出决策)。例如,MYCIN 系统编码了血液感染诊断的知识。

第二次热潮的核心驱动力是专家系统证明 AI 能赚钱:

XCON(eXpert CONfigurer,也叫 R1)是 DEC 公司(Digital Equipment Corporation)使用的专家系统,由 CMU 的 John McDermott 团队开发。它的任务是自动配置 VAX 计算机系统的订单——这是一个需要大量专业知识且容易出错的复杂任务。XCON 据报道在六年内为 DEC 节省了约 4000 万美元。到 1985 年,全球公司在 AI 上的投入超过 10 亿美元,大多数花在内部 AI 部门和专家系统开发上。

一个完整的产业生态涌现了:

  • 硬件公司:Symbolics 和 LISP Machines Inc. 生产专为运行 LISP 语言(AI 研究的首选编程语言)优化的专用工作站——LISP 机(LISP Machine),价格通常在 5-10 万美元。
  • 软件公司:Teknowledge、Intellicorp(KEE 产品)等提供专家系统开发工具和”外壳”(shell)——即预置推理引擎、用户只需填入知识的框架。
  • 知识工程师(knowledge engineer)成为一个新职业——专门负责采访领域专家、将其知识编码为规则的人。

日本通产省投入 8.5 亿美元启动了第五代计算机系统(FGCS)计划,目标是建造能进行对话、翻译、推理的并行推理计算机。这个计划引发了全球军备竞赛式的连锁反应:

  • 美国启动了 DARPA 的战略计算计划(Strategic Computing Initiative, 1983),到 1985 年已投入 1 亿美元支持 92 个项目。
  • 英国启动了 Alvey 计划(1983),投入 3.5 亿英镑。

1982 年,John Hopfield 发表的 Hopfield 网络论文重新唤起了学界对神经网络的兴趣。1986 年,Rumelhart、Hinton 和 Williams 在 Nature 上发表的论文让**反向传播算法(Backpropagation)**广为人知——该算法通过链式法则将误差从输出层逐层反传,使得训练多层网络成为可能(Werbos 早在 1974 年的博士论文中就提出了这个想法,但当时未被重视)。连接主义终于从第一次寒冬中复苏。

第二次寒冬(约 1987–1993):泡沫再次破裂

Section titled “第二次寒冬(约 1987–1993):泡沫再次破裂”

第二次寒冬的触发因素同样是多方面的:

1987 年,Sun Microsystems 等公司生产的标准 UNIX 工作站性能快速提升,价格远低于专用 LISP 机。Lucid 和 Franz LISP 等公司为这些工作站提供了高效的 LISP 环境。不久后,Apple 和 IBM 的个人电脑也具备了运行 LISP 程序的能力。

据 benchmarks 显示,通用工作站在 LISP 运行性能上已经追平甚至超过了昂贵的 LISP 机。到 1987 年底,整个价值 5 亿美元的专用 LISP 机产业在一年内被通用计算机取代。Symbolics、LISP Machines Inc.、Lucid Inc. 等公司相继倒闭。

随着专家系统规模增长到数万条规则,三个根本性问题暴露出来:

  • 知识获取瓶颈(Knowledge Acquisition Bottleneck):每添加一个新领域都需要知识工程师花费大量时间采访专家并手工编码规则。这个过程既昂贵又容易出错——专家往往自己也无法清晰描述他们的直觉判断过程(即”隐性知识”难以显性化)。
  • 脆弱性(Brittleness):专家系统在规则覆盖的范围内表现完美,但一旦遇到训练规则之外的输入就会产生荒谬的错误——它没有人类的常识来兜底。
  • 无法学习:与后来的机器学习模型不同,专家系统无法从经验中自动改进——每一条新规则都需要人工添加。

到 1990 年代初,许多公司放弃或大幅缩减了专家系统项目。DARPA 也于 1988 年大幅削减了战略计算计划中的 AI 经费——新任 IPTO 主任 Jack Schwarz 认为”专家系统只是聪明的编程”,将资金”深度而残酷地”削减了。

到 1992 年,日本第五代计算机计划在远未达成 1981 年设定的宏伟目标的情况下悄然终止。正如 HP Newquist 在 The Brain Makers 一书中所说:“1992 年 6 月 1 日,第五代计算机计划不是以成功的轰鸣结束,而是以一声呜咽告终。”

第二次寒冬对 AI 的公众形象造成了严重损害。2005 年《纽约时报》的 John Markoff 写道:“在最低谷时期,一些计算机科学家和软件工程师刻意避免使用’人工智能’这个词,生怕被人当成不切实际的梦想家。“许多研究者开始将自己的工作改称为”机器学习”(machine learning)、“智能系统”(intelligent systems)、“分析”(analytics)、“知识管理”(knowledge management)等名称,以获取经费和避免”AI”的污名。

Rodney Brooks 在 2006 年的一段话很好地总结了这种悖论:“有一个愚蠢的迷思说 AI 失败了,但 AI 在你身边每时每刻都在运行。“Nick Bostrom 也在同年指出:“大量前沿 AI 已经渗透到通用应用中,通常甚至不再被称为 AI——因为一旦某件事变得足够有用和普及,它就不再被标记为 AI 了。“这就是所谓的 “AI 效应”(AI Effect):AI 的成功被正常化,只有 AI 的失败被记住。

正是在第二次寒冬中,统计学习路线悄然崛起,为第三次热潮积蓄了力量:

  • SVM(1995):Vapnik 等人提出的支持向量机成为 2012 年前最强大的通用分类器之一。
  • AdaBoost(1997):集成学习方法的奠基——多个”弱学习者”组合成强分类器。
  • TD-Gammon(1992):强化学习首次在博弈领域达到世界级水平。
  • 贝叶斯网络(1988):Judea Pearl 的工作奠定了概率推理的基础,他因此获得 2011 年图灵奖。

这些方法与符号主义的根本区别在于:它们不依赖人工编写的规则,而是从数据中自动发现统计规律——“数据驱动”取代了”规则驱动”。

第三次热潮(2006 至今):深度学习 → 大模型 → 生成式 AI

Section titled “第三次热潮(2006 至今):深度学习 → 大模型 → 生成式 AI”

第三次热潮的复兴可以追溯到 2006 年 Hinton 发表的**深度信念网络(Deep Belief Network, DBN)**论文——通过”逐层预训练”策略成功训练了多层网络,“深度学习”一词由此正式确立。

与前两次热潮不同,第三次热潮不是由单一突破驱动的,而是三个条件同时成熟的结果:

要素具体内容为什么是关键
算法ReLU 激活函数、Dropout 正则化、BatchNorm、残差连接(ResNet)解决了深层网络的梯度消失问题——即误差信号在反传过程中逐层衰减导致深层无法学习的问题
数据ImageNet(2009,1400 万+ 标注图像)、互联网文本语料深层网络需要海量数据才能避免过拟合(overfitting)——“大数据”时代为 AI 提供了燃料
算力NVIDIA GPU(特别是 CUDA 平台)、Google TPU神经网络的核心运算是大规模矩阵乘法,GPU 的并行架构恰好适合——算力成本下降了几个数量级

2012 年,Alex Krizhevsky 在 Hinton 指导下设计的 AlexNet 在 ILSVRC 图像识别竞赛中以 15.3% 的错误率夺冠(第二名 26.2%)。关键创新是用 GPU 训练深度 CNN。此后数年,几乎所有图像识别方法都转向了深度学习——这就是”AlexNet 时刻”。

需要澄清的是:AlexNet 不是 CNN 的发明。CNN 的灵感来自 Hubel & Wiesel 对猫视觉皮层的研究(1962),福岛邦彦在 1980 年提出了 Neocognitron(CNN 的前身),Yann LeCun 在 1989 年将其用于手写数字识别(LeNet)。Ciresan 等人甚至在 2011 年就已用 GPU CNN 赢得了竞赛。AlexNet 的意义在于它让整个社区看到了深度学习的威力——是”走向主流的标志”,而非技术起点。详见 CNN 与 ResNet。

2017 年,Google 的论文 Attention Is All You Need 提出了 Transformer 架构。在此之前,处理序列数据(文本、语音)主要使用 RNN/LSTM,它们必须逐个词处理——速度慢且难以捕捉长距离依赖。Transformer 用**自注意力机制(Self-Attention)**取代了序列处理:模型在处理每个词时可以同时”看到”所有其他词,判断哪些部分最相关。

Transformer 的影响是革命性的:

  • 2018 年:BERT 和 GPT-1 确立了”预训练 + 微调”(pre-training + fine-tuning)范式——先在海量无标注文本上训练通用语言模型,再用少量标注数据微调特定任务。
  • 2020 年:GPT-3 展示了惊人的规模效应——1750 亿参数的模型只需给几个例子就能完成翻译、写代码、做算术等任务,无需专门微调。这催生了**规模定律(Scaling Laws)**的研究:模型能力随参数量、数据量和算力呈可预测的幂律(power law)提升。
  • 2022 年:ChatGPT 引爆全球——通过 RLHF(基于人类反馈的强化学习)让模型回答更符合人类偏好,两个月内突破 1 亿用户。

2022-2026:从 ChatGPT 到推理模型与 Agent

Section titled “2022-2026:从 ChatGPT 到推理模型与 Agent”

ChatGPT 之后,AI 领域进入了前所未有的高速发展期:

  • 2023:GPT-4(多模态)、LLaMA 开源权重、首届 AI 安全峰会(布莱切利园)
  • 2024:o1 推理模型(Chain-of-Thought 思维链推理)、GPT-4o(实时多模态交互)、Sora(文生视频)
  • 2025:DeepSeek-R1(开放权重推理模型,引发 Nvidia 股市暴跌)、Stargate 计划(5000 亿美元基建)、GPT-5、推理模型在 IMO 达到金牌水平

范式转移的规律:每次转移都由”旧范式的内在瓶颈(组合爆炸 / 知识获取瓶颈 / 浅层模型表达力不足)+ 外部条件成熟(算力、数据、算法突破)“共同驱动,而非单一论文所致。

第三次热潮会终结吗?——“第三次寒冬”的前瞻性讨论

Section titled “第三次热潮会终结吗?——“第三次寒冬”的前瞻性讨论”

主流文献确认的历史上只有两次大寒冬。“第三次寒冬”目前是前瞻性讨论而非史实。但有几个值得关注的信号:

  1. Scaling Laws 的天花板:2025 年 6 月,Apple 研究人员发表论文 The Illusion of Thinking(思考的幻觉),指出大推理模型(Large Reasoning Model)在超过一定复杂度的问题上会出现”完全的准确率崩溃”——即问题越难,模型反而越不愿”思考”。这质疑了”更大就是更强”的线性叙事。
  2. 数据墙(Data Wall):高质量人类生成文本可能在未来几年内被耗尽。各大公司已转向合成数据(synthetic data)——即用 AI 生成的数据来训练 AI——但其长期效果和潜在风险尚未充分验证。
  3. 商业回报存疑:METR 在 2025 年 7 月发布的随机对照实验发现,经验丰富的开发者使用 2025 年初的 AI 编程工具后,完成实际任务反而慢了 19%——尽管他们自己以为快了 20%。AI 工具的生产力收益可能被高估。巨额基建投入(如 Stargate 的 5000 亿美元)能否获得足够回报仍是未知数。
  4. 版权与监管风险:2025 年 Anthropic 以 15 亿美元和解版权诉讼,Disney/Universal 起诉 Midjourney,加州 SB 53 和欧盟 AI Act 开始落地——合规成本正在上升。
  5. 能源瓶颈:训练和运行大型 AI 模型的电力消耗巨大。据估计,到 2025 年大型科技公司在 AI 基础设施上的总投入将达 3640 亿美元,而数据中心的电力需求已开始挑战电网的供电能力。

但这次可能不同——结构性差异

Section titled “但这次可能不同——结构性差异”

与 1980 年代的专家系统泡沫相比,当前的 AI 热潮有几个结构性差异可能使其更具韧性:

  • 已产生巨大的实际价值:与 1980 年代专家系统仅在少数场景有用不同,当前的 LLM 和生成式 AI 已经在编程(GitHub Copilot)、客服、内容创作、药物发现(AlphaFold)等领域产生了可衡量的价值。
  • 没有”单一失败模式”:专家系统崩盘是因为知识获取瓶颈——一个根本性缺陷。当前的深度学习没有如此明显的单一致命伤,其局限(幻觉、推理能力不足)正在被逐步改善。
  • 技术迭代速度远超从前:2012 年到 2025 年间,模型从百万参数增长到万亿参数,架构从 CNN/RNN 演进到 Transformer 再到 MoE——这个迭代速度是前所未有的。
  • 投入规模完全不同:1985 年全球在 AI 上的投入约 10 亿美元;2025 年仅大型科技公司一家的投入就可能超过数百亿美元。

最可能的情景不是经典的”寒冬”(经费枯竭、领域声誉破产),而是**“理性的回调”**——市场从过度乐观的预期中修正,资本分配更趋理性,但核心技术研究不会停滞。AI 研究已经深入到从手机到汽车到科研工具的方方面面——正如 Rodney Brooks 所说,“AI 在你身边每时每刻都在运行”,即使它不再被叫作”AI”。

各技术在时间轴上的”时代坐标”

Section titled “各技术在时间轴上的”时代坐标””
时代主导范式代表技术本站点名技术的坐标
1956–1974符号主义搜索、规划、定理证明—
1980–1987符号主义(知识工程)专家系统、LISP 机—
1990s统计学习SVM、AdaBoost、贝叶斯网络、HMM随机森林(思想脉络属 1990s 统计学习,正式论文 2001)
2006–2016深度学习CNN、RNN/LSTM、GAN、DQNYOLO(2015,深度学习时代的 CNN 应用)
2017 至今大模型/生成式 AITransformer、GPT、扩散模型、RLHF扩散模型(2015 奠基、2020 DDPM 主流化)、LLM(2018 预训练范式、2022 产品化)

几个容易误判的年代归属:

  • 随机森林正式论文是 2001 年,但思想脉络(bagging 1996、随机子空间 1998)属 1990s 统计学习潮流,按脉络归入 1990s 更合理。详见集成学习与随机森林。
  • Deep Blue(1997)不是机器学习的胜利——它是 alpha-beta 暴力搜索 + 手工评估函数,属符号主义/搜索范式的巅峰(见搜索与规划)。
  • AlexNet 是深度学习走向主流的标志,而非技术原创起点(CNN 源自福岛 1980 与 LeCun 1989;Ciresan 组 2011 年已用 GPU CNN 获胜)。详见 CNN 与 ResNet。
  • “深度学习诞生于 2006”有争议——Schmidhuber 主张深度学习始于 Ivakhnenko 1965 年的多层网络训练方法(其 arXiv:2212.11279 系统表达了这一立场)。