分类争议与易错点
本页汇总 AI 技术分类中最常见的争议与易错点,每条附有具体例子与详细论证。与术语归属速查表配合使用。各条涉及的技术细节可在对应分类章节与深挖专题中找到完整论证。
为什么分类争议很重要? AI 是一个快速发展的领域,术语混用随处可见——媒体报道、甚至论文标题都常常出错。搞清楚这些边界,不仅是为了「正确」,更是为了理解不同技术路线的本质差异。下面逐条展开。
1. 「机器学习 vs 深度学习」并列是错的
Section titled “1. 「机器学习 vs 深度学习」并列是错的”争议本质:二者是从属关系,不是并列关系。
深度学习(Deep Learning, DL)是机器学习(Machine Learning, ML)的一个子集,正确的并列项是「传统机器学习 vs 深度学习」。包含关系为:
深度学习 ⊂ 机器学习 ⊂ 人工智能
具体例子:随机森林、SVM、k-NN 都是机器学习算法,但它们完全不需要深度神经网络——它们是「传统 ML」。业界和媒体常说「AI=深度学习」或把「ML」等同于「DL」,这是概念错位:逻辑回归是 ML,但它连隐藏层都没有,和「深度」毫无关系。
易混淆场景:Kaggle 表格数据竞赛中,XGBoost(传统 ML)常年压制深度学习。这恰恰说明 DL 并非在所有场景都优于传统 ML——在结构化数据上,传统方法往往更强。
2. 反向传播是训练算法,不是模型
Section titled “2. 反向传播是训练算法,不是模型”争议本质:反向传播(Backpropagation)是一种计算梯度的方法,不是一个独立的模型或架构。
很多人误以为「反向传播是一种神经网络」,但反向传播本质上只是一个高效计算梯度的算法——通过链式法则从输出层向输入层逐层计算偏导数,告诉每个参数该往哪个方向调整。它服务于模型的训练过程,本身不是一个模型。
归属优先权争议:
- Paul Werbos 1974 年在其哈佛博士论文中首次描述了反向传播在神经网络中的应用,但未被广泛关注。
- Rumelhart、Hinton 和 Williams 1986 年在 Nature 发表的论文 Learning representations by back-propagating errors 普及了该方法,被广泛引用。
- Schmidhuber 等人长期强调更早的工作者(如 Linnainmaa 1970 的自动微分)被忽视。
这个优先权争议至今仍是 AI 史学界的敏感话题。
3. Deep Blue 属于符号主义/搜索范式,不是机器学习的胜利
Section titled “3. Deep Blue 属于符号主义/搜索范式,不是机器学习的胜利”争议本质:IBM Deep Blue(深蓝,1997 击败卡斯帕罗夫)的核心是暴力搜索 + 人类专家评估函数,不是「从数据中学习」。
Deep Blue 每秒搜索约 2 亿个棋盘位置,使用 Minimax 搜索 + Alpha-Beta 剪枝(均为符号主义 AI 的经典方法),其局面评估函数由国际象棋大师和程序员手工调参。它几乎没有用到今天意义上的「机器学习」。
对比:20 年后,AlphaGo(2016)击败李世石,用的是深度神经网络 + 强化学习 + 蒙特卡洛树搜索(MCTS)。这两者代表了完全不同的 AI 范式——前者是符号搜索的巅峰,后者是深度学习 + 搜索的融合。媒体常把两者混为一谈,说成「AI 从下棋进化到下围棋」,但底层技术截然不同。
4. 随机森林归 bagging 还是独立一类
Section titled “4. 随机森林归 bagging 还是独立一类”争议本质:随机森林(Random Forest)到底应归入 bagging(Bootstrap Aggregating,一种集成学习策略)的子类,还是算作独立的方法。
主流观点:归为「bagging + 随机特征选择」。Breiman 在 2001 年的原论文中明确将随机森林定义为 bagging 的扩展——在 bagging(对训练集做有放回采样得到多个子集,分别训练)的基础上,每个节点分裂时只随机选一部分特征。两条随机化(数据采样 + 特征采样)共同作用。
年代归属:按思想脉络属 1990s 统计学习(Ho 1995 的随机决策森林是前身),Breiman 的正式论文发表于 2001。引用时需注意区分「思想起源」和「正式发表」的时间。
5. GBDT/XGBoost 归类依据是 boosting 分支,而非「决策树算法」
Section titled “5. GBDT/XGBoost 归类依据是 boosting 分支,而非「决策树算法」”争议本质:XGBoost 被很多人归类为「决策树算法」,但其核心创新在于 boosting 框架,与基学习器是什么无关。
Boosting(提升)的核心思想是:串行训练多个弱模型,每个新模型专门纠正前一个模型的错误。GBDT(梯度提升决策树)中,每棵新树拟合的是之前所有树的残差(预测值与真实值之差)。XGBoost、LightGBM、CatBoost 都是这一思路的工程优化实现。
关键区别:Boosting 框架的基学习器不一定是决策树——理论上可以用任何模型。它被归入「集成学习 → boosting」而非「决策树」,正如 boosting 与 bagging 的区别在于训练策略而非基模型。
6. 扩散模型 = Score-based 生成模型——不是第四类生成模型
Section titled “6. 扩散模型 = Score-based 生成模型——不是第四类生成模型”争议本质:扩散模型(Diffusion Model)经常被当作与 VAE/GAN/Flow 并列的「第四种深度生成模型」,但在数学上它们与 score-based 模型是同一族。
三个名字,同一族:
- DDPM(Denoising Diffusion Probabilistic Models, Ho et al. 2020):以概率论视角描述——前向加噪是马尔可夫链,反向去噪也是。
- NCSN(Noise Conditioned Score Network, Song & Ermon 2019):以 score function(对数概率密度的梯度 ∇log p(x))视角描述——学习在不同噪声水平下的 score。
- SDE(Score-Based Generative Modeling through Stochastic Differential Equations, Song et al. 2021):用随机微分方程统一了上述两个视角。
与 VAE 的关系:扩散模型可以看作「无限步的层级 VAE」——加噪每一步相当于 VAE 中的一个编码层,去噪相当于解码。这不是完全并列的关系,而是有数学联系的。详见 Luo 2022 的统一视角综述。
7. Transformer(架构)与扩散/自回归(生成机制)是正交概念
Section titled “7. Transformer(架构)与扩散/自回归(生成机制)是正交概念”争议本质:把 Transformer 和自回归混为一谈,或把 Transformer 和扩散模型看作对立。
Transformer 是一种网络架构(用自注意力替代循环),自回归(autoregressive)和扩散(diffusion)是生成机制(如何一步步生成数据)。二者是正交(独立)的维度,可以自由组合:
| 自回归 | 扩散 | |
|---|---|---|
| Transformer | GPT 系列(逐词生成) | DiT/Stable Diffusion 3(逐步去噪) |
| CNN | PixelCNN(逐像素生成) | DDPM(U-Net 逐步去噪) |
具体例子:
- GPT = Transformer 架构 × 自回归生成(一个词一个词地吐出来)
- Sora = Transformer 架构 × 扩散生成(DiT 架构,逐步去噪生成视频帧)
- 原始 DDPM = U-Net(CNN 架构) × 扩散生成
8. BERT、CLIP 不是生成模型
Section titled “8. BERT、CLIP 不是生成模型”争议本质:BERT 和 CLIP 经常被误归入「生成式 AI」,但它们都不是生成模型。
BERT(Bidirectional Encoder Representations from Transformers):
- 架构是 encoder-only(只用 Transformer 的编码器部分),训练方式是掩码语言建模(Masked Language Modeling, MLM)——随机遮住 15% 的 token,让模型根据上下文猜测被遮住的词。
- 它的输出是表示向量(embedding),用于分类、信息抽取等理解任务。它不能「从头生成一段文本」。
- 虽然理论上可以逐个 mask 然后填空来生成文本,但这不是它的设计用途,效果也很差。
CLIP(Contrastive Language-Image Pre-training):
- 用对比学习(contrastive learning,拉近匹配的图文对、推远不匹配的)将图像和文本映射到同一向量空间。
- 它是一个表征模型(判别式),告诉你图像和文本有多匹配,但不会生成新图像或新文本。
- DALL-E 和 Stable Diffusion 使用了 CLIP(CLIP 作为文本理解组件),但 CLIP 本身不生成图像。
9. YOLO 版本号不代表传承关系
Section titled “9. YOLO 版本号不代表传承关系”争议本质:YOLO(You Only Look Once)从 v1 到最新版的编号看起来是线性传承,但实际上从 v4 起就是多团队并立开发。
谱系梳理:
- YOLOv1–v3:Joseph Redmon 原作者团队。
- YOLOv4:Alexey Bochkovskiy(Darknet 社区),Redmon 已宣布退出计算机视觉研究。
- YOLOv5:Ultralytics 公司(Glenn Jocher),工程化做得好但学术新意有争议。
- YOLOv6(美团)、YOLOv7(原团队 Wang 等人)、YOLOv8/v11(Ultralytics)——各自独立开发。
- YOLO-X、PP-YOLO(百度)等也在各自的生态中使用 YOLO 名号。
引用时需说明具体版本,不能笼统说「YOLO 算法」。学术编号(目前到 v13)和工业旗舰版本号(如 YOLO26,Ultralytics 用日期命名)是两套不同的编号系统,容易混淆。
10. RLHF 的归类——是 RL 还不是 RL?
Section titled “10. RLHF 的归类——是 RL 还不是 RL?”争议本质:RLHF(Reinforcement Learning from Human Feedback,基于人类反馈的强化学习)到底算强化学习,还是只是借用了 RL 的名词?
RLHF 的标准流程:
- SFT(Supervised Fine-Tuning,监督微调):用人工写的高质量回答微调 LLM。
- 奖励模型(Reward Model):用人类对模型输出的偏好排序数据训练一个打分模型。
- PPO(Proximal Policy Optimization):用奖励模型的分数作为奖励信号,用强化学习算法优化 LLM 策略。
第 3 步用的是 PPO,这是标准的策略梯度强化学习算法,所以经典 RLHF 确实属于强化学习范畴。
但 DPO 不是 RL:DPO(Direct Preference Optimization, 2023)跳过了训练奖励模型和 PPO 的步骤,直接从偏好数据中优化策略——本质上是监督学习。所以 DPO 实现了与 RLHF 相似的目标(对齐人类偏好),但方法上不是强化学习。把它也称为「RLHF」是名词滥用。
11. AI 寒冬的次数——只有两次是公认的
Section titled “11. AI 寒冬的次数——只有两次是公认的”争议本质:到底有几次「AI 寒冬」(AI Winter,资金和支持大幅削减的时期)?
两次公认的寒冬:
- 第一次:约 1974–1980。起因包括 Lighthill Report(1973,英国政府对 AI 研究价值的负面评估)、DARPA 大幅削减资助、感知机局限性暴露(Minsky 1969 的 Perceptrons 一书指出单层感知机连 XOR 都解决不了)。
- 第二次:约 1987–1993。起因是 LISP 机器市场崩溃(专用硬件被通用工作站取代)、专家系统维护成本高昂且泛化能力差。
起止年份各来源有分歧(有人把第一次的起点定在 1969,有人定在 1974),但两次寒冬本身是公认的。
「第三次寒冬」?:有人认为 2023–2024 年随着 LLM 投资泡沫可能催生第三次寒冬,但这只是前瞻性讨论,目前(2026 年)AI 投资仍在高位,尚未形成共识。详见寒冬与热潮。
12. AI 效应——符号主义的历史贡献被低估
Section titled “12. AI 效应——符号主义的历史贡献被低估”争议本质:「AI 效应」(AI Effect)指一种心理倾向:一旦某项 AI 技术被充分理解和广泛应用,人们就不再认为它是 AI 了。
Pamela McCorduck 的经典说法是:「It’s part of computer science until it works; then it’s AI’s problem.」(一旦有效了就不归 AI 管)。更常见的表述是:「AI is whatever hasn’t been done yet.」(AI 就是那些还没做成的事)。
具体例子:
- A* 搜索:游戏寻路、地图导航都在用,但没人说 GPS 导航是 AI。
- Alpha-Beta 剪枝:深蓝下棋的核心算法,但今天人们认为下棋程序「不算 AI」。
- OCR(光学字符识别):曾被认为是 AI 的重大成就,现在只是「一个普通功能」。
- 垃圾邮件过滤:用了朴素贝叶斯/逻辑回归,但没人觉得 Gmail 的垃圾过滤是 AI。
这种效应导致符号主义 AI(搜索、规划、逻辑推理)的历史贡献常被公众低估——它们太「好用」了,以至于被踢出了 AI 的范畴。
13. 「AGI」的定义——每家公司都有自己的标准
Section titled “13. 「AGI」的定义——每家公司都有自己的标准”争议本质:通用人工智能(AGI, Artificial General Intelligence)至今没有公认的统一定义,不同研究者用这个词指代完全不同的东西。
常见的定义维度包括:
- 能力层面:能在所有认知任务上达到或超越人类水平。
- 自主性层面:能自主学习和适应未见过的任务,无需人类重新设计。
- 经济层面:能自动化绝大多数人类劳动。
争议焦点:如果 AI 在某些任务(如编程、数学)上超越人类,但在另一些(如物理操作)上不行,算不算 AGI?OpenAI、DeepMind、Anthropic 各有不同的 AGI 里程碑定义,部分原因是 AGI 的达成与商业利益(如微软与 OpenAI 的合同条款)直接挂钩。详见安全与对齐。
14. 「涌现能力」是真实现象还是测量假象?
Section titled “14. 「涌现能力」是真实现象还是测量假象?”争议本质:大语言模型表现出的「涌现能力」(Emergent Abilities,即模型规模超过某个阈值后突然解锁的新能力)是真实的相变现象,还是评估指标的统计假象?
- 支持方:Wei et al. 2022 发现某些任务(如多步算术、符号操作)在小模型上接近随机猜测,在大模型上突然跃升到高水平。
- 反对方:Schaeffer et al. 2023(Are Emergent Abilities of Large Language Models a Mirage?)认为这可能是评估指标选择造成的假象——如果用连续指标而非非黑即白(exact match)指标,「相变」就消失了。
这场争论至今未有定论,但它直接影响「是否需要继续扩大模型规模」的战略决策。
15. 大模型时代,「深度学习」和「基础模型」的关系
Section titled “15. 大模型时代,「深度学习」和「基础模型」的关系”争议本质:Bommasani et al. 2022 提出「基础模型」(Foundation Model)概念后,它和深度学习/大模型的分类关系如何界定?
基础模型指在大规模无标注数据上预训练、可适配多种下游任务的模型(GPT、BERT、CLIP 等)。争议在于:
- 基础模型不是一个新的技术类别——它仍是深度学习,用的还是 Transformer 等架构。
- 它是一种新的范式/应用模式(预训练 + 微调/提示),强调的是「训练一次 → 适配万物」的理念。
- 是否应该把基础模型作为独立分类,还是深度学习下的子类,学界尚无共识。