Skip to content

分类维度与全景图

本站旨在绘制人工智能与机器人技术的全景,并在尽可能多的方面让读者入门——不仅讲清每项技术”是什么、属于哪个大类”,更要让你看完能上手、能写代码、能理解实际产品背后的原理。全站现有 560+ 页内容,分为 AI 技术与机器人与 ROS两大组,覆盖数学基础、符号主义 AI、机器学习、深度学习、强化学习、生成式 AI、LLM 应用生态、模型部署、AI 工程开发、工业 AI,以及 ROS2、MoveIt 2、Nav2 导航、Gazebo 仿真、rosbag2 的完整谱系。本页是全站的总纲:用三个正交维度组织 AI 全景,并用一张分类树展示各大分支的位置。学习路径与导航见技术地图与学习路径。

AI 是一整片技术大陆:机器学习是从数据中学习的方法论,深度学习是其中的神经网络路线,生成式 AI 和 LLM 是当前最活跃的前沿,符号主义 AI 是与机器学习并列的另一条经典路线——而所有这些背后都有坚实的数学基础支撑。

如果你刚接触 AI,可以将这段话拆开来理解:

  • “从数据中学习”——区别于传统编程中”人工编写每一条规则”,机器学习让算法自己从大量样本中归纳模式。比如识别猫的图片,不是写”如果有尖耳朵+胡须+圆脸就是猫”,而是给模型看十万张标注好的猫的图片,让它自己学会”猫”的视觉特征。
  • “神经网络路线”——用模拟生物神经元互联的多层结构(人工神经网络)来实现学习。“深度”指的是网络有很多层,从而能逐层提取从简单(如边缘)到复杂(如人脸)的特征。
  • “最活跃的前沿”——2022 年 ChatGPT 发布以来,生成式 AI(能创造文本、图像、音频、视频等新内容的 AI)成为全球投入最大、进展最快的领域。2024-2025 年,OpenAI o1/o3、DeepSeek-R1 等**推理模型(Reasoning Model)**的出现,标志着 LLM 从”快思考”(直觉式回答)迈向”慢思考”(分步推理),AI 在数学竞赛和复杂编程上的能力大幅提升。

AI 技术可以沿三个正交维度分类——“正交”意味着这三个维度互相独立,就像空间中的 x/y/z 坐标,任何一项技术通常在每个维度上都有一个坐标。理解这三个维度,就能快速给任何新出现的技术”定位”。

维度一:范式维度——知识从哪来?

Section titled “维度一:范式维度——知识从哪来?”

这是最顶层的维度,回答的是**“AI 系统的知识是怎么获得的”**:

  • 符号主义(Symbolic AI / GOFAI):知识由人工显式编码——写成规则、逻辑公理、本体(Ontology,即某个领域的概念体系及概念间关系)。系统靠逻辑推理与搜索来求解问题。GOFAI(Good Old-Fashioned AI,“老派 AI”)是哲学家 John Haugeland 对这种范式的戏称。

    • 典型代表:20 世纪 80 年代盛行的专家系统(Expert System)——把人类专家的决策规则编码为 if-then 规则库。例如 MYCIN 系统用于诊断细菌感染。
    • 核心优势:推理过程可解释、可审计——你能看到每一步推导的逻辑链条。
    • 核心劣势:知识获取瓶颈——把专家的隐性知识转化为显式规则极其耗时,且很多”常识”难以用规则穷尽。
    • 详见:符号主义 AI。
  • 连接主义(Connectionism):知识从数据中学习,以神经网络为载体,即今天的深度学习路线。其核心思想是:不手工编码知识,而是让大量简单单元(“神经元”)互联成网络,通过调整连接权重来”学会”模式。

    • 典型代表:CNN 识别图片、Transformer 生成文本、扩散模型生成图像。
    • 核心优势:能自动学习特征表示(Representation)——即把原始数据(像素、文字)转化为模型可用的数学表达,无需人工设计特征;擅长处理感知类任务(视觉、语言)。
    • 核心劣势:像”黑箱”——模型学到了什么难以精确解释;需要大量数据和算力。
    • 详见:深度学习。
  • 行为主义 / 具身智能(Embodied AI):智能体(Agent)通过与环境交互、试错来涌现行为。Rodney Brooks 在 1990 年代提出包容架构(Subsumption Architecture),主张不需要中央推理系统,智能可以由简单的感知-行动模块层层叠加产生。今天的延伸是实体 AI(Physical AI)——让 AI 控制机器人在真实物理世界中行动,如自动驾驶、人形机器人。

  • 统计学习 / 概率方法:介于上述范式之间,使用概率论和统计模型来建模不确定性。**贝叶斯网络(Bayesian Network)**用图结构表达变量间的条件依赖关系,支持不确定性下的推理和学习。传统机器学习方法(SVM、决策树、朴素贝叶斯等)大多属于这一类。

2025 年的趋势——神经符号融合(Neuro-symbolic AI):当前的研究前沿不再是”选符号还是选连接”,而是将两者融合:用深度学习做感知和理解,用符号推理做逻辑推断和验证。例如,LLM 负责理解自然语言问题,形式化推理引擎(如 Lean、Z3 定理证明器)负责严格的逻辑推导。DeepMind 的 AlphaGeometry、AlphaProof 就是这一路线的代表——神经网络提供”直觉”猜测,符号引擎做严格验证。

维度二:学习方式维度——监督信号是什么?

Section titled “维度二:学习方式维度——监督信号是什么?”

这个维度主要用于机器学习内部,回答的是**“学习过程中使用什么类型的反馈信号”**:

学习方式监督信号通俗比喻典型任务
监督学习(Supervised Learning)每条数据都有人工标注的标准答案像做有标准答案的练习题图像分类(标注”猫/狗”)、房价预测
无监督学习(Unsupervised Learning)无标注,让模型自己发现数据中的结构像在一堆没有标签的文件中自己分类客户分群(聚类)、异常检测
强化学习(Reinforcement Learning, RL)不给标准答案,而是给”奖励”或”惩罚”像训狗——做对了奖励零食,做错了纠正AlphaGo 下棋、机器人学走路
半监督学习(Semi-supervised)少量标注 + 大量无标注练习题只有少量有答案,大部分自己做标注成本高的医学影像分析
自监督学习(Self-supervised)数据自身构造监督信号做填空题——把句子挖个空,自己猜LLM 预训练(预测下一个词)

自监督学习是 LLM 成功的关键:GPT 系列、LLaMA 等大语言模型的预训练,本质上是自监督学习——把互联网上海量文本拿来,遮住一些词让模型预测,不需要任何人工标注。这使得训练数据可以几乎无限扩展。正因为如此,LLM 才能积累如此丰富的世界知识。

强化学习与 LLM 的交叉——RLHF:2022 年以来,RLHF(Reinforcement Learning from Human Feedback,基于人类反馈的强化学习) 成为让 LLM “听话”的关键技术:让人类对模型的多个回答排序,训练一个奖励模型,再用强化学习优化 LLM 的输出。ChatGPT 的成功很大程度上归功于此。详见RLHF 与 LLM 训练。

维度三:任务/架构维度——解决什么问题、用什么结构?

Section titled “维度三:任务/架构维度——解决什么问题、用什么结构?”

这个维度有两个子轴:任务域(解决什么问题)和网络架构(用什么结构来解决)。

常见任务域:

  • 计算机视觉(Computer Vision, CV):让机器”看懂”图像和视频——包括图像分类、目标检测(找到图中物体的位置和类别)、图像分割(为每个像素标注类别)等。
  • 自然语言处理(Natural Language Processing, NLP):让机器”理解和生成”人类语言——包括机器翻译、文本摘要、问答系统、情感分析等。
  • 语音与音频(Speech & Audio):语音识别(ASR,将语音转为文字)、语音合成(TTS,将文字转为语音)、声纹识别等。
  • 机器人与具身智能(Robotics & Embodied AI):让 AI 控制物理实体在真实世界中行动。
  • 规划与决策(Planning & Decision-making):在复杂环境中规划最优行动序列。

主要网络架构:

架构擅长的任务类型核心思想代表模型
CNN(卷积神经网络)图像、视频等网格化数据用卷积核(小窗口)扫描图像,提取局部特征(边缘→纹理→物体部件→物体)ResNet、YOLO、U-Net
RNN / LSTM(循环神经网络)序列数据(文本、时序、语音)网络有”记忆”,逐个处理序列元素并保留前文信息LSTM、GRU(已被 Transformer 大幅取代)
Transformer文本(现也扩展到图像、音频、视频)自注意力机制(Self-Attention)——让序列中每个元素直接与所有其他元素”交流”,并行处理,无需循环GPT、BERT、LLaMA、ViT
扩散模型(Diffusion Model)图像/视频/音频生成先逐步给数据加噪声,再学习逆向去噪过程来生成新样本Stable Diffusion、Sora、DALL·E
Mixture of Experts (MoE)大规模高效推理/训练模型内部包含多个”专家”子网络,每次只激活最相关的几个专家,从而在总参数量巨大的情况下保持较低的推理成本DeepSeek-MoE、Mixtral、GPT-4(据传)

“架构 × 任务”的交叉:架构和任务域是正交的。比如 ViT(Vision Transformer)就是把 Transformer 架构应用到 CV 任务的产物;Whisper 是 Transformer 应用到语音识别的产物;Sora 是 Transformer 应用到视频生成的产物。理解了这一点,看到任何新模型你都能快速定位:它用的是什么架构,解决的是什么任务。

端到端学习(End-to-End Learning):这是深度学习带来的一个重要范式转变。传统方法把任务拆成多个手工设计的阶段(如人脸识别:人脸检测→特征点定位→特征提取→比对),每个阶段独立优化。端到端学习则是直接从原始输入到最终输出训练一个统一的神经网络,让模型自己学习所有中间步骤。优点是避免了每个阶段的误差累积和信息损失,缺点是需要更多数据且更难解释。

下图以”范式 + 技术路线”为主轴,展示全站两大组、20 个分类的全景速览:

如何看懂这棵树:结构上,深度学习与强化学习都从属于机器学习大框架(前者是神经网络路线,后者是与监督/无监督并列的第三范式);生成式 AI 是深度学习内部按”模型目标”划分的子族——当模型的目标不是”分类”或”预测”,而是”创造新内容”时,就进入生成式 AI 的范畴;LLM 应用生态建立在生成式 AI 之上,关注如何用 LLM 构建实际应用;语音音频与 AI 应用产品则是面向实际使用的延伸。

2025 年的热点:推理模型(o1/o3、DeepSeek-R1)在”生成式 AI”与”强化学习”的交叉地带崛起——它们用强化学习训练 LLM 的分步推理能力;**MCP(Model Context Protocol)**作为连接 LLM 与外部工具/数据源的开放协议,正在 Agent 生态中快速普及;多模态(一个模型同时理解文本、图像、音频、视频)已成为新模型的标配而非加分项。

每大区域的完整细分见各分类章节:

AI 技术:数学基础、符号主义 AI、传统机器学习、深度学习、强化学习、语音与音频、生成式 AI、LLM 应用生态、AI 应用与产品、模型部署、AI 工程开发、工业 AI、其他交叉分支、历史演进、速查与参考。

机器人与 ROS:机器人与 ROS2、MoveIt 2 机械臂、Nav2 导航、Gazebo 仿真、rosbag2 数据。