本页是全站的导航枢纽:从技术全景出发,帮你快速定位”我在哪、可以去哪”,并给出从零到入门的学习路径。全站现有 800+ 页内容,按 AI 技术、计算机视觉、机器人与 ROS、激光雷达 四大组组织。分类框架的由来见分类维度与全景图。
| 大组 | 内容定位 | 适合谁 |
|---|
| AI 技术 | 数学基础、机器学习、深度学习、生成式 AI、LLM 应用、语音、部署与工程 | 学算法、做 AI 应用 |
| 计算机视觉 | 视觉架构与任务、OpenCV 教程(104 篇)、Open3D 教程(36 篇) | 做图像/三维方向 |
| 机器人与 ROS | ROS 2、MoveIt 2、Nav2、Gazebo、rosbag2、具身智能 | 做机器人开发 |
| 激光雷达 | SLAM、标定、感知、滤波、工业场景应用与技术专题 | 做 LiDAR/三维感知 |
| 分类 | 页面数 | 你会学到什么 |
|---|
| 数学基础 | 42 | 线性代数、概率统计、梯度下降、损失函数、正则化、数据工程、训练工程、分布式训练、量化推理——AI 的数学地基与工程底座 |
| 符号主义 AI | 12 | 搜索、规划、逻辑推理、专家系统、知识图谱——AI 的另一条经典路线 |
| 传统机器学习 | 25 | 决策树、SVM、随机森林、聚类、推荐系统、时间序列、异常检测——深度学习之前的方法体系 |
| 深度学习 | 18 | Transformer、RNN、注意力、GNN、训练技巧、NLP 基础——神经网络与训练方法论主线 |
| 强化学习 | 15 | Q-learning、PPO、AlphaGo、RLHF、多智能体——从试错中学习 |
| 语音与音频 | 11 | ASR、TTS、声纹识别、音频分离——语音交互与音频处理 |
| 生成式 AI | 34 | 扩散模型、GAN、ControlNet、LoRA、视频生成——AI 创作与多模态 |
| LLM 应用生态 | 40 | Prompt 工程、RAG、Agent、MCP、微调、推理优化、VLM——LLM 应用开发 |
| AI 应用与产品 | 18 | ChatGPT、Claude、Cursor、ComfyUI 等——实际产品拆解 |
| 模型部署 | 5 | CV 部署(ONNX/TensorRT)、LLM 部署(vLLM/Ollama)、量化加速、GPU 多卡——从模型到上线 |
| AI 工程开发 | 12 | Linux、Shell、Git、Docker、Python 工程进阶、AI 后端、MLOps——工程落地全栈 |
| 工业 AI | 5 | 工业视觉、通信协议、3D 视觉与机器人、工业 AI 系统——产线落地 |
| 其他交叉分支 | 5 | 进化计算、量子 ML、脉冲神经网络——前沿与边缘 |
| 历史演进 | 2 | 1950–2026 时间线、两次寒冬——理解 AI 怎么走到今天 |
| 速查与参考 | 3 | 术语归属速查、分类争议、参考来源 |
| 分类 | 页面数 | 你会学到什么 |
|---|
| 视觉架构 | 5 | CNN、ResNet、EfficientNet、MobileNet、ViT——为图像设计的网络架构 |
| 视觉任务 | 13 | 目标检测(YOLO/DETR)、分割、跟踪、光流、OCR、深度估计、点云——从图像中读出结构化信息 |
| OpenCV 教程 | 104 | 核心模块、图像处理、特征检测、相机标定、DNN、目标检测——官方教程中文版 |
| Open3D 教程 | 36 | 点云、网格、可视化、配准管线、数据集——三维数据处理官方教程中文版 |
如果你已经知道某个技术名称,想知道它在全景中的位置,这里给出”从技术名到分类坐标”的速查。每条标注从属链与一句话解释。
- 机器学习(ML):AI 的子领域——“从数据中学习规律,而非人工编码规则”。它是方法论的集合,不是某一种算法。
- 深度学习(DL):机器学习的子集——用多层神经网络自动学习数据的特征表示。深度学习的突破在于:以前特征要靠专家手工设计(Feature Engineering),现在模型自己学。
- 表示学习(Representation Learning):深度学习的核心能力——模型逐层学到越来越抽象的表示:从边缘到纹理,再到”毛茸茸+尖耳朵”这样的语义组合。
- 决策树(Decision Tree):传统 ML → 监督学习。一棵 if-else 流程图,直观、可解释,但单棵树容易过拟合。
- 随机森林(Random Forest):传统 ML → 集成学习 → bagging 分支。训练很多棵决策树投票决定结果——“三个臭皮匠顶个诸葛亮”。详见集成学习与随机森林。
- SVM(支持向量机):传统 ML → 监督学习。找到让不同类别间隔最大化的”最优分界面”。深度学习崛起前最强大的分类器之一。详见支持向量机。
- CNN(卷积神经网络):深度学习三大架构族之一,为网格化数据(图像)设计。核心是卷积核在图像上滑动的”局部感知”机制。详见卷积神经网络。
- YOLO:深度学习 → CNN → 目标检测 → 单阶段检测器。“You Only Look Once”——一次前向就输出所有检测结果,适合实时检测。详见目标检测与 YOLO。
- RNN / LSTM:深度学习 → 序列模型。RNN 用”循环连接”获得记忆;LSTM 解决了长序列的梯度消失问题。2017 年前是 NLP 主力,后被 Transformer 取代。
- Transformer:深度学习三大架构族之一。核心是自注意力机制——序列中每个元素直接与所有其他元素计算关联,可高度并行化。当今几乎所有 LLM 的基础架构。详见Transformer 架构。
- ViT(Vision Transformer):Transformer × CV。把图像切成小块(Patch)当”词”处理,证明 Transformer 是通用架构。
- MoE(Mixture of Experts):深度学习 → 稀疏激活架构。门控路由器每次只激活最相关的几个”专家”子网络——总参数 671B、每次推理仅用 37B(DeepSeek-V3),兼顾容量与效率。
- 扩散模型(Diffusion Model):深度生成模型 → score-based。训练网络逐步去噪:推理时从纯噪声反复去噪生成新图片。详见扩散模型。
- GAN(生成对抗网络):深度生成模型 → 对抗训练。生成器(造假者)与判别器(鉴定者)博弈共进。2014-2020 图像生成主流,后被扩散模型大量取代。详见GAN 生成对抗网络。
- ControlNet:扩散模型的可控生成扩展——通过草图、姿态、深度图等条件精确控制生成结果。详见ControlNet。
- LoRA(Low-Rank Adaptation):参数高效微调(PEFT) 方法。冻结原模型,只训练注入的低秩旁路矩阵——几张图片、极少显存即可定制风格。详见LoRA 训练。
- 大语言模型(LLM):Transformer → 预训练语言模型。海量文本上预训练(预测下一个词),再经指令微调与 RLHF 成为对话助手。详见LLM 演进。
- 推理模型(Reasoning Model):LLM 新范式——先生成长链思维链(CoT)再作答的”慢思考”。o1 开启、DeepSeek-R1 以开放权重复现;在数学、编程上远超传统 LLM,代价是更多推理时计算。
- RAG(检索增强生成):LLM 应用技术——生成前先从外部知识库检索相关内容作为上下文,缓解”知识截止”与”幻觉”。详见RAG 检索增强生成。
- Agent(智能体):LLM 应用技术——自主规划任务、调用工具、观察结果、迭代行动,完成多步复杂任务。详见Agent 与智能体。
- MCP(Model Context Protocol):Anthropic 2024 年底提出的开放协议——标准化 LLM 与外部工具/数据源的连接(“AI 的 USB 接口”)。详见MCP 与工具使用。
- RLHF:强化学习 × LLM。人类排序回答 → 训练奖励模型 → 用 PPO 优化 LLM 符合人类偏好。ChatGPT 成功的关键技术之一。详见RLHF 与 LLM 训练。
- ASR(语音识别):语音 → 文字。代表系统:OpenAI Whisper。
- TTS(语音合成):文字 → 语音。方向是从”机器味”走向真人级自然语音。
- 详见语音与音频。
- ROS 2(Robot Operating System):机器人组各分类的公共底座——节点/话题/服务通信中间件。详见关于 ROS。
- SLAM(同步定位与建图):机器人 → Nav2 / 激光雷达组。一边建地图一边定位自己。详见激光 SLAM。
- 点云(Point Cloud):三维感知的基础数据结构。传统方法见点云,Python 处理见 Open3D 教程。
- 具身智能(Embodied AI):AI 与物理实体融合——智能在”大脑-身体-环境”交互中产生。详见Physical AI 总览。
学习路径按七大模块组织,与全栈培训体系对齐。
- “机器学习”和”深度学习”不是并列关系,是从属关系(DL ⊂ ML ⊂ AI)。深度学习特指用多层神经网络的那一支。
- 深蓝(Deep Blue)不是机器学习的胜利。1997 年击败卡斯帕罗夫的深蓝,核心是 Minimax 搜索 + Alpha-Beta 剪枝 + 人工评估函数——它不是”学习”出来的。
- AlphaGo 用了深度学习 + 强化学习(与深蓝不同)。用神经网络学习棋盘评估和落子概率,是真正的”从经验中学习”。
- BERT、CLIP 不是生成模型。BERT 是掩码语言模型(理解文本),CLIP 是对比学习模型(图文匹配)——都不”生成”新内容。
- Transformer 是”架构”,自回归/扩散是”生成机制”。GPT 用 Transformer 做自回归,Sora 用 Transformer 做扩散——同一架构承载不同机制。
- “涌现能力”不是设计出来的。参数量跨过临界点后突然出现新能力(算术、写代码)的现象;但它是否真实存在仍有争议,部分研究认为可能是评估指标非线性造成的假象。
- “开源模型”≠“开放权重模型”。LLaMA、DeepSeek-R1 等通常只公开权重,训练代码与数据不完全透明,更准确的叫法是”开放权重(open-weight)”。
- OpenCV 不只是”传统视觉”。它的 DNN 模块可以加载 ONNX 等推理模型做检测识别——在边缘设备上常用 OpenCV DNN 替代重型推理框架。
更多争议见分类争议与易错点。