深度学习概览
本页说明深度学习(Deep Learning)在整个 AI 分类体系中的位置,并给出全景分类树。深度学习是机器学习的子集,特指使用多层神经网络自动学习层级化特征表示的方法,区别于依赖手工特征工程的传统机器学习(见 经典机器学习)。
深度学习 = 让计算机自动学会”怎么看数据”。传统机器学习需要人工设计特征(花瓣长度、纹理统计量等),深度学习用多层神经网络自动从原始数据中逐层提取特征——从像素到边缘、从边缘到部件、从部件到物体。
一个神经元在做什么
Section titled “一个神经元在做什么”单个神经元(Neuron)的本质是一个加权求和 + 非线性激活的运算单元:
输入: x = [x1, x2, ..., xn] (上一层传来的特征)权重: w = [w1, w2, ..., wn] (网络学习的参数,决定每个输入的重要性)偏置: b (一个标量,调整激活阈值)
步骤1 — 线性组合: z = w1*x1 + w2*x2 + ... + wn*xn + b步骤2 — 激活函数: a = f(z) (f 可以是 ReLU、Sigmoid 等)
输出: a (传给下一层)- 权重 w 是网络通过训练学到的参数——它决定了”这个输入特征有多重要”。训练深度学习,本质上就是在寻找一组最优的 w 和 b。
- 激活函数 f 引入非线性。如果去掉激活函数,多层线性组合仍是一次线性变换(矩阵乘法可合并),网络就无法拟合弯曲的决策边界——深度就失去了意义。
- ReLU(Rectified Linear Unit) 是最常用的激活函数:
f(z) = max(0, z)。z > 0 时原样输出,z ≤ 0 时输出 0。它计算极简、梯度不会像 Sigmoid 那样在深层网络中消失,是现代深度学习的默认选择。
一整层神经元并行计算,可以用矩阵乘法表示:A = f(W·X + B),其中 W 是权重矩阵、X 是输入矩阵。GPU 天生擅长大规模矩阵乘法——这就是为什么深度学习离不开 GPU。
三大架构族各自的直觉
Section titled “三大架构族各自的直觉”- CNN = 手持放大镜扫图:拿一个小窗口在图片上逐块滑动,每次只关注局部——先看到边缘和线条,再组合成角和形状,最后拼出”眼睛""鼻子""猫脸”。核心是局部观察 + 逐层抽象。卷积核(Convolution Kernel,也称 Filter)就是那个”放大镜”——一个小尺寸的可学习权重矩阵(如 3×3),在图像上滑动,每滑到一个位置就和覆盖的像素做逐元素乘加,输出一个标量。一个 3×3 的卷积核滑过整张图,就生成一张特征图(Feature Map),记录了”这种局部模式在图像各处出现了多强”。
- RNN = 有记忆的流水线:像流水线上每个工位,处理当前零件的同时还记着上游传来的信息——读到”今天天气真___“时,要记得前面的”天气真”才能填出”好”。核心是有状态、按顺序处理。RNN(Recurrent Neural Network,循环神经网络)在每个时间步 t 都执行:
h_t = f(W_h · h_{t−1} + W_x · x_t + b),其中 是上一步的”记忆”,x_t 是当前输入。 - Transformer = 全员开会:所有词同时在场,互相”看”谁和自己最相关——不像 RNN 排队传话,而是直接并行沟通,算得快、看得全局。核心是注意力机制 + 并行计算。Self-Attention 的核心运算是:
Attention(Q, K, V) = softmax(Q·K^T / √d_k) · V,其中 Q(Query,查询)、K(Key,键)、V(Value,值)都是输入经过线性变换得到的。直观理解:Q 是”我在找什么”,K 是”别人有什么”,两者点积就是”相关程度”,softmax 归一化后作为权重对 V 加权求和——让每个位置都能直接关注序列中所有其他位置。
三大架构对比
Section titled “三大架构对比”三大架构的关键区别:
| 维度 | CNN | RNN | Transformer |
|---|---|---|---|
| 核心操作 | 卷积(局部加权求和) | 循环(带记忆的状态更新) | 自注意力(全局相关性计算) |
| 感受野 | 局部(随层数增大) | 理论上无限(实际受限) | 全局(一步到位) |
| 并行性 | 空间维度高度并行 | 必须逐步串行 | 完全并行(序列内所有位置同时计算) |
| 位置感知 | 内置(卷积位置敏感) | 内置(按时间步处理) | 无(需额外的位置编码) |
| 计算复杂度 | O(k·n)(k 为核大小) | O(n·d²)(n 为序列长度) | O(n²·d)(n 为序列长度) |
| 擅长领域 | 图像、视频 | 短序列、实时流 | 长序列、语言、多模态 |
常见误解:三大架构族是并列关系,不是演进替代关系。ViT 不是”CNN 的进化版”,而是”去卷积化”的全新尝试(详见 Transformer 架构)。反向传播是训练算法(链式法则求梯度),不是一种网络模型。
深度学习发展简史
Section titled “深度学习发展简史”1943 McCulloch & Pitts 提出第一个数学神经元模型(M-P 模型)1957 Rosenblatt 发明感知机(Perceptron)——第一个可学习的单层神经网络1969 Minsky 出版《Perceptrons》指出单层网络无法解决 XOR 问题 → 第一次 AI 寒冬1986 Rumelhart, Hinton & Williams 在 Nature 普及反向传播算法(Backpropagation)1989 LeCun 发明 LeNet(卷积神经网络用于手写数字识别) Hornik 证明万能逼近定理:含一个隐藏层的 MLP 可逼近任意连续函数1997 Hochreiter & Schmidhuber 提出 LSTM(长短期记忆网络),解决 RNN 梯度消失1998 LeNet-5 商用于美国邮政系统支票识别——深度学习最早的工业落地之一2006 Hinton 提出深度信念网络(DBN),"Deep Learning"一词开始流行2009 ImageNet 数据集发布(120 万张标注图像)——大规模标注数据成为催化剂2012 ★ AlexNet 在 ImageNet 竞赛中将错误率从 26% 降到 15% → 深度学习引爆 使用 GPU 训练 + ReLU 激活 + Dropout 正则化 → 现代深度学习技术栈确立2014 Goodfellow 提出 GAN(生成对抗网络);Kingma 提出 VAE VGG 和 GoogLeNet 证明"更深更好"2015 ★ ResNet 引入残差连接(Residual Connection),训练 152 层网络成为可能 核心公式:y = F(x) + x(跳过一层直接加到输出,梯度可直达浅层)2017 ★ Vaswani et al. 提出 Transformer → "Attention Is All You Need" 自注意力机制取代 RNN,成为序列建模的新范式2018 BERT(Google)和 GPT(OpenAI)发布 → 预训练语言模型时代开启2020 ViT(Vision Transformer)证明 Transformer 也能做视觉 AlphaFold 2 解决蛋白质结构预测——深度学习的科学应用里程碑2021 CLIP / DALL·E → 多模态学习兴起2022 ★ ChatGPT 发布 → 大语言模型走向大众,Transformer 生态全面爆发 Stable Diffusion → 扩散模型 democratize 图像生成2023 LLaMA 系列开源 → 开源大模型生态崛起2024 Sora(OpenAI)视频生成;多模态大模型(GPT-4o)成为趋势 Diffusion Transformer(DiT)成为生成模型新架构2025 ★ MoE(混合专家模型)大规模普及 → 万亿参数模型推理成本骤降 原生多模态模型(端到端处理文本+图像+音频+视频) SSM/Mamba 线性复杂度长序列建模进入实用阶段 世界模型(World Model)与具身智能(Embodied AI)加速融合动手实践:用 PyTorch 搭一个 MLP
Section titled “动手实践:用 PyTorch 搭一个 MLP”MLP(多层感知机,Multi-Layer Perceptron)是最简单的深度学习模型——全连接层堆叠 + 激活函数。先从这个”Hello World”开始:
import torchimport torch.nn as nn
# 定义一个简单的多层感知机class MLP(nn.Module): def __init__(self, in_dim, hidden_dim, out_dim): super().__init__() self.net = nn.Sequential( nn.Linear(in_dim, hidden_dim), # 第一层:输入→隐藏层 nn.ReLU(), # 激活函数:引入非线性 nn.Linear(hidden_dim, out_dim), # 输出层:隐藏→分类 )
def forward(self, x): return self.net(x)
model = MLP(in_dim=784, hidden_dim=128, out_dim=10) # MNIST: 28×28→128→10类print(model)print(f"总参数量: {sum(p.numel() for p in model.parameters()):,}")# 输出示例: 总参数量: 101,770一个完整的训练循环
Section titled “一个完整的训练循环”理解训练循环(Training Loop)是深度学习的核心——所有框架的训练代码本质上都是这个流程的变体:
import torch.optim as optimfrom torch.utils.data import DataLoader
# 1. 准备数据加载器(假设已定义 train_dataset)train_loader = DataLoader(train_dataset, batch_size=64, shuffle=True)
# 2. 定义损失函数和优化器criterion = nn.CrossEntropyLoss() # 多分类交叉熵损失optimizer = optim.Adam(model.parameters(), lr=1e-3) # Adam 优化器
# 3. 训练循环model.train() # 切换到训练模式(启用 Dropout / BatchNorm 更新)for epoch in range(10): total_loss = 0 for batch_x, batch_y in train_loader: # Step 1: 前向传播——数据经过网络得到预测 logits = model(batch_x)
# Step 2: 计算损失——衡量预测与真实标签的差距 loss = criterion(logits, batch_y)
# Step 3: 反向传播——自动计算每个参数的梯度 optimizer.zero_grad() # 清空上一步的残余梯度(PyTorch 梯度是累加的) loss.backward() # 链式法则从 loss 向前逐层计算梯度
# Step 4: 参数更新——沿梯度反方向走一小步 optimizer.step() # w = w - lr * gradient
total_loss += loss.item() print(f"Epoch {epoch+1}, Loss: {total_loss/len(train_loader):.4f}")关键概念解释:
- 批量(Batch)与批大小(Batch Size):每次不把全部数据喂给网络,而是取一小批(如 64 个样本)。太小则梯度噪声大、GPU 利用率低;太大则显存不够且泛化可能变差。常用值:32、64、128、256。
- Epoch(轮次):遍历完整个训练集一次叫一个 epoch。通常训练几十到几百个 epoch。
- 梯度(Gradient):损失函数对每个参数的偏导数,指示”参数往哪个方向调一点能让 loss 下降最快”。
- 优化器(Optimizer):决定如何使用梯度更新参数。SGD 是最基础的(
w = w - lr * grad),Adam 是最常用的(自适应调整每个参数的学习率,收敛快、调参少)。
训练的数学原理:梯度下降与反向传播
Section titled “训练的数学原理:梯度下降与反向传播”深度学习的目标是最小化损失函数 L(w),其中 w 是所有可学习参数的集合。梯度下降的核心思想:
重复执行: w ← w - lr * ∂L/∂w
其中: w — 模型参数(权重和偏置) lr — 学习率(Learning Rate),控制每步走多大 ∂L/∂w — 损失函数对参数的梯度(偏导数)直观理解:想象你蒙着眼站在山坡上,目标是走到谷底(loss 最小处)。你用脚探一探哪个方向最陡(计算梯度),然后朝下坡方向迈一小步(参数更新)。学习率就是步子大小——太大可能跨过谷底到对面的山坡(loss 爆炸),太小则半天走不到底(收敛极慢)。
反向传播(Backpropagation)
Section titled “反向传播(Backpropagation)”反向传播是高效计算梯度的算法——利用链式法则从输出端向输入端逐层计算偏导数。
前向传播: x → h1 → h2 → ... → y_pred → Loss反向传播: Loss → ∂L/∂y → ∂L/∂h_n → ∂L/∂h_{n-1} → ... → ∂L/∂w1
链式法则: ∂L/∂w_layer_k = ∂L/∂h_k * ∂h_k/∂w_layer_k每个中间结果只需计算一次、反向传递一次,计算量与前向传播同一量级。现代框架(PyTorch、TensorFlow)自动构建计算图(Computational Graph)并自动执行反向传播——开发者只需写前向传播,调用 loss.backward() 即可。
调参核心法则
Section titled “调参核心法则”- 先跑通再优化:深度学习容易”调参地狱”。先用小数据集、简单架构跑通全流程(数据加载→模型→训练循环→评估),再逐步加深网络、调超参。
- GPU 几乎是必需品:CPU 上训练 CNN/Transformer 极慢。用
device = torch.device("cuda" if torch.cuda.is_available() else "cpu")做设备适配,或用 Colab 免费 GPU。 - 过拟合是头号问题:训练 loss 持续降但验证 loss 开始升 = 过拟合(Overfitting,即模型”死记”了训练数据而非学到通用规律)。对策:Dropout(随机丢弃部分神经元,迫使网络不过度依赖个别特征)、数据增强(Data Augmentation,通过翻转、裁剪、旋转等方式扩充训练数据)、早停(Early Stopping,验证 loss 不再降时停止训练)、减小模型。
- 学习率最关键:学习率太大 → loss 爆炸(NaN);太小 → 收敛极慢。先用
1e-3(Adam)做基线,再根据 loss 曲线调整。
学习率调度策略
Section titled “学习率调度策略”固定学习率不是最优的。业界常用的学习率调度(Learning Rate Schedule)策略:
Warmup(预热): 前 N 步从极小值线性增长到目标学习率 → 避免训练初期梯度过大导致参数震荡
Cosine Annealing(余弦退焦): lr(t) = lr_min + 0.5*(lr_max - lr_min)*(1 + cos(π*t/T)) → 学习率按余弦曲线缓慢下降,后期精细调优
Step Decay(阶梯衰减): 每 M 个 epoch 学习率乘以 γ(如 0.1) → 简单有效,ResNet 训练经典策略实践中最流行的组合是 Warmup + Cosine Annealing:先用几百到几千步 warmup 到峰值学习率(通常 1e-3 ~ 1e-4),然后按余弦曲线缓慢降到接近 0。几乎所有现代大模型(BERT、GPT、ViT)都用这种策略。
常用正则化方法
Section titled “常用正则化方法”正则化(Regularization)是防止过拟合的技术统称:
- L2 正则化(Weight Decay):在损失函数中加入权重的平方和惩罚
L_total = L + λ * Σ(w_i²),迫使权重保持较小值,防止单个特征主导。AdamW 优化器将 weight decay 解耦,效果优于 Adam + L2。 - Dropout:训练时随机将部分神经元的输出置零(丢弃率 p 通常为 0.1~0.5),测试时不丢弃但输出乘以 (1-p)。效果类似于训练了多个子网络的集成。
- Batch Normalization:对每层的每个特征做标准化(均值为 0、方差为 1),再用可学习的参数缩放和偏移。加速训练收敛、允许使用更大学习率、有一定的正则化效果。
- Layer Normalization:对每个样本的所有特征做标准化(不像 BN 是跨样本),广泛用于 Transformer 和 RNN。
损失函数选择速查
Section titled “损失函数选择速查”| 任务类型 | 常用损失函数 | 说明 |
|---|---|---|
| 二分类 | Binary Cross-Entropy (BCE) | 配合 Sigmoid 输出 |
| 多分类 | Cross-Entropy Loss | 配合 Softmax 输出 |
| 回归 | MSE (L2 Loss) / MAE (L1 Loss) | MSE 对离群值敏感,MAE 更鲁棒 |
| 目标检测 | Focal Loss / Smooth L1 | Focal Loss 解决类别不平衡 |
| 分割 | Dice Loss + Cross-Entropy | Dice 直接优化 IoU 指标 |
| 对比学习 | InfoNCE / Triplet Loss | 拉近正样本对、推远负样本对 |
- 图像分类:电商平台的商品图片自动归类、手机相册按人脸和场景自动整理,CNN 骨干网络(如 ResNet)是工业界标配方案。
- 目标检测:安防摄像头实时检测入侵人员、自动驾驶系统识别前方车辆与行人,YOLO 系列凭借实时推理能力占据主流(见 目标检测与 YOLO)。
- 语音识别:微信语音转文字、讯飞输入法实时听写,深度学习(LSTM / Transformer)将识别准确率推到接近人类水平。
- 机器翻译:Google 翻译、DeepL 支持上百种语言互译,Transformer 架构是当前神经机器翻译的核心引擎。
- 推荐系统:抖音、YouTube 的个性化内容推荐背后,深度学习用于用户兴趣建模和内容特征提取,直接影响每日上亿用户的信息流体验。
- 蛋白质结构预测:AlphaFold 2 利用深度学习从氨基酸序列预测三维结构,解决了困扰生物学界 50 年的难题,获 2024 年诺贝尔化学奖。
- 科学计算:AI4Science 领域用深度学习加速天气预报(GraphCast)、材料发现、药物分子设计,正在改变传统科研范式。
2025-2026 前沿趋势
Section titled “2025-2026 前沿趋势”MoE 混合专家模型
Section titled “MoE 混合专家模型”MoE(Mixture of Experts,混合专家模型)是让大模型”按需激活”的技术:模型包含多个”专家”子网络(如 8 个或 64 个 FFN 层),每次推理只激活其中 1-2 个最相关的专家。效果是参数量巨大但单次推理计算量小——DeepSeek-V3 用 6710 亿总参数但每次只激活 370 亿,以接近 GPT-4 的性能实现了远低于 GPT-4 的推理成本。2025 年 MoE 已成为开源大模型的标配架构。
原生多模态模型
Section titled “原生多模态模型”2025 年的趋势是从”拼接式多模态”(分别用视觉编码器和语言模型再拼接)转向”原生多模态”——模型从一开始就在统一的 Transformer 架构中同时处理文本、图像、音频和视频。代表如 GPT-4o、Gemini 2.0、Qwen2.5-Omni,能实时理解语音语调和视频画面,推理延迟大幅降低。
状态空间模型 SSM / Mamba
Section titled “状态空间模型 SSM / Mamba”Transformer 的自注意力复杂度是 O(n²)(n 为序列长度),处理超长序列(10 万 token 以上)时显存和计算成为瓶颈。SSM(State Space Model,状态空间模型)路线以线性复杂度 O(n) 建模长序列,Mamba(2023)通过选择性状态机制让 SSM 达到与 Transformer 相当甚至更好的语言建模质量。2025 年 Mamba-2 和 Jamba(AI21)等混合架构已进入实用阶段,在长文档、基因组序列等领域展现优势(详见 Mamba 与状态空间模型)。
世界模型与具身智能
Section titled “世界模型与具身智能”世界模型(World Model)指能理解和预测物理世界动态的模型——输入当前状态和动作,预测下一时刻的世界状态。2025 年,结合大模型的视觉理解能力与机器人控制,具身智能(Embodied AI)加速发展:机器人不再依赖硬编码规则,而是用大模型理解自然语言指令、感知环境、规划动作。代表项目包括 Google 的 RT-2、Figure 02 人形机器人、Tesla Optimus 等。
Diffusion Transformer(DiT)
Section titled “Diffusion Transformer(DiT)”将 Transformer 架构引入扩散模型(Diffusion Model),替代传统的 U-Net 去噪网络。Sora(OpenAI)和 Stable Diffusion 3 都采用 DiT 架构,证明了 Transformer 的可扩展性(Scaling Law)在视频生成领域同样有效——模型越大、数据越多,生成质量越好。2025 年 DiT 已成为视频生成和图像生成的主流架构选择。
测试时扩展(Test-Time Scaling)
Section titled “测试时扩展(Test-Time Scaling)”传统观点认为推理阶段计算量固定。2024-2025 年的研究表明,在推理时给予更多计算(如让模型生成思维链、自我验证、多次采样选优),可以显著提升输出质量。OpenAI 的 o1/o3 系列和 DeepSeek-R1 是这一方向的代表——通过强化学习训练模型在推理时”多想几步”,在数学和编程任务上大幅超越同参数量的标准模型。
本节共 30 个子页面,按主题归为五大类(历史脉络标注于括号内,详见各子页面)。
深度学习(Deep Learning ⊂ ML)├── 核心架构│ ├── CNN 主线(Neocognitron 1980 → LeNet → AlexNet 2012 → ResNet 2015)│ ├── 目标检测与 YOLO(R-CNN 两阶段 → YOLO/SSD 单阶段)│ ├── 图像分割(FCN/U-Net 语义分割 → Mask R-CNN 实例分割)│ ├── RNN 循环神经网络(Elman 1990 → LSTM 1997 → GRU 2014)│ ├── Transformer 架构(Vaswani et al. 2017,自注意力 + 并行计算)│ ├── 视觉Transformer ViT(2020,去卷积化的视觉建模)│ ├── 注意力机制(Self/Cross Attention、Soft/Hard Attention)│ ├── 注意力机制变体(Sparse/Linear/Multi-Query/Flash Attention)│ └── Mamba与状态空间模型(SSM 路线,线性复杂度长序列建模)├── 训练与优化范式│ ├── 迁移学习(预训练 + 微调,工业落地标配)│ ├── 自监督学习(对比学习 SimCLR/MoCo、掩码学习 MAE)│ ├── 模型压缩与加速(剪枝、量化、蒸馏、稀疏化)│ ├── 神经架构搜索 NAS(自动化网络设计,ENAS/DARTS)│ └── 对抗样本与防御(Adversarial Attack 与鲁棒性)├── 视觉应用任务│ ├── OCR 文字识别(CRNN、CTC、注意力解码)│ ├── 姿态估计(2D/3D 关键点,OpenPose/HRNet)│ ├── 深度估计与3D视觉(单目深度、NeRF、点云)│ ├── 点云处理(PointNet/PointNet++、自动驾驶 3D 感知)│ ├── 图像复原与超分辨率(去噪/去模糊、SRCNN/ESRGAN)│ ├── 光流与视频理解(FlowNet、VideoMAE、时空建模)│ ├── 视觉问答与图像描述(VQA 多模态推理)│ ├── 图像描述生成(Show and Tell、CNN+LSTM、BLIP)│ ├── 传统计算机视觉(OpenCV、SIFT/HOG、阈值/分水岭分割)│ └── 传统方法 vs 深度学习(手工特征 vs 自动学习特征)├── 语言与图结构│ ├── NLP 自然语言处理基础(分词、Word2Vec、文本分类)│ └── 图神经网络 GNN(GCN/GAT/GraphSAGE,非欧数据)└── 前沿学习范式 ├── 联邦学习(Federated Learning,隐私保护分布式训练) ├── 元学习(Meta-Learning,学会学习,MAML) └── 持续学习(Continual Learning,克服灾难性遗忘)- 深度学习概览:深度学习在 AI 体系中的定位与三大架构直觉
- CNN 主线:从 Neocognitron 到 ResNet 的经典卷积架构里程碑
- 目标检测与 YOLO:两阶段 vs 单阶段检测器,YOLO 全系演进
- 图像分割:U-Net 语义分割与 Mask R-CNN 实例分割
- RNN 循环神经网络:LSTM/GRU、seq2seq 与注意力机制的诞生
- Transformer 架构:自注意力、多头注意力、位置编码的原理与实现
- 视觉Transformer ViT:将 Transformer 迁移到视觉的 Patch 化建模路线
- 注意力机制:Self/Cross Attention、Soft/Hard Attention 原理详解
- 注意力机制变体:Sparse/Linear/Multi-Query/Flash Attention 等提效方案
- Mamba与状态空间模型:SSM 路线,以线性复杂度建模长序列
- 自监督学习:对比学习(SimCLR/MoCo)与掩码学习(MAE)
- 迁移学习:预训练 + 微调,跨任务知识复用
- 模型压缩与加速:剪枝、量化、知识蒸馏、稀疏化
- 图神经网络 GNN:GCN/GAT/GraphSAGE 处理非欧几里得数据
- NLP 自然语言处理基础:分词、Word2Vec、文本分类
- OCR 文字识别:CRNN + CTC 与注意力解码的文本识别流程
- 姿态估计:2D/3D 关键点检测(OpenPose、HRNet)
- 深度估计与3D视觉:单目深度估计、NeRF、点云处理
- 点云处理:PointNet/PointNet++、自动驾驶 3D 感知
- 图像复原与超分辨率:去噪去模糊与 SRCNN/ESRGAN 超分
- 光流与视频理解:FlowNet、VideoMAE 等时空建模方法
- 视觉问答与图像描述:VQA 跨模态推理任务
- 图像描述生成:Show and Tell、CNN+LSTM、BLIP 等描述生成
- 传统计算机视觉:OpenCV、SIFT/HOG、阈值/分水岭分割等经典 CV 方法
- 传统方法 vs 深度学习:手工特征 vs 自动学习特征的发展脉络与对比
- 对抗样本与防御:FGSM/PGD 攻击与模型鲁棒性防御
- 联邦学习:隐私保护的分布式训练范式
- 元学习:学会学习,MAML 等少样本学习方法
- 持续学习:克服灾难性遗忘的终身学习方法
- 神经架构搜索 NAS:ENAS/DARTS 等自动化网络设计
典型类库与工具
Section titled “典型类库与工具”| 类库 | 语言 | 说明 |
|---|---|---|
| PyTorch | Python | Meta 维护的深度学习框架,动态计算图、调试友好,学术界主流 |
| TensorFlow / Keras | Python | Google 维护的深度学习框架,Keras 提供简洁高层 API,工业界广泛使用 |
| JAX | Python | Google 出品的高性能数值计算框架,函数式编程范式,自动并行化 |
| torchvision | Python | PyTorch 官方视觉工具库,提供常用模型(ResNet、VGG 等)与数据增强工具 |
| timm | Python | 收集大量预训练 CNN 与 ViT 模型的第三方库,一行代码即可加载 |
| HuggingFace Transformers | Python | 提供 Transformer 系列模型的预训练权重与统一 API,覆盖 NLP/CV |
| OpenCV | C++/Python | 计算机视觉经典库,提供图像读写、变换、标注可视化等基础操作 |
| 术语 | 英文 | 解释 |
|---|---|---|
| 深度学习 | Deep Learning | 使用多层神经网络自动学习层级化特征表示的机器学习方法 |
| 神经网络 | Neural Network | 由大量神经元互连组成的计算模型,深度学习的基本结构 |
| 反向传播 | Backpropagation | 利用链式法则从输出向输入逐层计算梯度的训练算法 |
| 激活函数 | Activation Function | 引入非线性的函数(如 ReLU),使网络能拟合复杂映射 |
| 损失函数 | Loss Function | 衡量模型预测与真实值差距的函数,训练的目标是最小化它 |
| 梯度下降 | Gradient Descent | 沿损失函数梯度反方向更新参数以逐步降低误差的优化方法 |
| 学习率 | Learning Rate | 控制每次参数更新步长的超参数,过大导致发散、过小收敛极慢 |
| 过拟合 | Overfitting | 模型在训练集上表现好但在新数据上泛化差,是深度学习的头号问题 |
| 批量归一化 | Batch Normalization | 对每层输入做标准化,加速收敛并有一定正则化效果 |
| 残差连接 | Residual Connection | 将输入直接跳过若干层加到输出上(y=F(x)+x),解决深层网络梯度消失 |
| 注意力机制 | Attention Mechanism | 让模型动态决定关注输入的哪些部分,Transformer 的核心组件 |
| 专家混合 | Mixture of Experts (MoE) | 包含多个专家子网络,每次只激活最相关的部分,实现稀疏计算 |
| 状态空间模型 | State Space Model (SSM) | 用状态方程建模序列,线性复杂度,Mamba 是其代表变体 |
- “深度学习”之名源于 2006 年 Hinton 等的深度信念网络(DBN)逐层预训练工作,此后”深度学习”逐渐取代”神经网络”成为主流称呼。
- 感知机由 Rosenblatt 1957 提出 / 1958 发表;反向传播由 Werbos 1974 首次应用于神经网络,Rumelhart, Hinton & Williams 1986 在 Nature 普及(归属有优先权争议)。
- He et al.,「Deep Residual Learning for Image Recognition」(CVPR 2016):ResNet 论文,残差连接是现代深度网络的基础结构。
- Vaswani et al.,「Attention Is All You Need」(NeurIPS 2017):Transformer 原论文,改变了整个 AI 领域的技术方向。
- LeCun, Bengio & Hinton,「Deep Learning」(Nature 2015):三位图灵奖得主联合撰写的深度学习综述,经典入门文献。