Skip to content

传统CV与深度学习对比

计算机视觉领域存在两条技术路线:依赖手工特征与经典算法的传统方法,以及端到端学习的深度学习方法。理解两者各自的优势边界与适用场景,是做出合理工程选型的前提。本页逐任务横向对比,并给出混合方案的实践指南。前置阅读:传统计算机视觉与 OpenCV、CNN 主线、目标检测与 YOLO。

把视觉系统想象成两种不同的工厂流水线:

  • 传统 CV 工厂 = 手工作坊。老师傅(算法工程师)拿着固定的工具(Sobel、HOG、Canny),对每张图执行一套固定工序:先磨皮、再描边、再量尺寸、最后分类。每道工序的原理都写在手册上,出了问题能逐工序排查。但每来一个新产品(新任务),就得重新设计一套工序。
  • 深度学习工厂 = 智能车间。你给它几千张成品照片和标签,它自己摸索出最优工序——精度通常吊打手工作坊,但车间是黑箱,你没法说清第 3 道工序到底在干嘛。换新产品时只要重新喂数据训练,不用改设备。
  • 混合工厂 = 最务实的方案——前段用传统方法做廉价的预处理(裁剪、校正、滤波),中段交给深度学习做核心判断(检测、分类),后段再用传统方法做后处理(跟踪、测量)。各取所长。
  • 基础模型工厂(2024-2026 新趋势) = 一个万能车间,用海量数据训练一个超大模型(如 SAM 2、DINOv2),你不需要给它喂数据——直接用 prompt(提示词、点击、框选)告诉它你想干什么。这正在模糊”传统”和”深度学习”的界限:大模型像传统方法一样”即插即用”,又像深度学习一样”端到端学习”。

传统计算机视觉建立在信号处理与射影几何之上。以下是几个核心方法的数学原理:

SIFT(尺度不变特征变换)

SIFT 是手工特征设计的巅峰之作,它的目标是在不同尺度、旋转、光照下都能检测到稳定的特征点(keypoint)。流程如下:

  1. 尺度空间极值检测:对图像做高斯模糊(不同 σ 值),得到”尺度空间金字塔”。在相邻尺度的差分高斯(DoG) 图中寻找局部极值点(比上下左右 26 个邻居都大或都小)。DoG 是不同 σ 的高斯模糊之差,近似拉普拉斯-高斯(LoG):
DoG(x,y,σ)=L(x,y,kσ)−L(x,y,σ)L(x,y,σ)=I(x,y)∗G(x,y,σ)\begin{aligned} \text{DoG}(x, y, \sigma) &= L(x, y, k\sigma) - L(x, y, \sigma) \\ L(x, y, \sigma) &= I(x, y) * G(x, y, \sigma) \end{aligned}

其中 L(x,y,σ)L(x, y, \sigma) 即原图 II 与高斯核 GG 的卷积。

  1. 关键点定位:用泰勒展开精修位置,用 Hessian 矩阵剔除边缘响应点(边缘点不稳定)。
  2. 方向分配:在关键点邻域内计算梯度方向直方图(36 个 bin,每 10° 一个),取峰值方向作为主方向——这赋予 SIFT 旋转不变性。
  3. 描述子生成:在关键点周围 16×16 窗口内,按 4×4 子区域计算 8 方向梯度直方图,得到 4×4×8 = 128 维特征向量。

HOG(方向梯度直方图)

HOG 的核心思想:局部物体的外观和形状可以通过梯度方向分布来描述。流程:

  1. 预处理:灰度化 + Gamma 校正(压缩高光区域)
  2. 计算梯度:Gx=I(x+1,y)−I(x−1,y)G_x = I(x+1,y) - I(x-1,y),Gy=I(x,y+1)−I(x,y−1)G_y = I(x,y+1) - I(x,y-1),幅值 =Gx2+Gy2= \sqrt{G_x^2 + G_y^2},方向 =arctan⁡(Gy/Gx)= \arctan(G_y / G_x)
  3. 分 cell(如 8×88 \times 8 像素),每 cell 内建 9 bin 方向直方图(0°∼180°0° \sim 180°)
  4. block 归一化:2×22 \times 2 个 cell 组成 block,L2 归一化后滑动
  5. 拼接所有 block 的直方图 → 最终特征向量(如 3780 维)

HOG 对光照变化有一定鲁棒性,但在大角度旋转和尺度变化下会失效——这是手工特征的共同弱点。

Canny 边缘检测

Canny 是最优边缘检测器的经典实现,包含五个步骤:

  1. 高斯滤波去噪:G(x,y)=12πσ2×exp⁡(−x2+y22σ2)G(x,y) = \frac{1}{2\pi\sigma^2} \times \exp\left(-\frac{x^2+y^2}{2\sigma^2}\right)
  2. Sobel 算子计算梯度幅值和方向
  3. 非极大值抑制(NMS):沿梯度方向只保留局部最大值,细化边缘
  4. 双阈值检测:高阈值确定”强边缘”,低阈值连接”弱边缘”
  5. 连通性分析:弱边缘只有与强边缘相连才保留

NMS(Non-Maximum Suppression,非极大值抑制) 这个概念后来被深度学习目标检测(YOLO、Faster R-CNN)直接复用——当多个检测框重叠时,只保留置信度最高的那个。

深度学习为什么能超越手工特征

Section titled “深度学习为什么能超越手工特征”

深度学习的核心优势在于特征学习——传统方法需要人手工设计特征(SIFT 128 维、HOG 3780 维),而深度网络从数据中自动学习最优特征表示。以 CNN 为例:

输入图像 [3×224×224]
→ Conv1: 学习边缘、颜色斑块 [64×112×112]
→ Conv2: 学习角点、纹理 [128×56×56]
→ Conv3: 学习部件、模式 [256×28×28]
→ Conv4: 学习物体级语义概念 [512×14×14]
→ 全局池化 → 全连接 → 分类

每一层都是通过反向传播(Backpropagation) 端到端优化的——损失函数的梯度从输出层逐层回传,每一层的卷积核参数都根据”对最终任务有没有帮助”来调整。这意味着特征层级是任务驱动的:做分类就学到判别性特征,做分割就学到边界敏感特征,做检测就学到位置敏感特征。

相比之下,传统方法的特征提取(SIFT/HOG)是固定的——不因任务变化,也不因数据变化。这就是为什么在复杂任务上深度学习通常能大幅领先。

各 CV 任务的传统方法 vs 深度学习逐项对比

Section titled “各 CV 任务的传统方法 vs 深度学习逐项对比”

以下逐任务对比两种路线的代表方法与性能特点:

图像分类

维度传统方法深度学习
代表方法SIFT/HOG 特征 + SVM / KNNResNet / ViT / CLIP / DINOv2
精度ImageNet top-5 约 70%ImageNet top-5 约 99%
数据需求数百张可起步数万张起步(或用预训练迁移)
推理速度CPU 毫秒级GPU 毫秒级,CPU 较慢
特征可解释性明确(梯度/边缘/纹理)弱(需 Grad-CAM 等可视化)

SVM(Support Vector Machine,支持向量机):传统分类器,寻找最优分割超平面使类别间隔最大化。在小数据场景下精度不错,但难以处理高维非线性特征。

目标检测

维度传统方法深度学习
代表方法Haar 级联 / HOG+SVM / DPMYOLOv8~v12 / Faster R-CNN / DETR / RT-DETR
精度受遮挡/多尺度影响大鲁棒性强,mAP 大幅领先
速度Haar 实时;DPM 较慢YOLOv8/v11 实时;RT-DETR 实时;两阶段较慢
类别数通常单类或极少类轻松支持 80+ 类(COCO)
架构滑动窗口 + 特征分类端到端回归(单阶段)或 RPN + ROI Pooling(两阶段)

mAP(mean Average Precision):目标检测的标准评价指标,对每个类别计算 PR 曲线下面积再取平均。mAP@0.5 表示 IoU 阈值 0.5 时的 mAP。

语义/实例分割

维度传统方法深度学习
代表方法分水岭 / 区域生长 / Graph CutU-Net / DeepLab v3+ / Mask R-CNN / SAM 2
精度边界粗糙,复杂场景失败像素级精度,实例级区分
适用场景简单/高对比度分割通用场景,SAM 2 可零样本分割任意物体

SAM 2(Segment Anything Model 2, Meta 2024):基础分割模型,通过点击/框选/文本提示即可分割任意物体,支持视频,被称为”视觉领域的 GPT 时刻”。

特征提取与匹配

维度传统方法深度学习
代表方法SIFT / ORB / SURFSuperPoint / R2D2 / LoFTR / DKM
精度弱纹理/大基线下失败弱纹理区域表现更好
速度ORB 极快;SIFT 中等GPU 加速后接近实时
可解释性描述子有明确几何含义学习到的描述子是黑箱
泛化性需人工调参应对新场景数据驱动泛化,但域偏移仍有问题

目标跟踪

维度传统方法深度学习
代表方法KCF / MOSSE / MeanshiftDeepSORT / ByteTrack / SiamRPN / SAMURAI
精度简单场景可用复杂场景(遮挡/多目标)优势显著
速度CPU 实时需 GPU
架构相关滤波 / 直方图匹配ReID 网络 + 关联匹配 / 孪生网络跟踪

SAMURAI(2024):基于 SAM 2 增强的视频目标跟踪方法,利用 SAM 2 的零样本分割能力实现了对任意目标的高质量长时跟踪。

深度估计

维度传统方法深度学习
代表方法立体匹配(SGM/BM)MiDaS / Depth Anything V2 / DPT
精度双目标定后精度高单目尺度模糊,但泛化好
硬件需双目/结构光硬件单张图即可估计
2025 最新—Depth Anything V2 在精细结构上大幅提升

Depth Anything V2(2024):基于大规模合成数据训练的单目深度估计基础模型,在边界和精细结构上的精度远超以往方法。

图像超分辨率

维度传统方法深度学习
代表方法双三次插值 / LanczosEDSR / SRCNN / Real-ESRGAN / HAT
精度模糊,无细节恢复PSNR/感知质量大幅领先
速度极快需 GPU
评估维度传统 CV深度学习
精度复杂任务受限复杂任务显著领先
推理速度CPU 即可,嵌入式极快需 GPU 才实用,NPU/TPU 可加速
数据需求少量甚至零样本大量标注数据(或预训练迁移)
可解释性每步骤数学明确黑箱,可解释性弱(可用 Grad-CAM 缓解)
部署成本轻量,内存占用小模型大,显存要求高(可用量化/蒸馏压缩)
泛化能力光照/视角敏感,域偏移严重数据多样时泛化更强
开发效率每个任务需调参设计管线数据驱动,跨任务复用强
长尾鲁棒性分布外样本易崩溃同样有域偏移问题,但更可控
跨任务迁移每个任务独立设计基础模型可零样本处理多任务
  • 嵌入式 / 边缘设备无 GPU:单片机(如 STM32)、低端 ARM 设备上跑深度学习不现实,传统算法(如 Haar 人脸检测)用纯 CPU 即可实时。
  • 实时性要求极高:高速产线(如每秒上百个零件的质检)或超低延迟要求(微秒级响应),传统方法的确定性和低开销不可替代。
  • 标注数据极少:只有几十张样本时,深度学习严重过拟合;传统方法(模板匹配、特征匹配)无需训练即可工作。
  • 可解释性是硬性要求:医疗、金融、安全审计等场景要求”模型为什么这么判”,传统方法的每一步都可追溯到数学定义。
  • 作为深度学习的预处理管线:图像校正、裁剪 ROI、去噪、颜色标准化——这些经典操作用 OpenCV 比训练网络更高效可靠。
  • 精确几何计算:相机标定、三维重建、SLAM(同时定位与地图构建)中的 Bundle Adjustment——这些需要精确几何建模的任务,传统优化方法仍是主力。深度学习可以辅助(如学习深度先验),但核心求解器仍是传统几何方法。
  • 精度要求高:比赛、产品差异化竞争——YOLO 的 mAP 远超 HOG+SVM。
  • 标注数据充足:有数千到数百万标注样本,深度学习是利用数据的最佳方式。
  • 任务复杂多变:多类别、多尺度、遮挡严重、场景多样——深度学习的端到端学习天然适合。
  • GPU / NPU 硬件可用:服务器、高配工作站、带 NPU 的移动芯片(如骁龙 8 Gen3、天玑 9300)都能高效推理。
  • 需要零样本/少样本能力:使用 SAM 2、DINOv2、CLIP 等基础模型,无需收集标注数据即可开箱即用。

混合方案:传统预处理 + DL 推理

Section titled “混合方案:传统预处理 + DL 推理”

工业级视觉系统极少只用一种路线,典型的混合管线:

  1. 传统预处理(OpenCV):图像去畸变、透视矫正、ROI 裁剪、色彩归一化、背景减除——用确定性算法快速处理,降低后续网络输入复杂度。
  2. DL 核心推理:YOLO 检测目标、U-Net 分割病灶、SAM 2 交互式分割、ResNet 分类——处理传统方法力不从心的复杂判断。
  3. 传统后处理(OpenCV):用 ByteTrack/DeepSORT 做目标跟踪、用形态学操作精修分割掩膜、用几何测量算实际尺寸——将深度学习输出转化为可用的结构化结果。

例如智能交通系统:OpenCV 做车牌定位 → YOLO 精确检测车牌 → OCR 网络识别字符 → OpenCV 校验和格式化输出。

传统方法靠手工设计的不变性(SIFT 对尺度/旋转不变),深度学习靠数据增强来获得鲁棒性。常见增强策略:

# 视觉数据增强( torchvision / albumentations )
几何变换:随机翻转、随机裁剪、随机旋转、弹性形变
色彩变换:亮度/对比度/饱和度抖动、直方图均衡
质量退化:高斯噪声、JPEG 压缩、模糊(模拟低质量输入)
高级增强:MixUp(两图叠加混合)、CutMix(裁剪拼接)、Mosaic(4 图拼接,YOLOv4+ 标志性增强)

MixUp:将两张训练图像按比例 α 混合(x = λ×x₁ + (1-λ)×x₂),标签也按比例混合。这相当于在输入空间做了线性插值正则化,能有效减少过拟合。CutMix 则是裁剪一张图的区域贴到另一张上——保留了局部纹理的真实性。YOLO 系列用的 Mosaic 是 CutMix 的扩展版:4 张图拼成 1 张,极大丰富了 batch 内的上下文多样性。

深度学习的学习率调度对最终精度影响巨大,常用策略:

  • 余弦退火(Cosine Annealing):lr(t)=lrmin+0.5×(lrmax−lrmin)×(1+cos⁡(πt/T))\text{lr}(t) = \text{lr}_{min} + 0.5 \times (\text{lr}_{max} - \text{lr}_{min}) \times (1 + \cos(\pi t / T)),学习率按余弦曲线从最大缓慢降到最小,是最常用的调度方式
  • 预热(Warmup):前 NN 步学习率从 0 线性升到 lrmax\text{lr}_{max},再开始余弦退火,防止训练初期学习率过大导致损失爆炸,大模型训练必备
  • OneCycle:先升后降的一个完整周期(fastai 的 lr_find + fit_one_cycle),超参数少,适合快速实验

量化与蒸馏:让大模型上边缘设备

Section titled “量化与蒸馏:让大模型上边缘设备”

深度学习模型的部署瓶颈在于模型体积和推理延迟。两种核心压缩技术:

量化(Quantization):将模型权重从 FP32(32 位浮点)降为 INT8(8 位整数),体积缩小 4 倍,推理速度提升 2~3 倍,精度损失通常 < 1%:

xquant=round(x/scale)+zero_pointscale=(xmax⁡−xmin⁡)/255\begin{aligned} x_{\text{quant}} &= \text{round}(x / \text{scale}) + \text{zero\_point} \\ \text{scale} &= (x_{\max} - x_{\min}) / 255 \end{aligned}

将浮点范围映射到 [0,255][0, 255]。

PTQ(Post-Training Quantization,训练后量化):直接对训练好的模型量化,只需少量校准数据。QAT(Quantization-Aware Training,量化感知训练):在训练过程中模拟量化误差,精度更高但需要重新训练。TensorRT、ONNX Runtime、OpenVINO 都支持这两种模式。

知识蒸馏(Knowledge Distillation):用一个大而精的教师模型指导一个小的学生模型训练。学生模型不仅学习真实标签,还学习教师模型的”软标签”(soft labels,即教师输出的概率分布):

Ltotal=α×Lhard(student,true_label)+(1−α)×KL(student_logits/T,teacher_logits/T)L_{\text{total}} = \alpha \times L_{\text{hard}}(\text{student}, \text{true\_label}) + (1-\alpha) \times \text{KL}(\text{student\_logits} / T, \text{teacher\_logits} / T)

其中 TT 是温度系数(T>1T > 1 使 softmax 输出更平滑,暴露类间关系),KL\text{KL} 是 KL 散度(衡量两个分布的差异),α\alpha 是权重系数,通常 0.5。

蒸馏让小模型学到”类间相似度”的暗知识(dark knowledge)——教师模型说”这是猫,但也有 3% 像狗”——这种信息比硬标签丰富得多。YOLOv8 和 Distilled ViT 就大量使用了蒸馏技术。

传统方法与深度学习各司其职的工业级流程:

同一任务对比:车牌定位——传统 OpenCV vs YOLO

Section titled “同一任务对比:车牌定位——传统 OpenCV vs YOLO”

传统方法用边缘 + 轮廓 + 形状过滤定位车牌,深度学习用预训练 YOLO 直接检测:

import cv2
# ===== 方法一:传统 OpenCV 定位车牌(无需训练,CPU 即可)=====
img = cv2.imread("car.jpg")
gray = cv2.cvtColor(img, cv2.COLOR_BGR2GRAY) # 转灰度
bilf = cv2.bilateralFilter(gray, 11, 17, 17) # 双边滤波保边去噪
edges = cv2.Canny(bilf, 30, 200) # Canny 边缘检测
contours, _ = cv2.findContours(edges, cv2.RETR_TREE, cv2.CHAIN_APPROX_SIMPLE)
# 筛选:宽高比在 2-5 之间、面积适中的矩形可能是车牌
for c in sorted(contours, key=cv2.contourArea, reverse=True)[:10]:
x, y, w, h = cv2.boundingRect(c)
if 2 < w / h < 5: # 车牌宽高比经验值
cv2.rectangle(img, (x, y), (x + w, y + h), (0, 255, 0), 2)
break
cv2.imshow("Traditional", img)
from ultralytics import YOLO
import cv2
# ===== 方法二:YOLO 直接检测车牌(精度高,需 GPU)=====
model = YOLO("yolov8n.pt") # 加载预训练 YOLOv8 纳米版
img = cv2.imread("car.jpg")
results = model(img, classes=[...]) # 推理(classes 指定车牌类别)
for box in results[0].boxes.xyxy: # 遍历检测框
x1, y1, x2, y2 = map(int, box[:4])
cv2.rectangle(img, (x1, y1), (x2, y2), (0, 0, 255), 2)
cv2.imshow("YOLO", img)
# 对比:YOLO 在复杂光照/角度下更鲁棒,传统方法在固定场景下更快更轻

模型量化示例(INT8 量化加速推理)

Section titled “模型量化示例(INT8 量化加速推理)”
import torch
# 训练后量化(Post-Training Quantization)
model = torch.load("resnet50.pth").eval()
# 方式一:PyTorch 动态量化(最简单,只量化全连接层)
quantized_model = torch.quantization.quantize_dynamic(
model, {torch.nn.Linear}, dtype=torch.qint8
)
# 模型体积约缩小到 1/4,CPU 推理速度提升 2-3x
# 方式二:完整 INT8 静态量化(需要校准数据,精度更高)
model.qconfig = torch.quantization.get_default_qconfig('fbgemm') # x86 CPU 后端
model_prepared = torch.quantization.prepare(model)
# 用少量校准数据跑前向传播,统计各层激活值的范围
for img in calibration_dataloader:
model_prepared(img)
model_int8 = torch.quantization.convert(model_prepared)
# INT8 模型可在普通 CPU 上实时推理,适合边缘部署
  • 不要无脑选深度学习:嵌入式、实时、小数据场景下传统方法往往更优。先问”我的约束是什么”,再选技术路线。
  • 传统方法做 ROI 提取能大幅加速:先用传统方法裁出感兴趣区域,再交给深度网络——输入分辨率降低后推理速度可提升数倍。
  • 数据增强是深度学习的必修课:传统方法靠手工特征的不变性(SIFT 对旋转不变),深度学习靠数据增强(随机翻转/裁剪/色彩抖动)来获得鲁棒性。
  • 域偏移是两种方法的共同敌人:训练集和测试集分布不同时(如实验室光照 vs 户外强光),两者都会退化。传统方法可用参数微调应对,深度学习可用域自适应(Domain Adaptation)或微调。2025 年的趋势是用更大的预训练模型来缓解域偏移——DINOv2、SAM 2 等基础模型在海量数据上训练后,对域变化的鲁棒性远超任务专用模型。
  • 可解释性要求下考虑注意力图:深度学习虽是黑箱,但可用 Grad-CAM / SHAP 等工具生成注意力热图,一定程度上满足审计需求。
  • 模型蒸馏让深度学习上边缘设备:大模型(教师)蒸馏出小模型(学生),配合量化(INT8),深度学习也能在树莓派级别设备上实时运行。
  • 2025 基础模型改变选型逻辑:SAM 2 做零样本分割、DINOv2 做零样本特征提取、Depth Anything V2 做零样本深度估计——很多以前需要大量标注数据的任务,现在用预训练基础模型 + 少量 prompt 就能解决。

传统 CV 与深度学习的竞争格局在 2024-2025 年出现了新的变量:

基础模型(Foundation Model)改变游戏规则

Section titled “基础模型(Foundation Model)改变游戏规则”

Meta 的 SAM 2(2024)和 Google 的 对应竞品让”分割”从需要大量标注数据的任务变成了零样本交互——点击一下或画个框,就能分割任意物体,甚至跨视频帧跟踪。这对传统分割方法(分水岭、Graph Cut)是降维打击。同样,DINOv2 让特征提取不再需要针对每个任务训练专用模型。

2024-2025 年,移动端 NPU 性能大幅提升(骁龙 8 Gen4 的 Hexagon NPU 算力超过 40 TOPS),加上 ONNX Runtime、TensorRT、Core ML、NCNN 等推理框架的优化,INT8 量化后的检测和分类模型在手机上可做实时推理。这意味着很多以前”传统方法才能跑”的边缘场景,现在深度学习也能胜任了。

视觉语言大模型(VLM)融合两条路线

Section titled “视觉语言大模型(VLM)融合两条路线”

GPT-4V、LLaVA、Qwen-VL 等视觉语言模型可以用自然语言指令完成检测、分割、OCR 等任务——用文本 prompt 代替代码调参,这在某种程度上像是”传统方法的灵活”与”深度学习的精度”的融合。不过当前 VLM 的推理速度仍远慢于专用模型,尚未在实时产线场景中替代传统管线。

在精确几何计算(相机标定、SLAM、三维重建、光流)和超低延迟场景(嵌入式实时控制)中,传统方法仍然是唯一选择。SLAM 系统(如 ORB-SLAM3、VINS-Fusion)的核心仍然是特征匹配 + Bundle Adjustment——这些需要精确数学建模的环节,端到端深度学习尚未能可靠替代。

  • 智能交通(ETC/违章检测):OpenCV 定位车牌区域 → YOLO 精检 → OCR 识别 → OpenCV 校验格式——混合管线的经典案例。
  • 工业质检产线:传统视觉做尺寸测量和模板匹配(确定性要求),深度学习做缺陷分类(复杂纹理识别)——两者互补。
  • 医疗影像辅助诊断:OpenCV 做 CT 窗口调整和配准 → U-Net / SAM 2 分割病灶 → 传统方法计算体积和位置——混合管线兼顾速度和精度。
  • 安防视频分析:背景减除(传统)做运动检测 → 行为识别网络(深度学习)判断异常——节省 GPU 算力只处理关键帧。
  • ARKit / ARCore:SLAM 跟踪(传统几何 + 优化)做实时定位 → 深度学习做语义分割理解场景——手机 AR 的技术底座。
  • 机器人导航:传统 SLAM + 路径规划做定位与运动,深度学习做场景理解和物体抓取——工业机器人和自动驾驶的标准架构。
类库路线说明
OpenCV传统传统 CV 全栈工具库,预处理与后处理首选
scikit-image传统Python 图像处理,科研和原型开发
PyTorch / torchvision深度学习主流深度学习框架,含预训练模型库
timm深度学习收录大量预训练 CNN/ViT(含 DINOv2/SAM 权重)
Ultralytics YOLO深度学习YOLOv8/v11/v12 系列,工业部署最广的目标检测方案
segment-anything-2 (Meta)深度学习SAM 2,零样本分割与视频跟踪基础模型
ONNX Runtime部署跨平台推理引擎,支持 INT8 量化,让深度学习模型在 CPU/移动端高效运行
OpenVINO部署Intel 的推理优化工具,加速传统与深度学习混合管线
TensorRT部署NVIDIA 的 GPU 推理加速库,支持 FP16/INT8 量化
术语英文解释
手工特征Hand-crafted Feature人工设计的特征提取方法(SIFT/HOG/Haar),区别于学习到的特征
端到端学习End-to-End Learning从原始输入直接到最终输出,整体优化,不拆分中间步骤
感兴趣区域ROI (Region of Interest)图像中需要重点分析的区域,先裁剪 ROI 可大幅降低计算量
域偏移Domain Shift训练数据与实际部署数据的分布差异,导致性能下降
模型蒸馏Knowledge Distillation用大模型(教师)指导小模型(学生)训练,实现模型压缩
注意力热图Attention Map / Grad-CAM可视化深度网络关注区域的工具,用于可解释性分析
数据增强Data Augmentation通过翻转/裁剪/色彩变换扩充训练数据,提升泛化能力
背景减除Background Subtraction从视频中分离前景运动目标的传统方法
量化Quantization将模型权重从 FP32 降为 INT8,减少显存占用、加速推理
非极大值抑制Non-Maximum Suppression (NMS)只保留重叠区域中置信度最高的检测框,消除冗余检测
Bundle AdjustmentBundle Adjustment多视图几何中的联合优化方法,同时调整相机参数和三维点位置
零样本Zero-shot无需针对新任务训练,直接用 prompt 或预训练能力处理
基础模型Foundation Model在海量数据上大规模预训练,可适配多种下游任务的大模型
知识的暗知识Dark Knowledge教师模型输出的软标签中包含的类间相似性信息
  • Szeliski,「Computer Vision: Algorithms and Applications」(2nd ed., 2022):传统 CV 经典教材,系统覆盖经典方法,免费在线。
  • Goodfellow et al.,「Deep Learning」第 9 章 (2016):深度学习经典教材中的卷积网络章节,对比理解两种范式。
  • Lowe,「Distinctive Image Features from Scale-Invariant Keypoints」(IJCV 2004):SIFT 论文,理解手工特征设计的经典。
  • Dalal & Triggs,「Histograms of Oriented Gradients for Human Detection」(CVPR 2005):HOG 论文,传统目标检测的代表作。
  • Redmon et al.,「You Only Look Once: Unified, Real-Time Object Detection」(CVPR 2016):YOLO 原始论文,端到端检测的开创之作,详见目标检测与 YOLO。
  • Kirillov et al.,「Segment Anything」(ICCV 2023):SAM 论文,基础分割模型的开创之作;SAM 2(2024)扩展到视频。
  • Depth Anything V2,「From Synthetic Data to Better Real-World Depth Estimation」(2024):单目深度估计基础模型,利用合成数据突破精度上限。
  • Zhao et al.,「OpenVINO: A Comprehensive Toolkit for AI Inference」(Intel, 2023):Intel 推理优化工具文档,理解混合管线部署的工程实践。