传统CV与深度学习对比
计算机视觉领域存在两条技术路线:依赖手工特征与经典算法的传统方法,以及端到端学习的深度学习方法。理解两者各自的优势边界与适用场景,是做出合理工程选型的前提。本页逐任务横向对比,并给出混合方案的实践指南。前置阅读:传统计算机视觉与 OpenCV、CNN 主线、目标检测与 YOLO。
把视觉系统想象成两种不同的工厂流水线:
- 传统 CV 工厂 = 手工作坊。老师傅(算法工程师)拿着固定的工具(Sobel、HOG、Canny),对每张图执行一套固定工序:先磨皮、再描边、再量尺寸、最后分类。每道工序的原理都写在手册上,出了问题能逐工序排查。但每来一个新产品(新任务),就得重新设计一套工序。
- 深度学习工厂 = 智能车间。你给它几千张成品照片和标签,它自己摸索出最优工序——精度通常吊打手工作坊,但车间是黑箱,你没法说清第 3 道工序到底在干嘛。换新产品时只要重新喂数据训练,不用改设备。
- 混合工厂 = 最务实的方案——前段用传统方法做廉价的预处理(裁剪、校正、滤波),中段交给深度学习做核心判断(检测、分类),后段再用传统方法做后处理(跟踪、测量)。各取所长。
- 基础模型工厂(2024-2026 新趋势) = 一个万能车间,用海量数据训练一个超大模型(如 SAM 2、DINOv2),你不需要给它喂数据——直接用 prompt(提示词、点击、框选)告诉它你想干什么。这正在模糊”传统”和”深度学习”的界限:大模型像传统方法一样”即插即用”,又像深度学习一样”端到端学习”。
传统 CV 的数学内核
Section titled “传统 CV 的数学内核”传统计算机视觉建立在信号处理与射影几何之上。以下是几个核心方法的数学原理:
SIFT(尺度不变特征变换)
SIFT 是手工特征设计的巅峰之作,它的目标是在不同尺度、旋转、光照下都能检测到稳定的特征点(keypoint)。流程如下:
- 尺度空间极值检测:对图像做高斯模糊(不同 σ 值),得到”尺度空间金字塔”。在相邻尺度的差分高斯(DoG) 图中寻找局部极值点(比上下左右 26 个邻居都大或都小)。DoG 是不同 σ 的高斯模糊之差,近似拉普拉斯-高斯(LoG):
其中 即原图 与高斯核 的卷积。
- 关键点定位:用泰勒展开精修位置,用 Hessian 矩阵剔除边缘响应点(边缘点不稳定)。
- 方向分配:在关键点邻域内计算梯度方向直方图(36 个 bin,每 10° 一个),取峰值方向作为主方向——这赋予 SIFT 旋转不变性。
- 描述子生成:在关键点周围 16×16 窗口内,按 4×4 子区域计算 8 方向梯度直方图,得到 4×4×8 = 128 维特征向量。
HOG(方向梯度直方图)
HOG 的核心思想:局部物体的外观和形状可以通过梯度方向分布来描述。流程:
- 预处理:灰度化 + Gamma 校正(压缩高光区域)
- 计算梯度:,,幅值 ,方向
- 分 cell(如 像素),每 cell 内建 9 bin 方向直方图()
- block 归一化: 个 cell 组成 block,L2 归一化后滑动
- 拼接所有 block 的直方图 → 最终特征向量(如 3780 维)
HOG 对光照变化有一定鲁棒性,但在大角度旋转和尺度变化下会失效——这是手工特征的共同弱点。
Canny 边缘检测
Canny 是最优边缘检测器的经典实现,包含五个步骤:
- 高斯滤波去噪:
- Sobel 算子计算梯度幅值和方向
- 非极大值抑制(NMS):沿梯度方向只保留局部最大值,细化边缘
- 双阈值检测:高阈值确定”强边缘”,低阈值连接”弱边缘”
- 连通性分析:弱边缘只有与强边缘相连才保留
NMS(Non-Maximum Suppression,非极大值抑制) 这个概念后来被深度学习目标检测(YOLO、Faster R-CNN)直接复用——当多个检测框重叠时,只保留置信度最高的那个。
深度学习为什么能超越手工特征
Section titled “深度学习为什么能超越手工特征”深度学习的核心优势在于特征学习——传统方法需要人手工设计特征(SIFT 128 维、HOG 3780 维),而深度网络从数据中自动学习最优特征表示。以 CNN 为例:
输入图像 [3×224×224] → Conv1: 学习边缘、颜色斑块 [64×112×112] → Conv2: 学习角点、纹理 [128×56×56] → Conv3: 学习部件、模式 [256×28×28] → Conv4: 学习物体级语义概念 [512×14×14] → 全局池化 → 全连接 → 分类每一层都是通过反向传播(Backpropagation) 端到端优化的——损失函数的梯度从输出层逐层回传,每一层的卷积核参数都根据”对最终任务有没有帮助”来调整。这意味着特征层级是任务驱动的:做分类就学到判别性特征,做分割就学到边界敏感特征,做检测就学到位置敏感特征。
相比之下,传统方法的特征提取(SIFT/HOG)是固定的——不因任务变化,也不因数据变化。这就是为什么在复杂任务上深度学习通常能大幅领先。
各 CV 任务的传统方法 vs 深度学习逐项对比
Section titled “各 CV 任务的传统方法 vs 深度学习逐项对比”以下逐任务对比两种路线的代表方法与性能特点:
图像分类
| 维度 | 传统方法 | 深度学习 |
|---|---|---|
| 代表方法 | SIFT/HOG 特征 + SVM / KNN | ResNet / ViT / CLIP / DINOv2 |
| 精度 | ImageNet top-5 约 70% | ImageNet top-5 约 99% |
| 数据需求 | 数百张可起步 | 数万张起步(或用预训练迁移) |
| 推理速度 | CPU 毫秒级 | GPU 毫秒级,CPU 较慢 |
| 特征可解释性 | 明确(梯度/边缘/纹理) | 弱(需 Grad-CAM 等可视化) |
SVM(Support Vector Machine,支持向量机):传统分类器,寻找最优分割超平面使类别间隔最大化。在小数据场景下精度不错,但难以处理高维非线性特征。
目标检测
| 维度 | 传统方法 | 深度学习 |
|---|---|---|
| 代表方法 | Haar 级联 / HOG+SVM / DPM | YOLOv8~v12 / Faster R-CNN / DETR / RT-DETR |
| 精度 | 受遮挡/多尺度影响大 | 鲁棒性强,mAP 大幅领先 |
| 速度 | Haar 实时;DPM 较慢 | YOLOv8/v11 实时;RT-DETR 实时;两阶段较慢 |
| 类别数 | 通常单类或极少类 | 轻松支持 80+ 类(COCO) |
| 架构 | 滑动窗口 + 特征分类 | 端到端回归(单阶段)或 RPN + ROI Pooling(两阶段) |
mAP(mean Average Precision):目标检测的标准评价指标,对每个类别计算 PR 曲线下面积再取平均。mAP@0.5 表示 IoU 阈值 0.5 时的 mAP。
语义/实例分割
| 维度 | 传统方法 | 深度学习 |
|---|---|---|
| 代表方法 | 分水岭 / 区域生长 / Graph Cut | U-Net / DeepLab v3+ / Mask R-CNN / SAM 2 |
| 精度 | 边界粗糙,复杂场景失败 | 像素级精度,实例级区分 |
| 适用场景 | 简单/高对比度分割 | 通用场景,SAM 2 可零样本分割任意物体 |
SAM 2(Segment Anything Model 2, Meta 2024):基础分割模型,通过点击/框选/文本提示即可分割任意物体,支持视频,被称为”视觉领域的 GPT 时刻”。
特征提取与匹配
| 维度 | 传统方法 | 深度学习 |
|---|---|---|
| 代表方法 | SIFT / ORB / SURF | SuperPoint / R2D2 / LoFTR / DKM |
| 精度 | 弱纹理/大基线下失败 | 弱纹理区域表现更好 |
| 速度 | ORB 极快;SIFT 中等 | GPU 加速后接近实时 |
| 可解释性 | 描述子有明确几何含义 | 学习到的描述子是黑箱 |
| 泛化性 | 需人工调参应对新场景 | 数据驱动泛化,但域偏移仍有问题 |
目标跟踪
| 维度 | 传统方法 | 深度学习 |
|---|---|---|
| 代表方法 | KCF / MOSSE / Meanshift | DeepSORT / ByteTrack / SiamRPN / SAMURAI |
| 精度 | 简单场景可用 | 复杂场景(遮挡/多目标)优势显著 |
| 速度 | CPU 实时 | 需 GPU |
| 架构 | 相关滤波 / 直方图匹配 | ReID 网络 + 关联匹配 / 孪生网络跟踪 |
SAMURAI(2024):基于 SAM 2 增强的视频目标跟踪方法,利用 SAM 2 的零样本分割能力实现了对任意目标的高质量长时跟踪。
深度估计
| 维度 | 传统方法 | 深度学习 |
|---|---|---|
| 代表方法 | 立体匹配(SGM/BM) | MiDaS / Depth Anything V2 / DPT |
| 精度 | 双目标定后精度高 | 单目尺度模糊,但泛化好 |
| 硬件 | 需双目/结构光硬件 | 单张图即可估计 |
| 2025 最新 | — | Depth Anything V2 在精细结构上大幅提升 |
Depth Anything V2(2024):基于大规模合成数据训练的单目深度估计基础模型,在边界和精细结构上的精度远超以往方法。
图像超分辨率
| 维度 | 传统方法 | 深度学习 |
|---|---|---|
| 代表方法 | 双三次插值 / Lanczos | EDSR / SRCNN / Real-ESRGAN / HAT |
| 精度 | 模糊,无细节恢复 | PSNR/感知质量大幅领先 |
| 速度 | 极快 | 需 GPU |
各自的优劣势综合分析
Section titled “各自的优劣势综合分析”| 评估维度 | 传统 CV | 深度学习 |
|---|---|---|
| 精度 | 复杂任务受限 | 复杂任务显著领先 |
| 推理速度 | CPU 即可,嵌入式极快 | 需 GPU 才实用,NPU/TPU 可加速 |
| 数据需求 | 少量甚至零样本 | 大量标注数据(或预训练迁移) |
| 可解释性 | 每步骤数学明确 | 黑箱,可解释性弱(可用 Grad-CAM 缓解) |
| 部署成本 | 轻量,内存占用小 | 模型大,显存要求高(可用量化/蒸馏压缩) |
| 泛化能力 | 光照/视角敏感,域偏移严重 | 数据多样时泛化更强 |
| 开发效率 | 每个任务需调参设计管线 | 数据驱动,跨任务复用强 |
| 长尾鲁棒性 | 分布外样本易崩溃 | 同样有域偏移问题,但更可控 |
| 跨任务迁移 | 每个任务独立设计 | 基础模型可零样本处理多任务 |
什么时候该用传统方法
Section titled “什么时候该用传统方法”- 嵌入式 / 边缘设备无 GPU:单片机(如 STM32)、低端 ARM 设备上跑深度学习不现实,传统算法(如 Haar 人脸检测)用纯 CPU 即可实时。
- 实时性要求极高:高速产线(如每秒上百个零件的质检)或超低延迟要求(微秒级响应),传统方法的确定性和低开销不可替代。
- 标注数据极少:只有几十张样本时,深度学习严重过拟合;传统方法(模板匹配、特征匹配)无需训练即可工作。
- 可解释性是硬性要求:医疗、金融、安全审计等场景要求”模型为什么这么判”,传统方法的每一步都可追溯到数学定义。
- 作为深度学习的预处理管线:图像校正、裁剪 ROI、去噪、颜色标准化——这些经典操作用 OpenCV 比训练网络更高效可靠。
- 精确几何计算:相机标定、三维重建、SLAM(同时定位与地图构建)中的 Bundle Adjustment——这些需要精确几何建模的任务,传统优化方法仍是主力。深度学习可以辅助(如学习深度先验),但核心求解器仍是传统几何方法。
什么时候该用深度学习
Section titled “什么时候该用深度学习”- 精度要求高:比赛、产品差异化竞争——YOLO 的 mAP 远超 HOG+SVM。
- 标注数据充足:有数千到数百万标注样本,深度学习是利用数据的最佳方式。
- 任务复杂多变:多类别、多尺度、遮挡严重、场景多样——深度学习的端到端学习天然适合。
- GPU / NPU 硬件可用:服务器、高配工作站、带 NPU 的移动芯片(如骁龙 8 Gen3、天玑 9300)都能高效推理。
- 需要零样本/少样本能力:使用 SAM 2、DINOv2、CLIP 等基础模型,无需收集标注数据即可开箱即用。
混合方案:传统预处理 + DL 推理
Section titled “混合方案:传统预处理 + DL 推理”工业级视觉系统极少只用一种路线,典型的混合管线:
- 传统预处理(OpenCV):图像去畸变、透视矫正、ROI 裁剪、色彩归一化、背景减除——用确定性算法快速处理,降低后续网络输入复杂度。
- DL 核心推理:YOLO 检测目标、U-Net 分割病灶、SAM 2 交互式分割、ResNet 分类——处理传统方法力不从心的复杂判断。
- 传统后处理(OpenCV):用 ByteTrack/DeepSORT 做目标跟踪、用形态学操作精修分割掩膜、用几何测量算实际尺寸——将深度学习输出转化为可用的结构化结果。
例如智能交通系统:OpenCV 做车牌定位 → YOLO 精确检测车牌 → OCR 网络识别字符 → OpenCV 校验和格式化输出。
深度学习的训练与部署技巧
Section titled “深度学习的训练与部署技巧”数据增强:两种范式的共性
Section titled “数据增强:两种范式的共性”传统方法靠手工设计的不变性(SIFT 对尺度/旋转不变),深度学习靠数据增强来获得鲁棒性。常见增强策略:
# 视觉数据增强( torchvision / albumentations )几何变换:随机翻转、随机裁剪、随机旋转、弹性形变色彩变换:亮度/对比度/饱和度抖动、直方图均衡质量退化:高斯噪声、JPEG 压缩、模糊(模拟低质量输入)高级增强:MixUp(两图叠加混合)、CutMix(裁剪拼接)、Mosaic(4 图拼接,YOLOv4+ 标志性增强)MixUp:将两张训练图像按比例 α 混合(x = λ×x₁ + (1-λ)×x₂),标签也按比例混合。这相当于在输入空间做了线性插值正则化,能有效减少过拟合。CutMix 则是裁剪一张图的区域贴到另一张上——保留了局部纹理的真实性。YOLO 系列用的 Mosaic 是 CutMix 的扩展版:4 张图拼成 1 张,极大丰富了 batch 内的上下文多样性。
深度学习的学习率调度对最终精度影响巨大,常用策略:
- 余弦退火(Cosine Annealing):,学习率按余弦曲线从最大缓慢降到最小,是最常用的调度方式
- 预热(Warmup):前 步学习率从 0 线性升到 ,再开始余弦退火,防止训练初期学习率过大导致损失爆炸,大模型训练必备
- OneCycle:先升后降的一个完整周期(fastai 的
lr_find+fit_one_cycle),超参数少,适合快速实验
量化与蒸馏:让大模型上边缘设备
Section titled “量化与蒸馏:让大模型上边缘设备”深度学习模型的部署瓶颈在于模型体积和推理延迟。两种核心压缩技术:
量化(Quantization):将模型权重从 FP32(32 位浮点)降为 INT8(8 位整数),体积缩小 4 倍,推理速度提升 2~3 倍,精度损失通常 < 1%:
将浮点范围映射到 。
PTQ(Post-Training Quantization,训练后量化):直接对训练好的模型量化,只需少量校准数据。QAT(Quantization-Aware Training,量化感知训练):在训练过程中模拟量化误差,精度更高但需要重新训练。TensorRT、ONNX Runtime、OpenVINO 都支持这两种模式。
知识蒸馏(Knowledge Distillation):用一个大而精的教师模型指导一个小的学生模型训练。学生模型不仅学习真实标签,还学习教师模型的”软标签”(soft labels,即教师输出的概率分布):
其中 是温度系数( 使 softmax 输出更平滑,暴露类间关系), 是 KL 散度(衡量两个分布的差异), 是权重系数,通常 0.5。
蒸馏让小模型学到”类间相似度”的暗知识(dark knowledge)——教师模型说”这是猫,但也有 3% 像狗”——这种信息比硬标签丰富得多。YOLOv8 和 Distilled ViT 就大量使用了蒸馏技术。
混合方案的典型管线
Section titled “混合方案的典型管线”传统方法与深度学习各司其职的工业级流程:
特征提取:手工 vs 学习的对比
Section titled “特征提取:手工 vs 学习的对比”同一任务对比:车牌定位——传统 OpenCV vs YOLO
Section titled “同一任务对比:车牌定位——传统 OpenCV vs YOLO”传统方法用边缘 + 轮廓 + 形状过滤定位车牌,深度学习用预训练 YOLO 直接检测:
import cv2
# ===== 方法一:传统 OpenCV 定位车牌(无需训练,CPU 即可)=====img = cv2.imread("car.jpg")gray = cv2.cvtColor(img, cv2.COLOR_BGR2GRAY) # 转灰度bilf = cv2.bilateralFilter(gray, 11, 17, 17) # 双边滤波保边去噪edges = cv2.Canny(bilf, 30, 200) # Canny 边缘检测contours, _ = cv2.findContours(edges, cv2.RETR_TREE, cv2.CHAIN_APPROX_SIMPLE)# 筛选:宽高比在 2-5 之间、面积适中的矩形可能是车牌for c in sorted(contours, key=cv2.contourArea, reverse=True)[:10]: x, y, w, h = cv2.boundingRect(c) if 2 < w / h < 5: # 车牌宽高比经验值 cv2.rectangle(img, (x, y), (x + w, y + h), (0, 255, 0), 2) breakcv2.imshow("Traditional", img)from ultralytics import YOLOimport cv2
# ===== 方法二:YOLO 直接检测车牌(精度高,需 GPU)=====model = YOLO("yolov8n.pt") # 加载预训练 YOLOv8 纳米版img = cv2.imread("car.jpg")results = model(img, classes=[...]) # 推理(classes 指定车牌类别)for box in results[0].boxes.xyxy: # 遍历检测框 x1, y1, x2, y2 = map(int, box[:4]) cv2.rectangle(img, (x1, y1), (x2, y2), (0, 0, 255), 2)cv2.imshow("YOLO", img)# 对比:YOLO 在复杂光照/角度下更鲁棒,传统方法在固定场景下更快更轻模型量化示例(INT8 量化加速推理)
Section titled “模型量化示例(INT8 量化加速推理)”import torch
# 训练后量化(Post-Training Quantization)model = torch.load("resnet50.pth").eval()
# 方式一:PyTorch 动态量化(最简单,只量化全连接层)quantized_model = torch.quantization.quantize_dynamic( model, {torch.nn.Linear}, dtype=torch.qint8)# 模型体积约缩小到 1/4,CPU 推理速度提升 2-3x
# 方式二:完整 INT8 静态量化(需要校准数据,精度更高)model.qconfig = torch.quantization.get_default_qconfig('fbgemm') # x86 CPU 后端model_prepared = torch.quantization.prepare(model)# 用少量校准数据跑前向传播,统计各层激活值的范围for img in calibration_dataloader: model_prepared(img)model_int8 = torch.quantization.convert(model_prepared)# INT8 模型可在普通 CPU 上实时推理,适合边缘部署- 不要无脑选深度学习:嵌入式、实时、小数据场景下传统方法往往更优。先问”我的约束是什么”,再选技术路线。
- 传统方法做 ROI 提取能大幅加速:先用传统方法裁出感兴趣区域,再交给深度网络——输入分辨率降低后推理速度可提升数倍。
- 数据增强是深度学习的必修课:传统方法靠手工特征的不变性(SIFT 对旋转不变),深度学习靠数据增强(随机翻转/裁剪/色彩抖动)来获得鲁棒性。
- 域偏移是两种方法的共同敌人:训练集和测试集分布不同时(如实验室光照 vs 户外强光),两者都会退化。传统方法可用参数微调应对,深度学习可用域自适应(Domain Adaptation)或微调。2025 年的趋势是用更大的预训练模型来缓解域偏移——DINOv2、SAM 2 等基础模型在海量数据上训练后,对域变化的鲁棒性远超任务专用模型。
- 可解释性要求下考虑注意力图:深度学习虽是黑箱,但可用 Grad-CAM / SHAP 等工具生成注意力热图,一定程度上满足审计需求。
- 模型蒸馏让深度学习上边缘设备:大模型(教师)蒸馏出小模型(学生),配合量化(INT8),深度学习也能在树莓派级别设备上实时运行。
- 2025 基础模型改变选型逻辑:SAM 2 做零样本分割、DINOv2 做零样本特征提取、Depth Anything V2 做零样本深度估计——很多以前需要大量标注数据的任务,现在用预训练基础模型 + 少量 prompt 就能解决。
2025-2026 最新进展
Section titled “2025-2026 最新进展”传统 CV 与深度学习的竞争格局在 2024-2025 年出现了新的变量:
基础模型(Foundation Model)改变游戏规则
Section titled “基础模型(Foundation Model)改变游戏规则”Meta 的 SAM 2(2024)和 Google 的 对应竞品让”分割”从需要大量标注数据的任务变成了零样本交互——点击一下或画个框,就能分割任意物体,甚至跨视频帧跟踪。这对传统分割方法(分水岭、Graph Cut)是降维打击。同样,DINOv2 让特征提取不再需要针对每个任务训练专用模型。
边缘 AI 生态成熟
Section titled “边缘 AI 生态成熟”2024-2025 年,移动端 NPU 性能大幅提升(骁龙 8 Gen4 的 Hexagon NPU 算力超过 40 TOPS),加上 ONNX Runtime、TensorRT、Core ML、NCNN 等推理框架的优化,INT8 量化后的检测和分类模型在手机上可做实时推理。这意味着很多以前”传统方法才能跑”的边缘场景,现在深度学习也能胜任了。
视觉语言大模型(VLM)融合两条路线
Section titled “视觉语言大模型(VLM)融合两条路线”GPT-4V、LLaVA、Qwen-VL 等视觉语言模型可以用自然语言指令完成检测、分割、OCR 等任务——用文本 prompt 代替代码调参,这在某种程度上像是”传统方法的灵活”与”深度学习的精度”的融合。不过当前 VLM 的推理速度仍远慢于专用模型,尚未在实时产线场景中替代传统管线。
传统方法并未消亡
Section titled “传统方法并未消亡”在精确几何计算(相机标定、SLAM、三维重建、光流)和超低延迟场景(嵌入式实时控制)中,传统方法仍然是唯一选择。SLAM 系统(如 ORB-SLAM3、VINS-Fusion)的核心仍然是特征匹配 + Bundle Adjustment——这些需要精确数学建模的环节,端到端深度学习尚未能可靠替代。
- 智能交通(ETC/违章检测):OpenCV 定位车牌区域 → YOLO 精检 → OCR 识别 → OpenCV 校验格式——混合管线的经典案例。
- 工业质检产线:传统视觉做尺寸测量和模板匹配(确定性要求),深度学习做缺陷分类(复杂纹理识别)——两者互补。
- 医疗影像辅助诊断:OpenCV 做 CT 窗口调整和配准 → U-Net / SAM 2 分割病灶 → 传统方法计算体积和位置——混合管线兼顾速度和精度。
- 安防视频分析:背景减除(传统)做运动检测 → 行为识别网络(深度学习)判断异常——节省 GPU 算力只处理关键帧。
- ARKit / ARCore:SLAM 跟踪(传统几何 + 优化)做实时定位 → 深度学习做语义分割理解场景——手机 AR 的技术底座。
- 机器人导航:传统 SLAM + 路径规划做定位与运动,深度学习做场景理解和物体抓取——工业机器人和自动驾驶的标准架构。
典型类库与工具
Section titled “典型类库与工具”| 类库 | 路线 | 说明 |
|---|---|---|
| OpenCV | 传统 | 传统 CV 全栈工具库,预处理与后处理首选 |
| scikit-image | 传统 | Python 图像处理,科研和原型开发 |
| PyTorch / torchvision | 深度学习 | 主流深度学习框架,含预训练模型库 |
| timm | 深度学习 | 收录大量预训练 CNN/ViT(含 DINOv2/SAM 权重) |
| Ultralytics YOLO | 深度学习 | YOLOv8/v11/v12 系列,工业部署最广的目标检测方案 |
| segment-anything-2 (Meta) | 深度学习 | SAM 2,零样本分割与视频跟踪基础模型 |
| ONNX Runtime | 部署 | 跨平台推理引擎,支持 INT8 量化,让深度学习模型在 CPU/移动端高效运行 |
| OpenVINO | 部署 | Intel 的推理优化工具,加速传统与深度学习混合管线 |
| TensorRT | 部署 | NVIDIA 的 GPU 推理加速库,支持 FP16/INT8 量化 |
| 术语 | 英文 | 解释 |
|---|---|---|
| 手工特征 | Hand-crafted Feature | 人工设计的特征提取方法(SIFT/HOG/Haar),区别于学习到的特征 |
| 端到端学习 | End-to-End Learning | 从原始输入直接到最终输出,整体优化,不拆分中间步骤 |
| 感兴趣区域 | ROI (Region of Interest) | 图像中需要重点分析的区域,先裁剪 ROI 可大幅降低计算量 |
| 域偏移 | Domain Shift | 训练数据与实际部署数据的分布差异,导致性能下降 |
| 模型蒸馏 | Knowledge Distillation | 用大模型(教师)指导小模型(学生)训练,实现模型压缩 |
| 注意力热图 | Attention Map / Grad-CAM | 可视化深度网络关注区域的工具,用于可解释性分析 |
| 数据增强 | Data Augmentation | 通过翻转/裁剪/色彩变换扩充训练数据,提升泛化能力 |
| 背景减除 | Background Subtraction | 从视频中分离前景运动目标的传统方法 |
| 量化 | Quantization | 将模型权重从 FP32 降为 INT8,减少显存占用、加速推理 |
| 非极大值抑制 | Non-Maximum Suppression (NMS) | 只保留重叠区域中置信度最高的检测框,消除冗余检测 |
| Bundle Adjustment | Bundle Adjustment | 多视图几何中的联合优化方法,同时调整相机参数和三维点位置 |
| 零样本 | Zero-shot | 无需针对新任务训练,直接用 prompt 或预训练能力处理 |
| 基础模型 | Foundation Model | 在海量数据上大规模预训练,可适配多种下游任务的大模型 |
| 知识的暗知识 | Dark Knowledge | 教师模型输出的软标签中包含的类间相似性信息 |
- Szeliski,「Computer Vision: Algorithms and Applications」(2nd ed., 2022):传统 CV 经典教材,系统覆盖经典方法,免费在线。
- Goodfellow et al.,「Deep Learning」第 9 章 (2016):深度学习经典教材中的卷积网络章节,对比理解两种范式。
- Lowe,「Distinctive Image Features from Scale-Invariant Keypoints」(IJCV 2004):SIFT 论文,理解手工特征设计的经典。
- Dalal & Triggs,「Histograms of Oriented Gradients for Human Detection」(CVPR 2005):HOG 论文,传统目标检测的代表作。
- Redmon et al.,「You Only Look Once: Unified, Real-Time Object Detection」(CVPR 2016):YOLO 原始论文,端到端检测的开创之作,详见目标检测与 YOLO。
- Kirillov et al.,「Segment Anything」(ICCV 2023):SAM 论文,基础分割模型的开创之作;SAM 2(2024)扩展到视频。
- Depth Anything V2,「From Synthetic Data to Better Real-World Depth Estimation」(2024):单目深度估计基础模型,利用合成数据突破精度上限。
- Zhao et al.,「OpenVINO: A Comprehensive Toolkit for AI Inference」(Intel, 2023):Intel 推理优化工具文档,理解混合管线部署的工程实践。