计算机视觉概览
本页说明计算机视觉(Computer Vision,CV)在整个 AI 分类体系中的位置,并给出本分类的全景导览。计算机视觉研究如何让机器从图像、视频与三维数据中获取、处理和理解信息——它是 AI 最早也最成功的应用领域之一,横跨传统图像处理与深度学习两大技术路线。
在 AI 技术全景中,本分类与「深度学习」「生成式 AI」等分类的关系如下:
- 深度学习:提供通用的神经网络架构与训练方法论(Transformer、RNN、训练技巧等),其中专用于视觉的架构(CNN、ResNet、ViT 等)已归入本分类的「视觉架构」。
- 计算机视觉(本分类):聚焦”看”——从经典图像处理(OpenCV)到判别式视觉任务(检测、分割、跟踪),再到三维视觉(Open3D)。
- 生成式 AI:负责”画”——扩散模型、GAN 等图像生成方法仍在 生成式 AI 分类下;本分类不重复收录生成模型内容。
- 激光雷达:激光雷达(LiDAR)感知是三维视觉在自动驾驶与机器人领域的专门分支,独立成类(见 激光雷达分类)。
视觉架构(01-architectures)
Section titled “视觉架构(01-architectures)”深度神经网络中专门为图像设计或常用于视觉任务的架构:
- CNN 卷积神经网络:视觉任务的基石,局部感受野 + 权值共享
- ResNet:残差连接,让百层网络可训练
- EfficientNet / MobileNet:高效与轻量级架构
- ViT:Transformer 进入视觉,纯注意力做图像分类
视觉任务(02-vision-tasks)
Section titled “视觉任务(02-vision-tasks)”判别式视觉任务:让模型从图像中”读出”结构化信息。
- 图像层面:图像分割、图像复原、深度估计
- 目标层面:目标检测(YOLO)、目标检测(DETR)、多目标跟踪
- 语义层面:OCR 文字识别、图像描述、视觉问答 VQA
- 运动与三维:光流、姿态估计、点云
- 传统路线:OpenCV 与传统视觉——深度学习之前的经典方法综述
OpenCV 教程(03-opencv)
Section titled “OpenCV 教程(03-opencv)”OpenCV 是最流行的开源计算机视觉库,覆盖图像处理、特征检测、相机标定、目标检测等传统方法(104 篇官方教程的中文翻译):
Open3D 教程(04-open3d)
Section titled “Open3D 教程(04-open3d)”Open3D 是三维数据处理库(点云、网格、RGB-D),常用于三维视觉与机器人感知(36 篇官方教程的中文翻译):
学习路径建议
Section titled “学习路径建议”- 零基础入门:从 OpenCV 核心模块 开始,掌握图像的基本表示与操作;
- 经典方法:学习 特征检测与匹配,理解传统 CV 的底层逻辑;
- 深度学习进阶:从 CNN 到 目标检测 与 分割;
- 三维视觉:用 Open3D 点云教程 进入三维世界,衔接激光雷达与机器人感知。