Skip to content

计算机视觉概览

本页说明计算机视觉(Computer Vision,CV)在整个 AI 分类体系中的位置,并给出本分类的全景导览。计算机视觉研究如何让机器从图像、视频与三维数据中获取、处理和理解信息——它是 AI 最早也最成功的应用领域之一,横跨传统图像处理与深度学习两大技术路线。

在 AI 技术全景中,本分类与「深度学习」「生成式 AI」等分类的关系如下:

  • 深度学习:提供通用的神经网络架构与训练方法论(Transformer、RNN、训练技巧等),其中专用于视觉的架构(CNN、ResNet、ViT 等)已归入本分类的「视觉架构」。
  • 计算机视觉(本分类):聚焦”看”——从经典图像处理(OpenCV)到判别式视觉任务(检测、分割、跟踪),再到三维视觉(Open3D)。
  • 生成式 AI:负责”画”——扩散模型、GAN 等图像生成方法仍在 生成式 AI 分类下;本分类不重复收录生成模型内容。
  • 激光雷达:激光雷达(LiDAR)感知是三维视觉在自动驾驶与机器人领域的专门分支,独立成类(见 激光雷达分类)。

深度神经网络中专门为图像设计或常用于视觉任务的架构:

判别式视觉任务:让模型从图像中”读出”结构化信息。

OpenCV 是最流行的开源计算机视觉库,覆盖图像处理、特征检测、相机标定、目标检测等传统方法(104 篇官方教程的中文翻译):

Open3D 是三维数据处理库(点云、网格、RGB-D),常用于三维视觉与机器人感知(36 篇官方教程的中文翻译):

  1. 零基础入门:从 OpenCV 核心模块 开始,掌握图像的基本表示与操作;
  2. 经典方法:学习 特征检测与匹配,理解传统 CV 的底层逻辑;
  3. 深度学习进阶:从 CNN 到 目标检测 与 分割;
  4. 三维视觉:用 Open3D 点云教程 进入三维世界,衔接激光雷达与机器人感知。