Skip to content

3D 激光 SLAM 综述:性能对比与多传感器紧耦合

同时定位与地图构建(Simultaneous Localization and Mapping, SLAM)是机器人学和计算机视觉领域的一个核心问题,其目标是让智能体(如机器人、无人车)在未知环境中移动时,能够同时构建环境地图并确定自身在该地图中的位置。定位的精确性依赖于地图的准确性,而地图的构建又需要精确的定位信息,这种固有的“鸡生蛋,蛋生鸡”的相互依赖关系构成了 SLAM 问题的核心挑战。

SLAM 技术的发展经历了从早期的基于滤波的方法(如扩展卡尔曼滤波器 EKF、粒子滤波器)到现代基于优化的方法(如图优化)的演变。与视觉里程计(Visual Odometry, VO)相比,SLAM 通常包含全局一致性维护机制,例如闭环检测,这是 VO 通常所缺乏的。

1.2 3D 激光雷达(LiDAR)在 SLAM 中的作用与优势

Section titled “1.2 3D 激光雷达(LiDAR)在 SLAM 中的作用与优势”

3D LiDAR(Light Detection and Ranging)传感器通过发射激光束并测量其反射回波的时间或相位差来获取环境的三维距离信息。在 SLAM 应用中,3D LiDAR 扮演着至关重要的角色,相较于视觉传感器(如相机),其主要优势体现在:

  1. 直接、精确的三维几何测量:LiDAR 能够直接获取环境中物体表面的精确三维坐标点云,无需像视觉 SLAM 那样依赖复杂的特征提取和三角化过程来估计深度。
  2. 对光照变化不敏感:作为主动传感器,LiDAR 自身发射光源,其性能基本不受环境光照变化的影响,能够在黑暗或光照剧烈变化的环境下稳定工作,这是视觉传感器难以比拟的。
  3. 对视觉纹理不敏感:LiDAR 主要依赖环境的几何结构,因此在缺乏视觉纹理(如白墙、空旷场地)的场景中,依然能够有效工作,而视觉 SLAM 在这些场景下往往会遇到特征提取困难的问题。
  4. 无固有尺度漂移:与单目视觉 SLAM 不同,LiDAR 直接测量距离,其生成的地图和估计的轨迹具有真实的物理尺度,不存在尺度不确定性或漂移问题。

基于上述优势,3D LiDAR SLAM 在自动驾驶、移动机器人、三维测绘等领域得到了广泛应用和深入研究。

尽管 3D LiDAR SLAM 取得了显著进展,但仍面临诸多挑战:

  1. 计算成本:3D LiDAR 每秒产生数十万甚至上百万的点云数据,实时处理如此庞大的数据量对计算资源提出了很高要求。
  2. 运动畸变:尤其对于机械旋转式 LiDAR,在传感器运动过程中完成一次扫描需要一定时间,导致同一帧点云中的点采集于不同时刻和位置,从而产生运动畸变(点云扭曲)。引入惯性测量单元(IMU)进行运动补偿是常用的解决方案。
  3. 环境因素:恶劣天气条件(如雨、雪、浓雾)会衰减激光信号,影响 LiDAR 的探测距离和精度。此外,LiDAR 难以探测透明或半透明物体(如玻璃)。
  4. 退化场景:在缺乏足够几何特征约束的环境中(如长直走廊、隧道、开阔地、大型平面),LiDAR SLAM 难以准确估计某些自由度的位姿,导致定位精度下降甚至失败,即所谓的“退化”问题。这是本报告第四节重点讨论的内容。
  5. 数据关联与闭环检测:如何可靠地将当前传感器读数与已有地图进行匹配(数据关联),以及如何准确识别曾经访问过的区域(闭环检测)以消除累积误差,是确保全局地图一致性的关键。
  6. 传感器多样性与融合:不同类型的 LiDAR(机械旋转式、固态式、相控阵等)具有不同的扫描模式和特性,算法往往需要针对特定类型进行调整。同时,如何有效融合 LiDAR 与其他传感器(IMU、相机、GPS 等)的数据以提升系统性能,是当前研究的热点和难点。这是本报告第三节和第五节的核心内容。

本报告旨在对 3D LiDAR SLAM 技术进行深入综述。第二节将介绍 LiDAR SLAM 的核心方法论,包括前端匹配和后端优化。第三节重点探讨紧耦合的 LiDAR-Inertial Odometry (LIO)技术。第四节将深入分析 LiDAR SLAM 在低特征环境下的退化问题及其应对策略。第五节介绍融合 LiDAR、视觉和惯性传感器的 LVI/LIVO SLAM 的最新进展。第六节展望新兴技术趋势,如深度学习、语义 SLAM 和多机器人协同等。最后,第七节对全文进行总结。

第 2 节:3D 激光 SLAM 核心方法论

Section titled “第 2 节:3D 激光 SLAM 核心方法论”

典型的 LiDAR SLAM 系统通常包含前端和后端两个主要部分。前端负责处理传感器数据,主要进行扫描匹配(Scan Matching)以估计连续帧之间的相对运动(即里程计,Odometry),并选择关键帧(Keyframes)。后端则接收前端的里程计估计和关键帧信息,通过非线性优化(通常是图优化)来优化机器人轨迹和地图,并通过闭环检测(Loop Closure Detection)来消除累积误差,保证全局地图的一致性。

扫描匹配是 LiDAR SLAM 前端的核心,其目标是通过对齐连续的 LiDAR 扫描数据(Scan-to-Scan)或将当前扫描数据与已建立的地图对齐(Scan-to-Map),来估计传感器(机器人)的相对运动。主流的扫描匹配方法可分为两大类:基于配准的(直接)方法和基于特征的方法。

这类方法直接使用原始或经过下采样的点云数据进行对齐。

  • 迭代最近点(Iterative Closest Point, ICP)
    • 原理:ICP 是一种经典的几何对齐算法。它通过迭代的方式寻找两个点云(源点云和目标点云)之间的对应点(通常是欧氏距离最近的点),然后计算一个刚体变换(旋转和平移),使得这些对应点之间的距离误差(如点到点距离、点到面距离)最小化。这个过程不断重复,直到满足收敛条件。
    • 优点:算法原理相对简单,在有良好初始位姿估计的情况下能够达到很高的配准精度。
    • 缺点:对初始位姿估计敏感,容易陷入局部最优解;计算量大,尤其对于大规模点云;对噪声和离群点敏感。
    • 变种:为了提高 ICP 的鲁棒性和效率,研究者们提出了多种改进版本,例如点到线 ICP(PL-ICP)、点到面 ICP(PP-ICP)、广义 ICP(GICP)、法向量 ICP(NICP)等,它们通过优化点选择、匹配策略、误差度量和权重分配等方式进行改进。Go-ICP 尝试解决对初值的敏感性。KISS-ICP 则是一个现代、高效的点对点 ICP 实现。
  • 正态分布变换(Normal Distributions Transform, NDT)
    • 原理:NDT 将目标点云划分为体素栅格(Voxel Grid),并用一个正态(高斯)分布(包含均值和协方差矩阵)来描述每个体素内的点云分布特征。然后,通过优化算法寻找一个刚体变换,使得源点云中的点在经过变换后,落在目标点云对应体素高斯分布上的概率最大化。
    • 优点:相比 ICP,NDT 通常对初始位姿估计不敏感,对噪声和离群点具有更好的鲁棒性,处理大规模点云时计算效率较高。
    • 缺点:配准精度可能受体素栅格大小影响,在理想条件下精度可能低于 ICP。
    • 应用:NDT 被用于 HDL-Graph SLAM。Cartographer 也使用了类似的基于概率栅格的匹配方法。一些混合方法如 NI-LIO 尝试结合 NDT 的鲁棒性和 ICP 的精度。

这类方法首先从点云中提取稀疏但显著的几何特征,然后基于这些特征进行匹配和位姿估计。

  • LOAM (LiDAR Odometry and Mapping)
    • 原理:LOAM 是基于特征的 LiDAR SLAM 的里程碑式工作。它根据点云局部区域的曲率(平滑度)提取两种主要特征:边缘点(Edge Points,曲率大)和平面点(Planar Points,曲率小)。通过最小化当前帧特征点到上一帧对应特征(边缘点到线,平面点到面)的距离来估计传感器运动。LOAM 将 SLAM 问题分解为两个并行运行的模块:一个高频率、低精度的里程计估计模块和一个低频率、高精度的地图优化模块。
    • 优点:相比于稠密方法,计算量显著降低,在结构化环境中精度很高,是许多后续研究的基准。
    • 缺点:严重依赖环境中存在足够的边缘和平面特征,在缺乏特征或结构重复的退化场景中容易失败。原始 LOAM 缺乏闭环检测模块。
  • LeGO-LOAM (Lightweight and Ground-Optimized LOAM)
    • 优化:LeGO-LOAM 是 LOAM 的一个轻量级优化版本,特别适用于地面车辆。它引入了地面分割,将点云分为地面点和非地面点,这有助于滤除噪声并辅助后续优化。它采用两阶段 Levenberg-Marquardt (L-M)优化策略:首先利用平面点(特别是地面点)估计垂直方向的平移和旋转(tz,θroll,θpitch),然后利用边缘点估计水平方向的平移和旋转(tx,ty,θyaw)。
    • 优点:比 LOAM 更轻量、计算效率更高,尤其适合地面车辆应用。增加了简单的基于 ICP 的闭环检测功能。
    • 缺点:仍然是基于特征的方法,在特征稀疏区域性能受限。闭环检测方法较为初级,容易失败。

前端扫描匹配方法呈现出明显的分野:基于配准的直接方法(如 ICP、NDT)和基于特征的方法(如 LOAM 及其变种)。直接方法试图利用点云中的所有信息以获得潜在的高精度,但面临计算量大和对初始位姿敏感的挑战。基于特征的方法通过稀疏化问题来提高效率,但其性能高度依赖于环境的几何结构。LeGO-LOAM 的优化 和混合方法(如 NI-LIO)的出现,正是为了缓解各自方法的固有弱点。这表明没有一种单一的方法能在所有情况下都占优,方法的选择需要根据具体的应用场景(计算资源、环境类型、精度要求)来权衡。

SLAM 后端的任务是利用前端提供的里程计估计和关键帧信息,对机器人的轨迹和地图进行全局优化,消除累积误差,强制全局一致性。

  • EKF-SLAM:在早期 SLAM 研究中具有重要地位,但其状态向量和协方差矩阵的大小随地图中路标数量的增加呈二次方增长,计算复杂度高,难以应用于大规模环境。此外,EKF 依赖于线性化假设,在非线性运动和观测模型下容易引入误差,且对错误的数据关联非常敏感。由于这些限制,在现代 3D LiDAR SLAM 中,EKF 已较少作为主要的后端优化方法。
  • 粒子滤波 SLAM (如 FastSLAM):通过粒子集合来表示机器人位姿的后验概率分布,能够更好地处理非线性和非高斯噪声,对数据关联错误也更鲁棒。然而,粒子滤波存在粒子退化问题,为保证精度通常需要大量粒子,导致计算开销大。GMapping 是一个著名的基于 Rao-Blackwellized 粒子滤波的 2D 栅格地图 SLAM 算法。在 3D LiDAR SLAM 领域,粒子滤波作为主要后端优化框架的应用不如基于图优化的方法普遍。
  • 核心思想:将 SLAM 问题构建为一个图模型。图中的节点(Nodes) 通常表示机器人在不同时刻的位姿(Pose),有时也包括环境中的路标(Landmarks)。图中的边(Edges) 则表示连接节点之间的约束(Constraints),这些约束来源于传感器的测量,如连续位姿间的里程计测量、闭环检测产生的位姿约束等。
  • 优化目标:图优化的目标是寻找一组最优的节点状态(即机器人位姿和地图),使得所有边的约束得到最大程度的满足,即使得与约束相关的误差最小化。这通常被建模为一个大规模的非线性最小二乘问题 34。
  • 因子图(Factor Graphs):因子图是一种特殊的二分图表示,被广泛用于现代 SLAM 优化库(如 GTSAM, Ceres Solver)中。它显式地区分了变量节点(Variable Nodes)(待优化的状态量,如位姿、速度、偏置等)和因子节点(Factor Nodes)(表示测量约束,如里程计约束、IMU 预积分约束、GPS 约束、闭环约束等)。因子图为多传感器融合提供了一个非常灵活和强大的框架,LIO-SAM 等先进系统就采用了因子图进行后端优化。
  • 优势:能够有效处理非线性问题;框架灵活,易于融合来自不同传感器的多种约束;可以利用高效的稀疏线性代数库求解大规模优化问题。
  • 实现:常用的优化库包括 g2o、GTSAM、Ceres Solver 等。采用图优化的代表性 LiDAR SLAM 系统有 LIO-SAM、Cartographer、HDL-Graph SLAM。

图优化已成为 3D LiDAR SLAM 后端的主流范式,很大程度上取代了基于滤波的方法来保证全局地图的一致性。这一点可以从当前先进的系统(如 LIO-SAM, Cartographer, HDL-Graph SLAM, KISS-SLAM 的扩展)普遍采用图优化得到印证。基于滤波的方法主要在历史文献中提及,或用于系统前端的特定模块(如 FAST-LIO 中的迭代 EKF 用于里程计)。图优化方法在融合多样化传感器数据(如 IMU 预积分、GPS、闭环约束)方面的灵活性,使其非常适合现代 SLAM 中复杂的多传感器融合场景。

第 3 节:紧耦合激光雷达-惯性里程计 (LIO)

Section titled “第 3 节:紧耦合激光雷达-惯性里程计 (LIO)”

纯 LiDAR SLAM 系统存在一些固有的局限性,例如:LiDAR 的扫描频率相对较低(通常为 10-20Hz),无法捕捉快速运动;扫描过程中的传感器运动会导致点云畸变;在缺乏几何特征的环境中容易发生退化。

惯性测量单元(IMU)能够以非常高的频率(数百至数千赫兹)提供关于传感器自身运动的测量信息,包括三轴加速度和三轴角速度。IMU 的测量与 LiDAR 的几何感知能力形成互补。

融合 LiDAR 和 IMU 的主要目标包括:

  1. 运动畸变补偿(Deskewing):利用高频 IMU 数据估计 LiDAR 扫描期间的连续运动,将点云中的每个点校正到同一时刻的坐标系下,消除运动畸变。
  2. 高频位姿估计:融合 IMU 数据可以在 LiDAR 扫描间隙提供高频率的位姿更新。
  3. 提高鲁棒性:在 LiDAR 退化场景(如特征稀疏区域)或传感器剧烈运动时,IMU 可以提供关键的运动约束,维持定位的连续性和稳定性。
  4. 提供运动先验:IMU 预测的运动可以为 LiDAR 扫描匹配提供良好的初始位姿估计,提高匹配效率和精度。

LiDAR 和 IMU 的融合架构主要分为松耦合(Loosely Coupled)和紧耦合(Tightly Coupled)两种:

  • 松耦合架构:
    • 原理:LiDAR 和 IMU 分别独立处理,得到各自的位姿估计或运动估计结果,然后在一个独立的模块(通常是卡尔曼滤波器)中对这些估计结果进行融合。例如,原始的 LOAM 算法仅使用 IMU 数据进行点云去畸变和提供运动先验,并未将 IMU 测量纳入后端优化。
    • 优点:实现相对简单,系统模块化程度高,易于开发和维护。
    • 缺点:融合效果次优,因为没有充分利用传感器测量之间的相关性;当某个传感器(如 GPS)的输出中断或精度严重下降时,系统性能会显著降低,鲁棒性较差。
  • 紧耦合架构:
    • 原理:将 LiDAR 的原始测量(或经过预处理的特征、点)和 IMU 的原始测量(加速度、角速度)直接输入到同一个状态估计器(如滤波器或优化器)中进行联合优化。
    • 优点:理论上可以获得更高的精度,因为联合优化能更好地处理传感器间的误差和相关性;能够更好地估计和补偿 IMU 的偏置(bias);在单个传感器性能下降或短暂失效时,系统鲁棒性更强,可以利用其他传感器的信息进行补偿。
    • 缺点:系统实现更为复杂,通常需要更高的计算资源。

近年来,LIO 领域的研究趋势明显倾向于紧耦合架构。诸如 LIO-SAM、FAST-LIO/FAST-LIO2、R3LIVE 等被明确描述为“紧耦合”的系统相继涌现并取得了优异的性能。这些系统展示了紧耦合方法在精度和鲁棒性方面的潜力。对比研究也常常指出紧耦合方法相对于松耦合方法(如原始 LOAM)的优势。松耦合的缺点,尤其是在挑战性环境下的表现,被反复提及。这种研究方向的趋同表明,尽管实现复杂度更高,但紧耦合带来的性能提升被认为足以弥补其挑战,尤其对于高性能 SLAM 系统而言。

实现紧耦合 LIO 需要依赖一些关键技术:

  • IMU 预积分(IMU Preintegration):
    • 概念:IMU 的测量频率远高于 LiDAR。为了将高频的 IMU 测量有效地融入频率较低的优化框架(如图优化),预积分技术被提出来。它将两个关键帧之间的所有 IMU 测量积分起来,形成一个表示这段时间内相对运动(旋转、速度、位移)的约束,同时考虑了 IMU 偏置在积分时间段内的变化。
    • 作用:IMU 预积分因子可以作为一个约束添加到因子图中,连接相邻的关键帧位姿节点,从而在不引入大量 IMU 状态变量的情况下,将 IMU 的运动信息融入优化过程。LIO-SAM 等基于图优化的系统广泛采用此技术。
  • 因子图优化(Factor Graph Optimization, FGO):
    • 框架:因子图提供了一个统一的框架来融合来自不同传感器的多种约束。在 LIO 中,因子图可以同时包含 LiDAR 测量残差(来自点云配准)、IMU 预积分因子、GPS 测量因子、闭环因子等。
    • 应用:通过求解这个大规模非线性最小二乘问题,可以联合优化机器人的轨迹、IMU 偏置以及地图。LIO-SAM 是基于因子图优化的典型代表。
  • 迭代卡尔曼滤波(Iterated Kalman Filters, 如 IEKF, ESIKF):
    • 框架:作为卡尔曼滤波的扩展,迭代卡尔曼滤波通过在每次量测更新步骤中,围绕更新后的状态估计进行多次重新线性化,来更好地处理系统中的非线性问题。误差状态卡尔曼滤波(ESIKF)则在误差状态空间进行滤波,更适合处理旋转等流形空间上的状态估计。
    • 作用:为紧耦合传感器融合提供了另一种实时性较好的框架。FAST-LIO/FAST-LIO2 系统采用了迭代扩展卡尔曼滤波(IEKF 或 ESIKF)。R3Live 系统也因其 LIO 子系统基于 FAST-LIO 而间接使用了该技术。
  • LIO-SAM:
    • 原理:基于因子图优化的紧耦合 LIO 系统。融合了 IMU 预积分、LiDAR 特征(边缘点和平面点)匹配、可选的 GPS 测量和闭环检测约束。采用关键帧策略和滑动窗口地图管理来保证效率。
    • 性能:精度高,实时性好,鲁棒性强,在大范围场景下表现优于 LOAM 和 LIOM。但在无特征隧道中若无人工路标,鲁棒性可能不如 FAST-LIO2。需要 9 轴 IMU 提供初始姿态。
  • FAST-LIO / FAST-LIO2:
    • 原理:基于迭代卡尔曼滤波(IEKF/ESIKF)的紧耦合 LIO 系统。FAST-LIO2 采用直接点云配准(不提取特征),并使用高效的 ikd-Tree 进行地图管理和近邻搜索。
    • 性能:计算效率高(速度快),鲁棒性好,精度高。FAST-LIO2 适用于多种 LiDAR 类型(旋转式和固态式)。在无特征隧道中表现较好。基础版本缺乏全局优化和闭环检测,在大场景下会累积漂移。
  • 其他系统:还存在其他值得关注的 LIO 系统,如同样基于滤波或优化的 LIOM、LINS、R-LINS。以及采用混合 ICP/NDT 匹配策略的 NI-LIO。

为了更直观地比较不同 LIO 系统的性能,下表总结了部分代表性算法在公开数据集(如 KITTI)和特定场景(如隧道)下的量化性能指标(主要是 ATE RMSE 和 RPE RMSE)以及鲁棒性表现。

表 1:紧耦合 LIO 系统性能对比

算法 (Algorithm)核心方法 (Core Method)数据集/场景 (Dataset/Scenario)ATE RMSE (m)RPE RMSE (m)RPE RMSE (deg)关键鲁棒性说明 (Key Robustness Notes)数据来源 (Data Sources)
LIO-SAM因子图优化 (Factor Graph)KITTI6.4280.1730.0025闭环(Y), 实时(Y), 隧道中需路标32
LIO-SAM因子图优化 (Factor Graph)KITTI1.5170.0760.0020闭环(Y), 实时(Y), 隧道中需路标32
LIO-SAM因子图优化 (Factor Graph)隧道 (有路标)0.95--隧道中有路标时精度最高34
LIO-SAM因子图优化 (Factor Graph)隧道 (无路标)8.74--无路标时漂移较大34
FAST-LIO2迭代卡尔曼滤波 (IEKF)KITTI7.091.253-闭环(N), 实时(Y), 隧道中鲁棒性好23
FAST-LIO2迭代卡尔曼滤波 (IEKF)KITTI1.971.223-闭环(N), 实时(Y), 隧道中鲁棒性好23
FAST-LIO2迭代卡尔曼滤波 (IEKF)隧道 (无路标)3.40--无路标时精度最高34
FAST-LIO2迭代卡尔曼滤波 (IEKF)隧道 (有路标)1.08--有路标时精度高34
NI-LIO混合 ICP/NDT + LIO (Hybrid ICP/NDT + LIO)KITTI1.430.290-精度高, 鲁棒性好23
NI-LIO混合 ICP/NDT + LIO (Hybrid ICP/NDT + LIO)KITTI0.370.013-精度高, 鲁棒性好23
LeGO-LOAM特征匹配+优化 (Feature Matching + Opt.)KITTI4.587.272-闭环(Y), 轻量级, 隧道中无路标时漂移大23
LeGO-LOAM特征匹配+优化 (Feature Matching + Opt.)KITTI0.870.057-闭环(Y), 轻量级, 隧道中无路标时漂移大23
LeGO-LOAM特征匹配+优化 (Feature Matching + Opt.)隧道 (无路标)9.12--隧道中无路标时性能较差34
SC-LeGO-LOAM特征匹配+优化+ScanContext (Feature Matching + Opt. + SC)KITTI8.6910.0920.0076闭环(Y, SC), 隧道中表现一般69
SC-LeGO-LOAM特征匹配+优化+ScanContext (Feature Matching + Opt. + SC)KITTI1.8050.1470.0081闭环(Y, SC), 隧道中表现一般69
Cartographer概率栅格匹配+图优化 (Prob. Grid Matching + Graph Opt.)KITTI4.8540.0330.0057闭环(Y), 需调参69
Cartographer概率栅格匹配+图优化 (Prob. Grid Matching + Graph Opt.)KITTI2.4370.0260.0021闭环(Y), 需调参69
HDL-Graph SLAMNDT+图优化 (NDT + Graph Opt.)KITTI12.7790.0190.0008闭环(N), 局部精度高, 全局差69
HDL-Graph SLAMNDT+图优化 (NDT + Graph Opt.)KITTI2.1600.0190.0012闭环(N), 局部精度高, 全局差69

注:ATE RMSE 和 RPE RMSE 数值越小表示精度越高。加粗表示该场景下最优或接近最优的性能。闭环(Y/N)表示算法是否包含闭环检测模块。(SC)表示使用 Scan Context 进行闭环。性能数据来源于不同研究,对比时需考虑实验设置差异。

该表综合了来自多个研究的量化结果,旨在提供一个关于主流 LIO 系统在精度和鲁棒性方面的横向比较视图,帮助理解不同技术路线(如基于特征 vs. 直接法,滤波 vs. 优化)的权衡。

第 4 节:提升鲁棒性:应对低特征环境下的退化问题

Section titled “第 4 节:提升鲁棒性:应对低特征环境下的退化问题”

LiDAR SLAM 的退化(Degeneration)是指在某些特定环境中,由于缺乏足够的几何约束信息,导致 SLAM 系统无法准确估计传感器的全部或部分位姿(位置和姿态),从而引起定位精度显著下降、漂移增大甚至定位失败的现象。

导致退化的主要原因包括:

  • 缺乏显著几何特征:环境中缺少足够的边缘、角点、平面等可供匹配的几何结构。
  • 结构重复或自相似:环境结构高度重复(如长廊两侧完全相同的墙壁)或对称,使得不同位置的观测难以区分。
  • 传感器视场角(FoV)受限:传感器无法观测到足够宽广或多样化的环境结构来提供约束。

典型的退化场景包括:长直走廊、隧道、开阔的广场或场地、仅能观测到大型平面的场景(如面对一堵大墙)等。在这些场景下,某些方向的平移或旋转可能变得不可观或弱可观。例如,在长直走廊中,沿走廊方向的平移和绕该方向的旋转就很难通过 LiDAR 精确估计。对于地面车辆,在起伏路面上行驶时,垂直方向的漂移也是一个常见问题。

为了提高 LiDAR SLAM 在低特征或退化环境下的鲁棒性,研究者们提出了多种策略:

  • 多传感器融合:这是最常用且有效的方法之一。
    • 融合 IMU:紧耦合的 LIO(如第 3 节所述)是应对退化的主要手段。IMU 能够提供高频的运动和姿态信息(尤其是重力方向相关的横滚角和俯仰角),即使在 LiDAR 观测信息不足时,也能提供关键的运动约束,显著抑制漂移。
    • 融合视觉传感器:相机可以捕捉丰富的纹理和颜色信息,这与 LiDAR 的几何信息形成互补。当 LiDAR 特征稀疏时,视觉特征可以提供额外的定位约束。LVI/LIVO 系统(将在第 5 节详述)通过融合视觉信息来提升整体鲁棒性。事件相机因其高动态范围和对运动敏感的特性,在特定场景(如光照剧变或高速运动)下也显示出潜力。
    • 融合轮速编码器:对于地面车辆,轮速编码器可以提供较为可靠的行驶距离信息,融合轮速编码器数据(如通过 EKF)可以帮助约束车辆的平移运动,尤其是在 LiDAR 里程计漂移较大的情况下。
  • 利用非几何特征(反射率/强度):
    • 概念:LiDAR 除了测量距离,通常还能记录反射点的强度(Intensity)或反射率(Reflectance)信息,这些信息反映了物体表面的材质和特性。
    • 方法:可以将强度/反射率信息投影生成类似图像的表示(如反射率图像),然后应用视觉中成熟的特征提取和匹配方法(如 SuperPoint)来寻找对应关系,或者将强度信息融入点云配准的代价函数中(如 Intensity-SLAM, I-LOAM)。IMU 数据可以辅助进行基于强度的特征匹配和外点剔除。
    • 优势:即使在几何结构单一或重复的环境中(如隧道墙壁),表面材质或标记(如车道线、标识)也可能提供独特的强度特征,从而为定位提供约束。已有研究表明,基于反射率的方法能够在纯几何方法失效的隧道中成功定位。
  • 改进的特征提取与匹配策略:
    • 地面优化(LeGO-LOAM):对于地面车辆,显式地分割和利用地面点云可以提供强大的垂直方向约束,提高定位稳定性。
    • 混合匹配(如 NI-LIO):结合 NDT 的鲁棒性和 ICP 的精度,可能在初始化困难或特征稀疏的场景下表现更好。
    • 直接法(如 FAST-LIO2):直接使用原始点云进行配准,避免了对特定类型特征(边缘、平面)的依赖,理论上可以利用环境中更细微的几何线索。
    • 语义信息辅助:利用语义分割结果识别场景中的稳定结构(如墙壁、地面)或物体,为匹配提供更可靠的依据,或剔除动态物体干扰。
  • 环境改造(人工路标):
    • 概念:在已知特征稀疏的环境中,主动放置具有强几何特征(如角点、特殊形状)的人工路标。
    • 效果:实验证明,在隧道等退化场景中,添加人工路标可以显著改善基于特征的 LiDAR SLAM 算法(如 LIO-SAM, LeGO-LOAM)的定位精度和鲁棒性。
  • 隧道环境:隧道是典型的 LiDAR SLAM 退化场景。研究表明,在没有人工路标的情况下,基于特征的方法(LeGO-LOAM, LIO-SAM)由于缺乏边缘特征而表现不佳,而直接法(FAST-LIO2)相对更鲁棒。添加具有强边缘特征的人工路标后,基于特征的方法性能得到极大提升,LIO-SAM 表现最优。基于反射率的方法也被证明在此类几何退化场景下有效。融合轮速编码器也能提升 FAST-LIO2 在隧道中的性能。
  • 一般低特征环境:对于各种类型的低特征环境,多传感器融合(LIO/LIVO)被普遍认为是提高鲁棒性的关键策略。利用反射率/强度信息提供了另一种或补充性的解决思路。

应对 LiDAR SLAM 退化问题并非只有一种万能药。现有研究提出了多种解决方案,包括传感器融合、利用非几何信息、环境改造以及改进匹配策略。隧道环境的实验结果清晰地展示了不同方法在有无人工路标时的性能差异。基于反射率的方法能在几何信息失效时提供支持。LIO/LIVO 被广泛认为是通用的鲁棒性增强手段。这表明最优策略的选择高度依赖于具体的退化类型(例如,隧道与开阔地)、可用的传感器(IMU、相机)以及操作限制(是否允许放置人工路标)。一个真正鲁棒的系统可能需要根据环境自适应地组合运用多种策略。

表 2:低特征环境下抗退化策略对比

环境类型 (Environment Type)算法/方法 (Algorithm/Method)抗退化策略 (Anti-Degradation Strategy)报告性能 (Reported Performance)数据来源 (Data Sources)
隧道 (Tunnel)LeGO-LOAM地面优化, IMU 融合, 闭环无路标时漂移大 (ATE RMSE: 9.12m)19
隧道 (Tunnel)LIO-SAMIMU 紧耦合(图优化), 闭环无路标时漂移较大 (ATE RMSE: 8.74m); 有路标时精度最高 (ATE RMSE: 0.95m)33
隧道 (Tunnel)FAST-LIO2IMU 紧耦合(滤波), 直接法无路标时精度最高 (ATE RMSE: 3.40m); 有路标时精度高 (ATE RMSE: 1.08m)24
隧道 (Tunnel)FAST-LIO2 + Wheel EncoderIMU 紧耦合, 直接法, 轮速计融合(EKF)精度提升35
隧道 (Tunnel)Reflectance-based Odometry反射率特征, IMU 辅助匹配几何方法失效时仍能工作, 轨迹一致性好36
隧道/走廊 (Tunnel/Corridor)Feature-based + Landmarks人工路标显著提升基于特征的 SLAM 性能34
低特征/退化场景 (General Low-Feature/Degenerate)LIO Systems (General)IMU 紧耦合普遍认为能提升鲁棒性25
低特征/退化场景 (General Low-Feature/Degenerate)LIVO Systems (General)IMU+视觉紧耦合普遍认为能进一步提升鲁棒性10
低特征/退化场景 (General Low-Feature/Degenerate)Reflectance/Intensity Methods反射率/强度特征可在几何特征不足时提供约束36

注:性能描述基于相关研究的报告,ATE RMSE 为绝对轨迹误差的均方根误差。

该表系统地比较了文献中记载的针对低特征环境的各种抗退化策略及其在相关场景下的表现,有助于识别在特定挑战环境下最有前景的技术方向。

第 5 节:多传感器融合进展:LiDAR-视觉-惯性 (LVI/LIVO) SLAM

Section titled “第 5 节:多传感器融合进展:LiDAR-视觉-惯性 (LVI/LIVO) SLAM”

将 LiDAR、视觉(相机)和 IMU 三种传感器进行融合,旨在结合各自的优势,克服单一或双传感器系统的局限性,以实现更鲁棒、更精确的 SLAM 系统。

  • 优势互补:

    • LiDAR 提供精确的几何结构信息和对光照变化的鲁棒性。
    • 视觉传感器提供丰富的纹理、颜色信息,有助于在几何特征稀疏的区域进行定位,并为地图赋予更丰富的语义信息。
    • IMU 提供高频率的运动测量和重力方向信息,有助于补偿 LiDAR 和相机的运动畸变,提高系统在快速运动或传感器数据暂时缺失时的鲁棒性。
  • 克服单一传感器弱点:

    • 视觉可以帮助 LiDAR 克服几何退化问题。
    • LiDAR 可以帮助视觉克服纹理缺失、光照变化和尺度漂移问题。
    • IMU 为 LiDAR 和视觉提供运动先验和姿态约束,提高整体稳定性。
  • 目标:通过三者融合,实现比单一传感器或双传感器(LIO/VIO)系统更高的定位精度和环境适应性,同时能够构建信息更丰富的地图(如带 RGB 颜色或语义信息的几何地图)。

近年来,融合 LiDAR、视觉和惯性传感器的 SLAM 系统(常称为 LVI-SLAM 或 LIVO)成为研究热点。

  • LVI-SAM:
    • 原理:采用因子图优化框架,紧耦合视觉-惯性子系统(VIS,类似 VINS-Mono)和激光-惯性子系统(LIS,类似 LIO-SAM)。两个子系统可以相互提供信息(VIS 利用 LIS 进行初始化和获取深度,LIS 利用 VIS 提供初始位姿估计和闭环检测),并在其中一个子系统失效时独立运行。
    • 特点:基于特征的 LIO 和 VIO 融合,对传感器失效具有较强鲁棒性。
  • R3Live / R3Live++:
    • 原理:紧耦合 LIO 子系统(基于 FAST-LIO)和 VIO 子系统。LIO 负责构建几何地图,VIO 通过最小化“帧到地图”的光度误差(frame-to-map photometric error)来估计位姿并为地图点渲染 RGB 颜色,采用 ESIKF 进行状态估计。
    • 特点:能够实时生成精确、稠密、带 RGB 颜色的三维点云地图,在 LiDAR 或视觉退化场景下表现鲁棒。R3Live++进一步加入了相机光度标定和曝光时间在线估计,提高了地图的辐射度(radiance)精度。该系统已开源。
  • FAST-LIVO / FAST-LIVO2:
    • 原理:基于 FAST-LIO 框架,采用直接法(direct methods)进行 LiDAR 和视觉数据的紧耦合融合。LiDAR 部分直接配准原始点云,视觉部分通过最小化直接光度误差进行图像对齐,无需提取角点等视觉特征。系统维护一个统一的体素地图,存储几何信息和视觉图像块。
    • 特点:旨在通过避免 LiDAR 和视觉两方面的特征提取来提高计算效率。
  • 其他方法:还包括基于 MSCKF 滤波框架的 LIC-Fusion,基于后端优化的 TVL-SLAM,以及利用 LiDAR 为视觉特征提供深度的 DEMO/LIMO 等。
  • 挑战:
    • 融合复杂度:设计能够有效融合三种异构传感器(点云、图像、惯性测量)数据的紧耦合算法本身就非常复杂。
    • 计算成本:同时处理和优化来自多种传感器的大量数据,对计算资源要求很高,实现实时性能是一大挑战。
    • 传感器标定与同步:精确的传感器外参(LiDAR、相机、IMU 之间的相对位姿)和时间同步是保证融合效果的前提,标定和同步过程本身也存在挑战。
  • 收益:
    • 精度提升:通过互补信息和联合优化,通常能达到比单一或双传感器系统更高的定位和建图精度。
    • 鲁棒性增强:系统在单一传感器可能失效或性能下降的场景下(如几何退化、纹理缺失、光照变化、快速运动)表现更稳定可靠。
    • 地图信息丰富:能够生成同时包含精确几何结构和真实颜色纹理的地图,甚至可以结合语义信息,为高级机器人任务提供更全面的环境理解。

LVI/LIVO 系统的不断涌现和发展 表明,融合 LiDAR、视觉和 IMU 这三种模态被认为是实现 SLAM 系统在最广泛的挑战性环境(如无特征、无纹理、动态光照、剧烈运动等)下达到最高鲁棒性的最有希望的途径。文献中反复强调了这些传感器之间的互补性。像 LVI-SAM 这样的系统明确将对单一子系统失效的鲁棒性作为关键优势。R3Live 也在 LiDAR/视觉同时退化的场景下展示了鲁棒性。这指示了一个研究方向,即追求系统在某个传感器模态受损时能够优雅降级而非灾难性失败。

3D LiDAR SLAM 领域的研究正朝着更智能、更鲁棒、更全面的环境感知方向发展。

深度学习技术正被越来越多地应用于 LiDAR SLAM 的各个环节:

  • 神经辐射场(NeRF)与 3D 高斯溅射(3DGS):利用神经网络隐式(NeRF)或显式(3DGS)地表示三维场景,作为 SLAM 的地图表示方法。
    • 优势:能够生成高保真度的场景渲染图像,实现连续、稠密的地图表示,对噪声和稀疏数据可能有更好的处理能力。
    • 挑战:计算成本高昂,难以实时运行;在大规模场景下的可扩展性;处理动态场景;保证全局一致性(闭环)仍是难题。
    • 代表工作:NeRF-LOAM, PIN-SLAM。
  • 学习化的 SLAM 模块:将深度学习模型用于 SLAM 流程中的特定模块,例如:
    • 特征提取与匹配:学习更鲁棒、更具区分性的点云特征描述子,或直接学习匹配关系。
    • 闭环检测:学习场景的全局描述子,用于高效、鲁棒地识别重访区域。
    • 去噪与数据增强:利用学习方法对原始点云进行去噪处理,或在训练数据中模拟各种扰动以提高模型的鲁棒性。
    • 里程计估计:直接利用神经网络端到端地估计传感器运动。Delora 是一个基于学习的 SLAM 系统示例。

将语义信息(如物体识别、场景类别)融入 SLAM 框架。

  • 优势:

    • 改善数据关联:利用物体类别信息辅助匹配。
    • 处理动态环境:识别并剔除或独立跟踪动态物体(如行人、车辆),提高在动态场景下的鲁棒性。
    • 构建语义地图:生成包含物体类别和位置信息的地图,为机器人执行更高级的任务(如导航、交互、场景理解)提供支持。
  • 代表工作:SD-SLAM, SG-SLAM。

  • 挑战:让 SLAM 系统能够在长时间(数天、数月甚至数年)运行中保持地图的一致性和定位的准确性,需要应对环境的外观变化(光照、季节、天气变化)和动态性。
  • 方法:研究重点在于开发鲁棒的地点识别技术(Place Recognition)、有效的地图更新与维护策略、以及持续学习(Continual Learning)方法,使系统能够在不遗忘旧知识的情况下适应新环境。BioSLAM 是一个面向终身 SLAM 的框架示例。
  • 概念:由多个机器人协同工作,共同构建一个环境地图。
  • 优势:可以更快地探索未知环境;通过机器人间的相对测量和闭环检测,可以提高整体定位精度和鲁棒性;系统容错性更高。
  • 挑战:如何在分布式系统中高效地融合来自不同机器人的数据;处理通信带宽限制和延迟;维护所有机器人地图的一致性。
  • 代表工作:LAMP 2.0(集中式), Kimera-Multi(分布式)。
  • 应用方向:利用强化学习(RL)训练机器人进行路径规划、探索策略制定、闭环决策、障碍物避让等。
  • 潜力:通过与环境的交互学习,使机器人能够获得自适应的行为能力,提高导航效率,增强对传感器噪声和故障的韧性。目前在 LiDAR SLAM 领域的应用尚处于探索阶段。

当前的研究趋势,如神经表示、语义 SLAM 和终身 SLAM,共同指向了一个从纯粹的几何建图向构建更丰富、更持久、更具语义意义的环境模型的转变。纯几何 SLAM 的局限性(如退化、动态物体处理、缺乏上下文理解)正在驱动这些新的研究方向。神经辐射场等技术提供了生成照片级真实感地图的可能性。语义信息增加了对环境中物体的理解。终身 SLAM 则致力于解决地图的长期一致性和环境变化问题。这表明 SLAM 的未来不仅关乎机器人“在哪里”以及环境的“几何形状是什么”,更关乎“环境中有什么物体”、“环境如何随时间变化”,以及如何利用这些更丰富的理解来支持更智能的机器人行为。

本综述深入探讨了 3D LiDAR SLAM 技术,涵盖了其核心方法、性能对比、关键挑战及最新进展。主要结论如下:

  1. 核心方法成熟多样:基于特征(如 LOAM 及其变种 LeGO-LOAM)和基于配准(如 ICP、NDT)的前端扫描匹配方法各有优劣,前者在结构化环境中效率高,后者在低特征或噪声环境下可能更鲁棒。后端优化方面,基于图优化的方法已成为保证全局一致性的主流框架。
  2. 紧耦合 LIO 是提升鲁棒性的关键:通过紧耦合框架(基于因子图优化或迭代卡尔曼滤波)融合 IMU 数据,利用 IMU 预积分等技术,可以显著补偿 LiDAR 的运动畸变、提高定位频率、增强在快速运动和退化场景下的鲁棒性。LIO-SAM 和 FAST-LIO2 是当前性能优异的代表性紧耦合 LIO 系统,性能对比见表 1。
  3. 低特征环境退化是持续挑战:在长廊、隧道等缺乏几何特征的环境中,LiDAR SLAM 容易发生退化。应对策略包括多传感器融合(尤其是 LIO)、利用非几何信息(反射率)、环境改造(人工路标)以及改进匹配算法(如直接法、地面优化)。没有单一方法能解决所有退化问题,最优策略依赖于具体场景和可用资源(见表 2)。
  4. LVI/LIVO 融合潜力巨大:融合 LiDAR、视觉和 IMU 是实现最高级别鲁棒性和构建信息丰富地图(如 RGB 彩色地图)的重要方向。LVI-SAM、R3Live 等系统展示了三传感器融合在应对复杂环境挑战方面的潜力。
  5. 新兴技术驱动未来发展:深度学习(尤其是神经表示)、语义 SLAM、终身 SLAM 和多机器人协同等技术正在为 LiDAR SLAM 注入新的活力,推动其从纯粹的几何感知向更全面的环境理解和长期自主运行发展。

尽管 3D LiDAR SLAM 取得了长足进步,但仍面临一些持续的挑战,并指向未来的研究方向:

  • 实时性与复杂性:随着算法复杂度和融合传感器数量的增加,如何在有限的计算资源下保证实时性能仍然是一个挑战。轻量化算法设计和高效计算架构是未来的研究重点。
  • 极端环境下的鲁棒性:在极端动态(大量移动物体)、极端退化(几乎无特征)或恶劣天气条件下的鲁棒性仍有提升空间。需要更强的环境适应性和故障恢复能力。
  • 大规模长期建图:如何高效、一致地构建和维护超大规模环境(城市级别)的地图,并处理环境随时间发生的变化(终身 SLAM),仍然是开放性问题。
  • 传感器标定与同步:多传感器融合系统的性能高度依赖于精确的内外参数标定和时间同步,开发更自动化、更精确的在线标定与同步技术至关重要。
  • 深度学习与传统方法的结合:如何更好地将深度学习的感知能力与传统几何方法的精度和可解释性相结合,是未来 SLAM 发展的重要方向。特别是高效、可扩展、可在线优化的神经表示方法值得深入研究。
  • 语义与高层理解:将 SLAM 与场景理解、物体交互、任务规划等高层机器人能力更紧密地结合,构建真正“智能”的感知系统。

总而言之,3D LiDAR SLAM 技术正朝着更精确、更鲁棒、更智能、更适应长期运行的方向发展。通过克服现有挑战并融合新兴技术,LiDAR SLAM 将继续为自动驾驶、机器人、增强现实等领域提供强大的环境感知基础。