三维 SLAM 范式演进:从显式几何到隐式神经表示与高斯泼溅
第一章:显式 SLAM 范式:理论、现状与局限
Section titled “第一章:显式 SLAM 范式:理论、现状与局限”同步定位与建图(Simultaneous Localization and Mapping, SLAM)技术是机器人、自动驾驶和增强现实领域的核心支柱。在 SLAM 技术的早期发展阶段,主导范式是显式几何方法。该范式通过直接、明确的几何图元(如特征点、点云、栅格)来表征环境,并将 SLAM 问题建模为一个概率推理问题,其核心在于通过优化传感器观测到的几何约束来联合估计传感器的运动轨迹与环境地图。
理论基石:几何约束与优化
Section titled “理论基石:几何约束与优化”显式 SLAM 的根本思想是,通过最大化后验概率(Maximum a Posteriori, MAP)来求解状态估计问题。这通常被构建为一个非线性最小二乘优化问题。在这一框架下,后端优化,特别是基于位姿图(Pose Graph)的优化,占据了核心地位。图中的每个节点代表传感器在某一时刻的位姿(通常对应一个关键帧),而边则代表了位姿之间的空间约束。这些约束来源于前端处理,例如,由连续帧间的运动估计(里程计)或由大尺度闭环检测(Loop Closure)提供。优化的目标是调整所有节点的位姿,以最小化所有约束的总误差。诸如 g2o(General Graph Optimization)和 Ceres Solver 等成熟的非线性优化库,为此提供了强大的求解工具。
前端负责从原始传感器数据中提取这些几何约束,这一过程被称为数据关联(Data Association)。根据传感器类型和处理方式的不同,显式 SLAM 主要分化为三大流派:特征点法、点云法和栅格/体素法。
流派梳理与代表性工作剖析
Section titled “流派梳理与代表性工作剖析”特征点法: ORB-SLAM3
Section titled “特征点法: ORB-SLAM3”特征点法通过从图像中提取稀疏但具有辨识度的特征点,并进行跨帧匹配与三角化,来构建地图和约束位姿。ORB-SLAM3 是这一流派的集大成者,它将视觉、视觉惯性以及多地图 SLAM 的功能整合进一个统一、精确且鲁棒的开源库中。
- 论文: Campos, C., Elvira, R., Rodríguez, J. J. G., Montiel, J. M. M., & Tardós, J. D. (2021). “ORB-SLAM3: An Accurate Open-Source Library for Visual, Visual-Inertial and Multi-Map SLAM”. IEEE Transactions on Robotics, 37(6), 1874-1890. (https://arxiv.org/abs/2007.11898)
- 源码:(https://github.com/UZ-SLAMLab/ORB_SLAM3)
- 核心课题组: 西班牙萨拉戈萨大学 (University of Zaragoza) 的 UZ-SLAMLab。
- 常用数据集: EuRoC MAV Dataset, KITTI Vision Benchmark Suite。
- 开创性相关工作: ORB-SLAM3 是其前代作品 ORB-SLAM 与 ORB-SLAM2 的直接演进,继承了核心的 ORB 特征和跟踪、局部建图、闭环检测三线程架构。其视觉惯性(VIO)和多地图功能分别是在 ORBSLAM-VI 与 ORBSLAM-Atlas 的基础上发展而来。地点识别则依赖于经典的 DBoW2 词袋模型。
- 优缺点对比:
- 优点:
- 高精度与强鲁棒性: 凭借对光照和视角变化具有不变性的 ORB 特征,系统实现了极高的定位精度和强大的重定位、闭环检测能力。
- 多功能集成: 它是首个能够处理单目、双目、RGB-D、单目惯性、双目惯性多种传感器配置的系统,并支持针孔与鱼眼相机模型。
- 多地图系统(Atlas): 引入了革命性的 Atlas 多地图系统,当跟踪丢失时,系统不会崩溃,而是开启一个新地图。当机器人重访旧区域时,无论该区域属于哪个子地图,系统都能识别并无缝地将地图融合,从而实现长期、稳健的操作。
- 紧耦合 VIO: 通过与 IMU 数据的紧耦合,系统能有效估计真实尺度,并对快速运动和视觉退化(如运动模糊)有更强的抵抗力。
- 缺点:
- 依赖视觉纹理: 在低纹理或无纹理的环境中,特征点提取困难,系统性能会急剧下降。
- 稀疏地图: 系统生成的地图是由稀疏的 3D 特征点构成的,这对于需要密集场景理解的任务(如导航、避障、真实感渲染)来说信息不足。
- 代码复杂度高: 作为一个功能全面的系统,其代码库庞大且模块间相互依赖,理解和修改的门槛较高。
- 优点:
ORB-SLAM3 的 Atlas 系统标志着 SLAM 从单次任务的地图构建,向支持长期自主运行的“终身”空间智能的转变。传统的 SLAM 系统构建一个单一、整体的地图,一旦发生严重跟踪失败,整个任务便宣告终结。这对于需要连续工作数天甚至数周的机器人是不可接受的。Atlas 系统则通过在跟丢后启动新地图,并在重访时跨地图进行地点识别与融合,将静态的地图产物转变为一个动态、可演化的空间知识库。这一架构为多机器人协同建图奠定了基础,不同机器人可以构建各自的“地图集”,并通过相互融合,最终形成一个全局一致的、集体的世界认知。
点云法: LIO-SAM
Section titled “点云法: LIO-SAM”对于以激光雷达(LiDAR)为主要传感器的 SLAM 系统,点云法是主流。这类方法通过匹配连续的激光雷达扫描数据(点云)来估计运动。LIO-SAM 是一个极具影响力的紧耦合激光雷达惯性里程计框架,它将状态估计问题构建为一个因子图(Factor Graph),并通过增量式平滑与优化(Smoothing and Mapping)实现极高的精度和实时性。
- 论文: Shan, T., Englot, B., Meyers, D., Wang, W., Ratti, C., & Rus, D. (2020). “LIO-SAM: Tightly-coupled Lidar Inertial Odometry via Smoothing and Mapping”. IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS). ((https://www.researchgate.net/publication/362412728_LIO-SAM_Tightly-coupled_Lidar_Inertial_Odometry_via_Smoothing_and_Mapping))
- 源码:(https://github.com/TixiaoShan/LIO-SAM)
- 核心课题组: Tixiao Shan (时任于麻省理工学院)。
- 常用数据集: 该框架常在自定义采集的数据集上进行展示,并使用公开的 KITTI 或 MulRan 等数据集进行性能对比。
- 开创性相关工作: LIO-SAM 的思想源头是 LOAM (Lidar Odometry and Mapping)。它继承了从点云中提取边缘点和平面点的核心思想,但革命性地将 LOAM 的双阶段(高频里程计+低频建图)松散框架,重构为一个基于 GTSAM 库的、统一的、全局优化的因子图模型。
- 优缺点对比:
- 优点:
- 极高精度: 实现了非常低的漂移和极高的轨迹精度,在具有丰富几何结构的环境中表现出色。
- 可扩展的融合框架: 因子图的本质使其成为一个灵活的传感器融合平台。可以方便地将 GPS、轮速计等其他传感器的测量值作为新的“因子”加入到优化问题中,进一步提升鲁棒性和全局一致性。
- 实时性能: 通过将扫描匹配的范围限制在一个局部的子地图而非整个全局地图,并结合关键帧选择策略,显著提升了系统的实时运行效率。
- 缺点:
- 依赖几何结构: 系统性能严重依赖于环境中是否存在清晰的几何特征(边缘和平面)。在几何结构退化的场景(如长廊、开阔的空地)中,性能会下降。
- 点云地图: 与 ORB-SLAM3 类似,其地图产物是点云,缺乏表面和语义信息。
- 数据预处理要求高: 需要精确的时间戳和激光雷达的环号(ring)信息来对运动中的点云进行去畸变处理,这对于非标准或固态激光雷达可能需要额外适配。
- 优点:
LIO-SAM 采用因子图不仅是一个实现上的选择,它标志着 LiDAR SLAM 技术走向成熟,成为一个有原则、可扩展的传感器融合平台。LOAM 采用了一种巧妙但略显特设(ad-hoc)的双模块算法,高效但灵活性不足。LIO-SAM 则用因子图这一通用数学工具取而代之。位姿、IMU 偏置等状态量是图中的变量,而 IMU 预积分、LiDAR 特征匹配、GPS 读数等测量则成为约束这些变量的“因子” 13。这种抽象带来了极强的可扩展性。想要加入轮速计?增加一个轮速计因子。想要加入气压计获取高程?增加一个高程因子。正是这种强大的底层数学框架,使得诸如 LIO_SAM_6AXIS 和 SC-LIO-SAM 等衍生工作能够在其基础上轻松地进行扩展和创新。
栅格/体素法: Google Cartographer
Section titled “栅格/体素法: Google Cartographer”栅格/体素法将空间离散化为均匀的网格(2D)或体素(3D),并估计每个单元被占据的概率。Google 开源的 Cartographer 是该流派的杰出代表,以其工程上的鲁棒性和独特的建图策略而闻名。
- 论文: Hess, W., Kohler, D., Rapp, H., & Andor, D. (2016). “Real-Time Loop Closure in 2D LIDAR SLAM”. IEEE International Conference on Robotics and Automation (ICRA). (https://ieeexplore.ieee.org/document/7487258) (注:该论文主要描述 2D 版本,3D 版本是其概念的延伸)
- 源码: https://github.com/cartographer-project/cartographer
- 核心课题组: Google。
- 常用数据集: Cartographer 通常与各种机器人平台(如 TurtleBot)和激光雷达(如 Velodyne)结合使用,数据集多为用户自定义。
- 开创性相关工作: Cartographer 建立在栅格建图和图优化的悠久历史之上,其核心创新在于提出了“子地图”(Submap)的概念,从而将高频的局部扫描匹配与低频的全局闭环优化解耦。
- 优缺点对比:
- 优点:
- 工程鲁棒性强: 专为实时应用设计,计算效率高,非常稳定。
- 可伸缩性: 子地图策略有效地控制了计算复杂度,使其能够构建非常大范围的地图。
- 地图可用性: 生成的占据栅格地图(Occupancy Grid Map)可以直接用于路径规划和导航任务。
- 缺点:
- 离散化精度限制: 地图以离散的栅格/体素存储,其分辨率直接决定了定位精度和重建保真度,且高分辨率会带来巨大的内存消耗。其精度通常低于特征点法或点云法。
- 维护状态: 官方项目已不再积极维护,其 ROS 分支的维护也十分有限。
- 传感器同步要求: 对传感器数据的时间同步性要求较高,否则性能会受影响。
- 优点:
Cartographer 的子地图策略是一个巧妙的工程折衷,它解决了 SLAM 中“在线处理”与“全局优化”之间的核心矛盾。SLAM 系统既需要足够快地实时处理新数据以保持局部一致性,又需要在检测到闭环时执行耗时的全局优化以保证整个地图的最终一致性。同时满足这两点在计算上是巨大的挑战。Cartographer 的方案是将问题分解:前端不断将新的激光扫描数据插入到一个短暂存在的、局部刚性的“子地图”中,这是一个快速的过程。一旦一个子地图构建完成,它就被视为一个不可变的整体数据块,并作为一个节点插入到全局的位姿图中。闭环检测和全局优化在这个简化的、由子地图构成的图上进行,频率远低于数据输入频率。这种“分块处理”的架构思想,对于管理大规模估计问题的复杂度极具启发性,其原则在后续的神经表示方法中(如使用局部子图或关键帧窗口)也得到了呼应。
第二章:隐式 SLAM 范式:新浪潮与核心优势
Section titled “第二章:隐式 SLAM 范式:新浪潮与核心优势”进入 21 世纪 20 年代,SLAM 领域迎来了一股强大的新浪潮:隐式神经表示。这一范式从根本上颠覆了地图的存储与表达方式。地图不再是离散几何图元的集合,而是一个连续的函数——通常是一个神经网络——可以通过查询任意三维坐标来获取该点的几何与外观属性。
理论核心:神经辐射场(NeRF)对三维表达的重塑
Section titled “理论核心:神经辐射场(NeRF)对三维表达的重塑”神经辐射场(Neural Radiance Fields, NeRF)的出现,为三维场景表示带来了革命性的变化。
-
根本性变革: 传统 SLAM 存储的是离散的点或体素,而隐式表示将整个三维场景的几何与纹理信息编码在一个神经网络(通常是多层感知机 MLP)的权重之中。这个网络可以被形式化地理解为一个函数
F(x,y,z)→(SDF/occupancy, color),它接收一个三维空间坐标作为输入,输出该点的几何属性(如符号距离函数 SDF 值或占据概率)和颜色。
-
连续性与紧凑性: 地图因此变成了一个连续且可微的函数。这使得系统能够以任意分辨率提取平滑的表面,并天然具备插值和“脑补”(hole-filling)空洞区域的能力。更重要的是,地图的内存占用由网络参数量决定,而与场景的几何复杂度或范围无关,这在存储效率上带来了巨大优势。
-
可微渲染: 整个从三维表示到二维图像的渲染过程是完全可微的。这使得端到端的优化成为可能:通过最小化渲染出的图像与真实输入图像之间的光度误差,可以同时联合优化相机的位姿和作为地图的神经网络权重。
代表性工作分析
Section titled “代表性工作分析”RGB-D 方向的先驱: NICE-SLAM
Section titled “RGB-D 方向的先驱: NICE-SLAM”iMAP 是首个将 NeRF 引入实时 SLAM 的工作,但它使用单个全局 MLP 来表示整个场景,导致了重建结果过于平滑、扩展到大场景时会“灾难性遗忘”等问题。NICE-SLAM 是针对这些核心痛点提出的重大改进。
- 论文: Zhu, Z., Peng, S., Larsson, V., Oswald, M. R., Pollefeys, M., & Geiger, A. (2022). “NICE-SLAM: Neural Implicit Scalable Encoding for SLAM”. CVPR. (https://arxiv.org/abs/2112.12130)
- 源码: https://github.com/cvg/nice-slam
- 核心课题组: 苏黎世联邦理工学院计算机视觉组 (CVG, ETH Zurich) 与马克斯·普朗克智能系统研究所 (MPI-IS)。
- 常用数据集: Replica (高质量合成室内场景), ScanNet (真实大规模室内场景), TUM-RGBD。
- 开创性相关工作: NICE-SLAM 直接针对 iMAP 的局限性进行改进。其核心思想源于将显式数据结构(特征网格)与隐式神经解码器相结合的混合式表达。
- 优缺点对比:
- 优点:
- 高保真重建: 能够生成细节丰富、几何精确的密集三维模型。
- 可扩展性: 引入的分层特征网格表示允许对地图进行局部更新,从而解决了单个 MLP 无法扩展到大场景的问题,效率更高。
- 鲁棒性: 实验证明,系统对动态物体和部分帧丢失具有较好的鲁棒性。
- 去闭环化趋势: 由于地图是全局共享和优化的,系统在重建过程中能保持较好的一致性,在一定程度上减弱了对传统显式闭环检测的依赖。
- 缺点:
- 计算量巨大: 优化过程仍然非常耗费计算资源,需要高端 GPU 支持。
- 可编辑性差: 生成的神经网络地图是一个“黑盒”,难以进行后期的手动编辑或语义操作。
- 跟踪稳定性: 尽管有所改进,但在剧烈运动或挑战性场景下,其跟踪鲁棒性仍可能不及成熟的几何方法。
- 优点:
NICE-SLAM 的分层特征网格是一种“两全其美”的巧妙设计,它融合了显式网格的结构化效率和隐式网络的连续高保真表达。纯隐式方法(如 iMAP)的问题在于,单个 MLP 必须编码整个场景,每当有新视角数据进入,整个网络都需要更新,这不仅速度慢,而且在大场景中容易遗忘早期观测到的区域。而纯显式体素网格虽然更新快且局部,但它是离散的,且在高分辨率下内存消耗巨大。NICE-SLAM 的混合方案则采用了一个从粗到精的多层级三维特征网格。一个三维查询点不再直接输入给一个庞大的 MLP,而是用其坐标通过三线性插值从这些网格中提取特征,然后将这些特征输入到更小的、专门化的 MLP 解码器中。这样的设计带来了决定性的优势:局部性。当新的一帧数据到来时,系统只需要更新相机视锥范围内的特征网格体素。这成功地将显式网格的局部高效更新特性引入了隐式表达的世界,从而解决了可扩展性的核心难题。这种“显式存储-隐式解码”的混合架构,成为了后续神经表示研究(如 Instant-NGP)的主流模式,是推动神经 SLAM 走向实用化的关键一步。
LiDAR 方向的探索: PIN-SLAM
Section titled “LiDAR 方向的探索: PIN-SLAM”PIN-SLAM 将隐式表示的思想成功地应用到了 LiDAR SLAM 领域。它提出了一种新颖的、基于“点”的隐式表示,这种表示既紧凑又具有“弹性”,使其能够完美地支持带有闭环检测的全局一致性建图。
- 论文: Pan, Y., Zhong, X., Wiesmann, L., Posewsky, T., Behley, J., & Stachniss, C. (2024). “PIN-SLAM: LiDAR SLAM Using a Point-Based Implicit Neural Representation for Achieving Global Map Consistency”. IEEE Transactions on Robotics. (https://arxiv.org/abs/2401.09101)
- 源码:(https://github.com/PRBonn/PIN_SLAM)
- 核心课题组: 德国波恩大学 (University of Bonn)。
- 常用数据集: KITTI Odometry Benchmark 等大规模自动驾驶数据集,同时也适用于 RGB-D 数据。
- 开创性相关工作: 该工作受到基于网格的隐式建图方法的启发,但敏锐地指出网格的刚性结构是实现闭环矫正时的一大障碍。因此,它创新地提出了基于点的表示作为一种更灵活的替代方案。
- 优缺点对比:
- 优点:
- SOTA 级精度: 实现了与顶级显式 LiDAR SLAM 系统相当甚至更优的定位精度。
- 全局一致性: 其“弹性”地图表示能够非常高效地在闭环后进行全局地图形变与修正,生成全局一致的地图。
- 完整的 SLAM 系统: 是首个包含里程计、基于特征的闭环检测、位姿图优化和全局一致性隐式建图的全功能神经 SLAM 系统。
- 紧凑与高效: 地图表示非常紧凑,且其基于“点到隐式模型”的配准方法无需寻找显式的点对点对应关系,提升了鲁棒性和效率。
- 缺点:
- GPU 依赖: 与其他神经方法一样,需要强大的 GPU 进行实时计算。
- 概念抽象: “神经点”的概念相比于传统的几何图元更为抽象,直观性稍差。
- 优点:
PIN-SLAM 的“弹性神经点”解决了地图表示的刚性与全局优化时形变需求之间的根本矛盾。在大范围建图中,当检测到一个闭环时,后端会优化整个位姿图,所有历史位姿都会被调整以消除累积误差。这意味着地图本身也必须随之“变形”以匹配修正后的轨迹。对于基于网格的表示(无论是显式的 Cartographer 还是隐式的 NICE-SLAM),网格都是刚性的,要让网格变形是一个非常复杂且容易引入错误伪影的操作。PIN-SLAM 的解决方案是,用一个稀疏的“神经点”集合来承载地图信息,每个神经点都附带一个可优化的特征向量。空间中任意查询点的 SDF 值,是通过插值其周围的神经点特征来得到的。其“弹性”体现在:当位姿图优化后,每个神经点都根据其关联关键帧的位姿修正量进行简单的刚性变换。由于整个连续的 SDF 场是由这些点连续插值定义的,因此整个隐式地图会随着这些点的移动而平滑、弹性地变形,从而在无需复杂的网格操作的情况下,轻松实现了全局一致性。这是对稠密建图全局一致性问题的一个极其优雅的解决方案,它揭示了一个深刻的原则:理想的 SLAM 地图表示,应该由离散、可变换的“锚点”(如神经点)来定义一个连续的底层场。这一原则,也将在后续的 3D 高斯泼溅技术中得到继承和发扬。
第三章:高斯泼溅与 SLAM 的融合前沿
Section titled “第三章:高斯泼溅与 SLAM 的融合前沿”在隐式神经表示之后,三维重建与 SLAM 领域迎来了最新的范式——3D 高斯泼溅(3D Gaussian Splatting, 3DGS)。3DGS 巧妙地结合了显式与隐式世界的优点:它使用显式的图元(三维高斯)来实现效率和可扩展性,同时利用一个可微分的光栅化渲染管线,实现了照片级质量的实时渲染和端到端的优化。
3D 高斯泼溅(3DGS):显式表达与微分渲染的统一
Section titled “3D 高斯泼溅(3DGS):显式表达与微分渲染的统一”- 核心原理: 3DGS 用海量的三维高斯函数集合来表示一个场景。每一个高斯体由其中心位置(均值 μ)、一个 3x3 的协方差矩阵 Σ(决定其形状和旋转)、颜色(通常用球谐函数 SH 表示)以及一个不透明度 α 来定义。
- 关键优势: 与 NeRF 需要沿每条光线进行耗时的步进采样不同,3DGS 采用了一个高度优化的、基于片元(Tile)的光栅化器,能够实时地(>100 FPS)将数百万个高斯体投影并混合到图像平面上。更重要的是,这个渲染过程是完全可微的,允许通过梯度下降进行极其快速的场景优化。
融合模式辨析
Section titled “融合模式辨析”当 3DGS 与 SLAM 结合时,主要出现了两种技术路线:
“SLAM for GS”(松耦合)
Section titled ““SLAM for GS”(松耦合)”- 原理: 这种方法采取一种务实的分解策略。它使用一个成熟、鲁棒的传统 SLAM 系统(如 ORB-SLAM3 或 LIO-SAM)作为独立的“位姿服务器” 45。SLAM 系统负责提供高质量的相机位姿,这些位姿随后被送入一个独立的 3DGS 建图模块。建图模块将这些位姿视为固定的、准确的真值,用以指导高斯场景的构建。
- 代表作: Photo-SLAM,它将 ORB-SLAM3 与 3DGS 进行了集成。
- 代码: Photo-SLAM 等相关工作的代码通常由其研究团队发布。
- 优缺点:
- 优点: 充分利用了现有 SLAM 系统在高精度跟踪和鲁棒性方面的优势。跟踪模块不易失败,尤其是在光照变化、快速运动等挑战性条件下。
- 缺点: 跟踪与建图是解耦的。SLAM 系统输出的位姿中任何残余的漂移都会被“固化”到 3DGS 地图中,无法通过渲染损失来反向修正位姿。地图的质量无法反哺跟踪的精度,不是一个端到端的系统。
这种松耦合方法是一个典型的工程化解决方案,它优先考虑了系统的鲁棒性而非理论上的最优性。直接从零开始联合优化位姿和高斯地图(即“GS as SLAM”)的难度很大,优化过程复杂且容易导致跟踪失败。松耦合方法则将这个难题分解,用最擅长的工具做最擅长的事:用经过千锤百炼的传统 SLAM 做跟踪,用渲染效果最好的 3DGS 做建图。这种信息流“单行道”的代价是牺牲了地图与位姿之间的闭环反馈。然而,对于以照片级真实感建图为首要目标,且能获得可靠位姿源的应用场景,这是一种非常有效的“过渡技术”。
“GS as SLAM”(紧耦合)
Section titled ““GS as SLAM”(紧耦合)”- 原理: 这是更彻底的融合方式。三维高斯体本身就是地图。对于每一帧新的输入图像,系统通过最小化渲染图像与输入图像之间的光度损失和/或几何损失,来联合优化当前帧的相机位姿以及高斯体的各项参数(位置、形状、颜色、不透明度)。
- 代表作: Gaussian-SLAM, SplaTAM。
- 代码:
- Gaussian-SLAM:(https://github.com/VladimirYugay/Gaussian-SLAM)
- SplaTAM:(https://github.com/spla-tam/SplaTAM) (项目主页 https://spla-tam.github.io/)
- 优缺点:
- 优点: 实现了真正的端到端联合优化。地图和位姿在统一的框架下相互精炼,如果跟踪成功,可以获得比松耦合方法更高保真度和一致性的结果。
- 缺点: 对跟踪漂移和失败更为敏感,尤其是在快速运动或纹理稀疏的场景中。优化过程对初始化较为敏感,且如何在大尺度场景中有效进行闭环矫正是一个巨大的挑战。
紧耦合“GS as SLAM”方法面临的核心挑战,是如何管理高斯地图的“可塑性”与“稳定性”之间的平衡。原始的 3DGS 优化流程是为离线多视图重建设计的,包含了非常激进的高斯“致密化”(densification)和“剪枝”(pruning)操作。在实时的 SLAM 流程中,这种激进的更新策略可能导致系统不稳定。一个暂时的、错误的位姿估计就可能导致系统在错误的地方创建大量高斯体,同时又删除了正确的高斯体,对地图造成不可逆的破坏。为此,研究者们正在重新借鉴经典 SLAM 的经验来解决这些问题。例如,Gaussian-SLAM 通过将场景组织成独立的“子地图”来提升扩展性并防止灾难性遗忘;SplaTAM 则通过渲染轮廓掩码,来指导系统仅在未被探索过的新区域添加高斯体,从而实现更可控的地图增长。更新的工作如 GLC-SLAM 则明确地将位姿图优化和闭环检测机制重新引入,以修正纯“帧到模型”跟踪所固有的累积漂移。这表明,GS-SLAM 的未来很可能是一种混合架构:既保留高斯地图端到端的可微特性,又利用经典 SLAM 中经过验证的、鲁棒的图优化框架来保证全局一致性。
专题分析:高级多模态输入对 SLAM 的颠覆性影响
Section titled “专题分析:高级多模态输入对 SLAM 的颠覆性影响”假设我们拥有一款理想化的“多模同源激光雷达”——一类在硬件层面实现多种数据流“时空对齐、物理层同构前融合”的传感器。具体数据流包括:HDR-RGB、HDR-NIR(近红外)、主动激光回波强度、绝对材质反射率、高精度深度(点云)以及内置 IMU。
a. 这个传感器的“物理层同构前融合”特性,将如何从根本上简化并增强 SLAM 前端的数据预处理和状态估计?
Section titled “a. 这个传感器的“物理层同构前融合”特性,将如何从根本上简化并增强 SLAM 前端的数据预处理和状态估计?”该传感器的核心特性将从根本上消除多传感器 SLAM 前端中两个最大、最棘手的误差来源:外参标定误差和时间同步误差,从而极大地简化算法并提升系统精度。
在传统的多传感器融合 SLAM 系统(如视觉惯性 VIO 或激光惯性 LIO)中,一个关键且繁琐的步骤是进行精确的传感器标定。这包括确定相机、LiDAR 和 IMU 之间精确的六自由度空间转换关系(外参)和微秒级的时间戳偏移(时偏)。任何标定误差都会作为系统性偏差引入到整个状态估计流程中,成为制约系统精度的天花板。例如,LIO-SAM 就需要用户提供精确的 IMU 到 LiDAR 的外参。
而这款“超级传感器”通过共用的光学路径和统一的硬件时钟,在物理层面保证了所有数据流(图像、点云、IMU)在出厂时就达到了完美的空间对齐和时间同步。对于 SLAM 前端而言,这意味着:
- 零标定负担: 不再需要复杂的离线标定流程和在线标定算法。
- 完美数据关联: 每一束激光返回的点,都天然地、精确地对应着图像上的一个像素,以及该时刻的 IMU 读数。数据以一个内在对齐的多模态向量
[x,y,z, r,g,b, nir, intensity, reflectance, ax,ay,az, gx,gy,gz]的形式被感知。 - 算法聚焦: SLAM 算法开发者可以将全部精力从繁琐的数据对齐和校正工作,转移到状态估计算法本身的核心逻辑上,从而催生出更简洁、更鲁棒、精度上限更高的前端里程计。
b. 绝对反射率和经 NIR 校正的回波强度这两个光照不变的通道,将如何催生出比传统视觉外观(RGB)或纯几何(点云)更鲁棒的地点识别与闭环检测算法?
Section titled “b. 绝对反射率和经 NIR 校正的回波强度这两个光照不变的通道,将如何催生出比传统视觉外观(RGB)或纯几何(点云)更鲁棒的地点识别与闭环检测算法?”这两个光照不变的通道,能够为场景提供一种物理层面的“材质指纹”,这种指纹的鲁棒性远超传统的视觉外观或纯几何结构,将催生出革命性的全天候、全季节地点识别算法。
-
传统方法的局限:
- 视觉外观 (RGB): 传统的视觉地点识别,如 ORB-SLAM 中的词袋模型,严重依赖图像的视觉外观。但外观会随着光照(白天/黑夜)、天气(晴天/阴天)、季节(夏季/冬季)的变化而剧烈改变。同一个办公室在正午和黄昏看起来截然不同,这使得跨时间、跨光照的闭环检测极为困难。
- 纯几何 (点云): 基于点云几何结构的地点识别,如 Scan Context,虽然对光照不敏感,但存在几何模糊性。许多室内走廊、室外道路在几何上看起来非常相似,难以区分。
-
物理不变性的威力:
- 绝对反射率: 这是一个物体表面的固有物理属性,它描述了该材质反射入射光的比例,理论上与光照强度和角度无关。一面砖墙的反射率值,无论是在正午的阳光下,还是在夜晚的路灯下,都应该是基本恒定的。
- NIR 校正强度: 865nm 的近红外主动光源及其回波强度,受环境光影响小,且对植被等特定材质有独特的响应,提供了另一个稳定的信息维度。
-
新一代地点识别算法:
基于这些物理不变量,可以构建全新的地点识别描述子。例如,可以对一个关键帧视锥范围内的所有点的反射率值和 NIR 强度值构建一个统计直方图或词袋模型。这个描述子不再描述“这个地方看起来像什么”,而是描述“这个地方是由哪些材质构成的”。这种基于“材质指纹”的匹配,将使得 SLAM 系统能够在夏天白天构建的地图中,于冬天的夜晚成功实现重定位和闭环检测,其鲁棒性是现有技术无法比拟的。
c. 这种“超级输入”是否是实现我们设想的“基于高斯泼溅的激光 SLAM 物理特征向量”方案的理想基石?请阐述如何利用这些多模态物理信息,来训练一个物理意义明确、而非抽象的“高斯特征场”,并用于 SLAM
Section titled “c. 这种“超级输入”是否是实现我们设想的“基于高斯泼溅的激光 SLAM 物理特征向量”方案的理想基石?请阐述如何利用这些多模态物理信息,来训练一个物理意义明确、而非抽象的“高斯特征场”,并用于 SLAM”是的,这种“超级输入”正是实现“基于高斯泼溅的激光 SLAM 物理特征向量”这一构想的理想基石。它能将 3DGS 从一个纯粹的视觉渲染工具,升维为一个具备物理意义的、可查询的世界建模引擎。
目前的 3DGS,其核心是渲染照片般真实的 RGB 图像。高斯体携带的颜色信息由球谐函数(SH)表示,这本质上只是对视角相关外观的一种紧凑编码,没有任何物理含义。
利用这款“超级传感器”,我们可以对高斯泼溅的底层图元进行重新定义,并构建一个高斯物理特征场 (Gaussian Physical Feature Field),具体阐述如下:
-
重新定义高斯基元: 我们不再让网络直接学习抽象的 SH 系数,而是改变高斯体的属性。每个高斯体将由
(μ, Σ, α, F)定义,其中μ(位置),Σ(协方差),α(不透明度) 保持不变,但颜色被一个可学习的、高维的物理特征向量F所取代。 -
构建多头解码器: 这个潜藏的特征向量
F将被多个并行的、小型的 MLP“解码头”进行解码,每个头对应一种物理模态:- headrgb(F)→预测的 RGB 颜色
- headnir(F)→预测的 NIR 强度
- headreflectance(F)→预测的绝对反射率值
- headgeometry(F)→预测的 SDF 值(可选,用于几何约束)
-
设计复合物理损失函数: 在 SLAM 的联合优化过程中,损失函数将不再仅仅是 RGB 图像的渲染误差。它会变成一个加权的复合损失:
其中每一项都是其对应模态的渲染值与传感器真实观测值之间的误差。通过最小化这个复合损失,系统被“强迫”去学习一个能够同时、自洽地解释所有物理观测的底层特征表示 F。这个 F 不再是抽象的,而是被多种物理规律共同约束的、具有明确物理意义的特征。
-
生成高斯物理特征场: 最终,整个 SLAM 系统构建的将不再仅仅是一个能看的地图,而是一个可查询、可分析的物理世界模型。用户可以对这个模型提出远超视觉渲染的请求:
- “以夜视仪的视角渲染此场景”(调用 NIR 解码头)。
- “高亮显示场景中所有反射率与金属相符的物体”(调用反射率解码头进行阈值分割)。
- “分析此区域的植被覆盖率”(利用 NIR 和 RGB 的组合特征)。
这种“超级输入”提供了构建这样一个系统所必需的、在物理层面对齐的、多模态的、带有真值的监督信号。它将是实现从“数字场景”到真正意义上的“物理数字孪生”的关键技术基石。
第四章:总结与未来展望
Section titled “第四章:总结与未来展望”为了清晰地总结上述讨论,下表从多个关键维度对比了显式、隐式和高斯泼溅三大 SLAM 范式。
| 性能指标 | 显式 SLAM (特征点/LiDAR) | 隐式 SLAM (NeRF-based) | 高斯泼溅 SLAM (紧耦合) |
|---|---|---|---|
| 地图表示 | 离散几何图元 (点、线、面、体素) | 连续函数 (神经网络权重) | 显式图元集合 (3D 高斯) |
| 跟踪精度 | 非常高 | 中到高 | 中到高,对漂移敏感 |
| 建图保真度 | 低 (稀疏) / 中 (栅格) | 非常高 (照片级/几何细节丰富) | 非常高 (照片级) |
| 对纹理/几何的鲁棒性 | 依赖特定特征 (纹理或几何) | 较好,依赖光度一致性 | 较好,依赖光度一致性 |
| 对光照变化的鲁棒性 | 视觉:低;LiDAR:高 | 中等 | 中等 |
| 实时能力 | 非常高 | 低 (计算密集) | 高 (实时渲染) |
| 内存占用 | 随场景规模线性增长 | 低,由网络大小决定 | 高,随高斯数量增长 |
| 全局一致性方法 | 显式闭环 + 位姿图优化 | 隐式全局优化,对显式闭环依赖弱 | 正在积极探索中,需引入图优化 |
| 下游任务适用性 | 导航:好;渲染:差 | 渲染:好;导航:需额外处理 | 渲染:非常好;导航:需额外处理 |
纵观 SLAM 技术从显式到隐式,再到显式与可微渲染结合的演进历程,可以预见其未来的发展将呈现以下几个核心趋势:
- 迈向多模态物理 SLAM: 未来的地图将不再局限于几何与颜色。正如第三章的专题分析所揭示的,随着能够提供绝对反射率、热成像、偏振等多物理维度信息的传感器出现,SLAM 的核心将转向构建真正的“物理数字孪生”。地图将编码物质的内在属性,使得机器人能够基于物理原理进行推理和交互,而不仅仅是几何导航。
- 语义与交互的深度融合: SLAM 地图将从一个被动的几何容器,转变为一个主动的、可交互的智能体世界模型。与视觉-语言大模型(VLMs)的结合将是关键。用户将能够用自然语言查询地图(例如,“去最近的会议室”),机器人则能理解指令中的高级语义概念,并在地图中进行定位和规划。这将是实现具身智能(Embodied AI)的关键一步。
- 学习与几何的再统一: 当前,鲁棒的经典几何方法 与高保真的学习表示方法 之间仍存在一定的张力。未来的趋势将是两者的深度融合,而非相互替代。我们可以预见,未来的 SLAM 架构将使用强大的深度学习模型进行前端的特征提取、数据关联和数据驱动的先验预测;但其核心后端将依然依赖于经典的、基于图优化的几何约束框架(如位姿图、BA),以保证整个系统的数学严谨性、可解释性和全局一致性。
- 实时性、可部署性与效率: 神经表示和高斯泼溅 SLAM 方法巨大的计算开销是其走向广泛应用的主要障碍。因此,未来的研究重点将高度集中于算法效率的提升。这包括模型量化与压缩、针对边缘计算设备(如机器人板载 NPU)的专门硬件加速、以及发展更紧凑高效的场景表示方法(如 RTG-SLAM 中的紧凑高斯模型),最终目标是让这些强大的 SLAM 能力能够在真实世界的机器人和消费级设备上实时、低功耗地运行。
- UZ-SLAMLab/ORB_SLAM3: ORB-SLAM3: An Accurate Open-Source Library for Visual, Visual-Inertial and Multi-Map SLAM - GitHub
- Cartographer SLAM Method for Optimization with an Adaptive Multi-Distance Scan Scheduler - MDPI
- ORB-SLAM3: An Accurate Open-Source Library for Visual, Visual–Inertial, and Multimap SLAM | Request PDF - ResearchGate
- arXiv:2007.11898v2 [cs.RO] 23 Apr 2021
- ORB-SLAM3 0n ubuntu - GitHub
- kmavvisualinertialdatasets – ASL Datasets
- (PDF) The EuRoC micro aerial vehicle datasets - ResearchGate
- Augmenting ORB‑SLAM3 with Deep Features, Adaptive NMS, and Learning‑Based Loop Closure - arXiv
- The KITTI Vision Benchmark Suite - Andreas Geiger
- ORB-SLAM3AB: Augmenting ORB-SLAM3 to Counteract Bumps with Optical Flow Inter-frame Matching This work was supported by the National Science Foundation of China 62271392, Shaanxi Innovation Team 2023CXTD04. Corresponding author: Chen He(chenhe@nwu.edu.cn). 1These authors contribute equally to this paper and should be considered as - arXiv
- LIO-SAM: Tightly-coupled Lidar Inertial Odometry via Smoothing and Mapping
- gisbi-kim/SC-LIO-SAM: LiDAR-inertial SLAM - GitHub
- TixiaoShan/LIO-SAM: LIO-SAM: Tightly-coupled Lidar … - GitHub
- Tightly-Coupled LiDAR-Visual-Inertial SLAM and Large-Scale Volumetric Occupancy Mapping - arXiv
- LOAM: Lidar Odometry and Mapping in Real-time
- LOAM: Lidar Odometry and Mapping in Real-time
- LOAM: Lidar Odometry and Mapping in Real-time - Carnegie Mellon University’s Robotics Institute
- LPVIMO-SAM: Tightly-coupled LiDAR/Polarization Vision/Inertial/Magnetometer/Optical Flow Odometry via Smoothing and Mapping - arXiv
- (PDF) LOAM : Lidar Odometry and Mapping in real-time - ResearchGate
- JokerJohn/LIO_SAM_6AXIS: LIO_SAM for-axis IMU and GNSS. - GitHub
- (PDF) IMPROVING GOOGLE’S CARTOGRAPHER 3D MAPPING BY CONTINUOUS-TIME SLAM - ResearchGate
- Cartographer — Cartographer documentation
- cartographer-project/cartographer: Cartographer is a … - GitHub
- Cartographer - GitHub
- hanmmmmm/Google-Cartographer-SLAM-with-Velodyne16 - GitHub
- Cartographer SLAM based mapping of an Indoor Environment using LIDAR - iarjset
- Improving Sensor Adaptability and Functionality in Cartographer Simultaneous Localization and Mapping - MDPI
- NeRF-Based SLAM | Encyclopedia MDPI
- SNI-SLAM: Semantic Neural Implicit SLAM - arXiv
- NICE-SLAM - Songyou Peng
- NICE-SLAM: Neural Implicit Scalable Encoding for SLAM
- NICE-SLAM: Neural Implicit Scalable Encoding for SLAM - CVF Open Access
- [CVPR’22] NICE-SLAM: Neural Implicit Scalable Encoding for SLAM - GitHub
- NICER-SLAM
- JingwenWang95/neural_slam_eval: Neural SLAM Evaluation Benchmark. [CVPR’23] Co-SLAM - GitHub
- arxiv.org
- PIN-SLAM: LiDAR SLAM Using a Point-Based Implicit Neural Representation for Achieving Global Map Consistency
- PRBonn/PIN_SLAM: PIN-SLAM: LiDAR SLAM Using a Point-Based Implicit Neural Representation for Achieving Global Map Consistency [TRO’ 24] - GitHub
- yizhezhang0418/PIN_SLAM - GitHub
- LiDAR SLAM Using a Point-Based Implicit Neural Representation for Achieving Global Map Consistency - arXiv
- PINGS: Gaussian Splatting Meets Distance Fields within a Point-Based Implicit Neural Map
- 3D Gaussian Splatting for Real-Time Radiance Field Rendering - Inria
- 3D Gaussian Splatting for Real-Time Radiance Field Rendering | Qiang Zhang
- 3D Gaussian Splatting for Real Time Radiance Field Rendering Using Insta360 Camera: - CORE
- SGF-SLAM: Semantic Gaussian Filtering SLAM for Urban Road Environments - PMC
- GLC-SLAM: Gaussian Splatting SLAM with Efficient Loop Closure - arXiv
- Photo-realistic Dense SLAM with Gaussian Splatting | OpenReview
- Photo-realistic Dense SLAM with Gaussian Splatting - arXiv
- GS-SLAM: Dense Visual SLAM with 3D Gaussian Splatting
- SplaTAM: Splat Track & Map 3D Gaussians for Dense RGB-D SLAM - CVF Open Access
- Gaussian-SLAM: Photo-realistic Dense SLAM with Gaussian Splatting - GitHub
- SplaTAM: Splat, Track & Map 3D Gaussians for Dense RGB-D SLAM
- SplaTAM: Splat, Track & Map 3D Gaussians for Dense RGB-D SLAM spla-tam . github . io
- Robust Gaussian Splatting SLAM by Leveraging Loop Closure - ResearchGate
- Real-Time Photo-Realistic SLAM with Gaussian Splatting and LiDAR-Inertial-Camera Fusion - arXiv
- RTG-SLAM: Real-time 3D Reconstruction at Scale Using Gaussian Splatting - gapszju
- NeRF and Gaussian Splatting SLAM in the Wild - arXiv