三维数字世界的范式革命
摘要
三维数字世界的构建正经历一场深刻的范式革命,其核心驱动力源于三维场景表示方法的演进。本综述报告系统性地梳理了这一革命性进程,将其划分为三个关键阶段:**以点云、网格为代表的、基于离散化思想的显式表示(“数值解”);以神经辐射场(NeRF)为代表的、基于连续函数思想的隐式表示(“解析解”);以及近期由 3D 高斯泼溅(3D Gaussian Splatting)引领的、兼具二者之长的混合表示新范式。**报告深入解构了 3D 高斯泼溅在保留隐式场优化能力的同时,如何通过显式基元与可微光栅化实现实时渲染与高效训练,从而解决了隐式表示的性能瓶颈。在此基础上,报告深度剖析了这一范式革命在同步定位与建图(SLAM)和三维感知两大前沿领域的颠覆性应用。在 SLAM 领域,探讨了从传统特征法、因子图优化到基于隐式与混合表示的实时高保真稠密建图的技术迭代,并特别关注了激光雷达(LiDAR)与神经场融合的最新进展。在感知领域,分析了”渲染即感知”的新理念,即通过特征场蒸馏将二维基础模型的强大语义能力注入三维表示中,构建智能化的数字孪生。报告进一步指出了当前面临的核心挑战,包括从新型表示向传统网格模型转换时固有的”翻译失真”风险,并前瞻性地探讨了新一代多模态数字 LiDAR 如何通过直接采集物理层同构的前融合数据——免标定的高动态范围(HDR)被动环境光信息、主动回波强度信息、材质反射率信息与点云深度及 IMU 位姿信息等——为实现终极的”高维特征泼溅”与”逆渲染”带来曙光。通过重新定义高斯基元、构建多头解码器、设计复合物理损失函数、生成高斯物理特征场,有望将 3DGS 从一个纯粹的视觉渲染工具,升维为一个具备物理意义的、可查询的世界建模引擎。这种”超级输入”提供了构建这样一个系统所必需的、在物理层面对齐的、多模态的、可解释的、带有真值的监督信号,将是实现从”数字场景”到真正意义上的”物理数字孪生”的关键技术基石。最后,报告总结了贯穿整个技术演进的核心权衡——在”完美复刻现实”与”构建可用数字资产”之间的动态博弈,并展望了未来融合混合表示、感知智能与传感器协同设计的技术发展方向,旨在最终消除这一权衡,创造出兼具物理真实性、语义可理解性与实时交互性的动态数字世界。
1. 引言:重塑现实的数字孪生之路
Section titled “1. 引言:重塑现实的数字孪生之路”在物理世界与数字信息日益交融的时代,构建高保真、可交互的现实世界数字孪生(Digital Twin)已成为计算机图形学、计算机视觉与机器人学等领域的终极目标之一。这一宏大愿景旨在创造一个与物理世界在几何、外观乃至物理规律上完全对应的虚拟副本,从而赋能从元宇宙、自动驾驶、智慧城市到工业仿真的广泛应用。然而,通往这一目标的道路上始终存在一个核心的技术张力与哲学权衡:我们追求的究竟是对现实世界进行不差分毫的”完美复刻”(Perfect Replication),还是构建一个虽然视觉上逼真,但更重要的是可编辑、可交互、可理解的”可用数字资产”(Usable Digital Assets)。
“完美复刻”强调的是视觉保真度的极致。其目标是生成在任意视角下都与真实照片无法区分的渲染图像,捕捉现实世界中所有复杂的光影、材质与几何细节。而”可用数字资产”则更侧重于数字孪生的功能性与实用性。一个可用的数字资产不仅需要视觉逼真,还必须具备清晰的结构,其内部组件应是可分离、可编辑、可赋予物理属性和语义标签的。例如,在自动驾驶仿真中,我们需要能够改变场景中的光照条件;在虚拟现实应用中,用户需要与场景中的物体进行交互;在机器人任务规划中,系统需要理解场景中”椅子”和”桌子”的语义概念。
长期以来,这两种追求似乎是相互矛盾的,并直接体现在三维场景表示方法的演进路径上。传统的显式几何表示方法,如三角网格(Mesh),天然地支持编辑与交互,但要达到照片级的真实感却异常困难,尤其是在处理反射、透明等复杂光学现象时,这代表了”可用性”优先的路径。而近年来兴起的隐式神经表示方法,特别是神经辐射场(NeRF),在”复刻”真实感方面取得了革命性突破,但其将整个场景编码于一个难以解析的神经网络”黑箱”中,使得编辑与交互变得极为困难,这代表了”复刻”优先的路径。整个领域似乎陷入了一个两难的境地:要么选择可交互但视觉效果欠佳的模型,要么选择视觉惊艳但几乎无法使用的模型。
本章旨在论证,三维表示技术的发展并非线性的增量改进,而是一场正在发生的、深刻的范式革命。这场革命正逐步化解上述”复刻”与”可用”之间的矛盾。我们将系统性地追溯这场革命的脉络:从以点云、网格为代表的、将世界视为离散采样集合的显式表示范式;到以 NeRF 为核心的、将世界描述为连续函数的隐式表示范式;最终聚焦于近期由 3D 高斯泼溅(3D Gaussian Splatting)所引爆的、巧妙融合了离散基元与连续场思想的混合表示新范式。正是这一混合范式的出现,才真正为实时、高保真且具备交互潜力的数字孪生应用(如同步定位与建图 SLAM 和高级三维感知)打开了大门,同时也带来了模型转换、多模态数据融合等一系列全新的挑战与机遇。
2. 三维表示的二元论:显式与隐式的哲学思辨
Section titled “2. 三维表示的二元论:显式与隐式的哲学思辨”在深入探讨最新的技术突破之前,有必要首先回顾并解构三维表示领域的两大经典思想流派:显式表示与隐式表示。这两种范式不仅在技术实现上截然不同,其背后更蕴含着对数字世界构建方式的两种根本不同的哲学观念。它们可以被类比为求解一个复杂物理问题的两种方法:数值解与解析解。
2.1 显式表示:离散化的世界观与数值解
Section titled “2.1 显式表示:离散化的世界观与数值解”显式表示,顾名思义,是通过直接、明确地定义场景中的几何元素来描述三维世界。这种方法如同用数值方法求解一个连续函数,通过在定义域内进行有限次的采样,并定义这些采样点之间的关系来近似描述整个函数。其核心思想是对连续的物理现实进行离散化采样。主流的显式表示方法包括点云、网格和体素栅格。
- 点云(Point Clouds): 点云是三维世界最原始、最直接的数字表达。它由一系列在三维空间中具有确定坐标 的点的集合构成,通常由激光雷达(LiDAR)或摄影测量等三维扫描设备直接获取。每个点还可以附带颜色、反射强度等额外属性。点云的优点在于其表示的简洁性与灵活性,能够以极高的精度捕捉物体的精细几何细节,尤其适用于大规模户外场景的原始数据采集。然而,其致命的缺点在于数据是无序且非结构化的,点与点之间缺乏明确的拓扑连接信息。这使得诸如表面法线计算、曲率分析等操作变得复杂,并且直接渲染点云难以形成连续平滑的表面,视觉效果较差。
- 网格(Meshes): 网格,特别是三角网格,是计算机图形学中最经典、应用最广泛的表示方法。它由顶点(Vertices)、边(Edges)和面(Faces)构成,明确定义了三维物体的表面拓扑结构。与点云相比,网格的结构化特性使其非常适合进行高质量的渲染、物理仿真和几何分析。然而,网格本质上是对真实世界的一种插值和近似。从点云生成网格的过程(即表面重建)本身就是一个充满挑战的课题,往往伴随着细节的丢失或引入不真实的平滑。对于具有复杂拓扑或非流形结构的物体,网格表示也面临困难。
- 体素栅格(Voxel Grids): 体素是二维像素(Pixel)在三维空间中的扩展,它将空间划分为规整的立方体单元格。每个体素存储一个值,例如表示该空间单元是否被占据。这种规整的结构使其非常适合进行空间索引和体积分析,并且与三维卷积神经网络(3D CNNs)等深度学习模型有良好的兼容性。但体素表示的主要弊端是其巨大的内存消耗,存储空间随分辨率的提升呈立方级增长,这严重限制了其在高分辨率场景中的应用。同时,其离散的栅格结构难以精确表达平滑的曲面和精细的结构。
从根本上看,所有显式表示方法都共享一种”数值解”的哲学。它们通过有限的离散元素(点、顶点、体素)来逼近一个无限复杂的连续现实。这种方法的优势在于其构成元素是可直接寻址和编辑的——移动一个顶点、删除一个点或改变一个体素的状态都是直观且计算上可行的操作。然而,其表达的精度和真实感永远受限于采样的密度和分辨率,采样点之间的”空白”区域只能通过插值或假设来填充,这构成了其保真度的天然上限。
2.2 隐式表示:连续场的世界观与解析解
Section titled “2.2 隐式表示:连续场的世界观与解析解”与显式表示的离散化思想相对,隐式表示采用了一种截然不同的世界观。它不直接存储几何元素,而是通过一个连续函数来定义整个三维空间。空间中的任何一点 都可以通过查询该函数 来获得其属性,例如该点是否位于物体表面内部(如符号距离函数 SDF,)、或者其颜色和密度。这种方法如同为物理问题找到了一个”解析解”——一个能够描述系统在任意点的状态的封闭形式的数学公式。
神经辐射场(NeRF)是这一思想的巅峰之作,它引发了三维视觉领域的深刻变革。
-
NeRF 核心原理: NeRF 将一个静态三维场景表示为一个连续的五维函数,通常由一个多层感知机(MLP)实现。该函数 将一个三维空间坐标 和一个二维观测方向 映射到一个体积密度 和一个与视角相关的颜色 :
通过沿着相机射线进行体渲染(Volume Rendering),NeRF 可以从任意新视角合成照片般逼真的图像。模型的参数 完全通过一组已知相机位姿的二维图像进行端到端的监督学习,而无需任何三维几何真值。
-
范式优势: NeRF 的最大优势在于其前所未有的新视角合成质量。由于其连续的函数表示,它能够以极高的保真度捕捉和重现复杂的、与视角相关的光学现象,如高光、反射和半透明材质,这些都是传统显式模型难以企及的。此外,NeRF 的连续性使其在处理遮挡和填充数据稀疏区域时表现出色,能够生成平滑且完整的几何表面。
-
根本性局限: 尽管 NeRF 在视觉质量上取得了巨大成功,但其作为一种”解析解”的范式也带来了根本性的局限,严重阻碍了其在实时和交互式应用中的部署:
- 极高的计算成本: NeRF 的训练和渲染过程都极为缓慢。训练一个场景通常需要数小时甚至数天,因为优化过程需要对海量像素进行反向传播。渲染一张图像同样耗时,因为它要求沿着每条相机射线密集采样数百个点,并对每个点进行一次完整的 MLP 前向传播。
- 静态场景假设: 原始 NeRF 模型假设场景是完全静态的,无法表示任何动态或可变形的物体,如运动的人或动物。
- 数据与位姿依赖: NeRF 的训练高度依赖大量高质量、多视角的输入图像以及精确的相机位姿。在数据稀疏或位姿不准的情况下,其重建质量会急剧下降。
- 可编辑性的缺失: 这是其最根本的缺陷。整个场景被编码在神经网络的权重中,形成一个”黑箱”。对场景进行局部编辑(如移动一把椅子)几乎是不可能的,因为这需要改变整个连续函数 的形态,通常意味着代价高昂的重新训练或复杂的模型解耦。
这种”解析解”的哲学赋予了 NeRF 强大的表达能力,理论上它可以用一个紧凑的函数模型描述具有无限细节的场景。然而,这种整体性、连续性的表示方式也使其失去了局部可操作性。对模型的任何微小改动都可能牵一发而动全身,破坏整个函数的全局一致性。
表 1:三维表示范式对比分析
| 范式 | 关键技术 | 核心原理 | 优势 | 劣势 |
|---|---|---|---|---|
| 显式(Explicit) | 点云、网格、体素 | 离散采样(“数值解”) | 易于编辑、几何精度高、与传统图形管线兼容 | 内存消耗大、难以表达复杂光学现象、视觉真实感有限 |
| 隐式(Implicit) | 神经辐射场(NeRF) | 连续函数(“解析解”) | 照片级真实感、能表达复杂视角相关效应、模型紧凑 | 训练和渲染速度极慢、静态场景假设、难以编辑和交互 |
| 混合(Hybrid) | 3D 高斯泼溅(3DGS) | 离散基元与连续场结合(“离散化解析解”) | 实时渲染、训练速度快、视觉质量高、基元可编辑 | 内存占用较大、向传统网格转换存在信息损失 |
这种显式与隐式之间的二元对立,不仅仅是技术路线的选择,更反映了应用需求的内在矛盾。图形学和交互应用(如游戏、CAD)需要的是可直接操控的离散组件,因此长期以来依赖显式网格。而视觉重建和新视角合成则追求极致的真实感,这促使了隐式 NeRF 的诞生。然而,没有任何一个应用场景只关心其中一个方面。一个理想的数字孪生必须同时具备照片级的真实感和灵活的可交互性。显式模型的”数值解”易于修改局部值,但难以提升全局精度;隐式模型的”解析解”全局精确,但修改局部行为则需要重解整个方程。这个根本性的矛盾为第三种范式的出现创造了历史性的机遇——一个既能利用解析函数的表达能力,又能保持数值方法的离散可操作性的新范式。
3. 混合范式的崛起:3D 高斯泼溅的解构与重塑
Section titled “3. 混合范式的崛起:3D 高斯泼溅的解构与重塑”在显式与隐式表示的二元对立所造成的应用鸿沟中,3D 高斯泼溅(3D Gaussian Splatting,3DGS)作为一种革命性的混合范式横空出世,它并非对前两种范式的简单组合,而是通过一种全新的设计哲学,成功地统一了实时性能、渲染质量与可编辑潜力,从而重塑了三维数字世界的构建方式。
3.1 核心原理:作为显式基元的隐式场
Section titled “3.1 核心原理:作为显式基元的隐式场”3DGS 的核心思想是将一个三维场景表示为数百万个三维高斯分布的集合。每一个高斯分布都是一个独立的、可优化的”基元”(primitive),它同时具备显式表示和隐式表示的特性,构成了混合范式的基石。
这种混合的本质体现在单个高斯基元的参数化定义中:
- 显式的位置与结构:
- 位置(均值 ): 每个高斯都有一个明确的三维中心坐标 。这使得场景由一组离散、可数的对象构成,为直接的空间操作(移动、删除、添加)提供了可能。
- 协方差矩阵 : 这是一个 的对称正定矩阵,决定了高斯分布的形状和方向。在优化过程中,它被分解为一个旋转矩阵 (通过四元数表示)和一个对角缩放矩阵 ,即 。这种各向异性(anisotropic)的协方差允许每个高斯基元被拉伸和旋转成任意形状的椭球体。这至关重要,因为它使得单个高斯可以高效地表示细长的线状结构或平坦的片状表面,极大地提升了表达效率。
- 隐式的外观与体积属性:
- 颜色(球谐函数 SH): 每个高斯的颜色并非一个固定的 RGB 值,而是由一组球谐函数(Spherical Harmonics)的系数来定义。球谐函数是一组定义在球面上的正交基函数,能够表示复杂的角度依赖函数。通过存储 SH 系数,每个高斯可以根据观测方向动态地计算出颜色,从而细腻地捕捉到高光、反射等与视角相关的外观变化,而无需进行复杂的光线追踪或全局光照计算。
- 不透明度 : 一个标量值,控制着高斯基元的透明度。它决定了该高斯在渲染时对最终像素颜色的贡献权重。
因此,3DGS 的场景表示是显式的,因为它由大量可独立寻址的高斯基元构成;同时它又是隐式的,因为每个高斯基元本身都定义了一个覆盖整个三维空间的连续体积场(尽管其影响范围在远离中心后会迅速衰减),并且场景的最终外观是通过一个端到端的可微渲染过程来优化的。这种设计巧妙地规避了纯显式模型难以表达复杂外观和纯隐式模型难以进行局部操作的困境。
3.2 范式优势:实时渲染与高效优化的统一
Section titled “3.2 范式优势:实时渲染与高效优化的统一”3DGS 之所以能引发范式革命,关键在于它不仅在理论上融合了显式与隐式的优点,更在实践中通过创新的渲染与优化管线,实现了性能上的巨大飞跃。
-
革命性的渲染管线: NeRF 性能瓶颈的核心在于其基于光线步进的体渲染过程,该过程需要对每个像素的每条光线进行数百次 MLP 查询,计算量巨大且难以并行化。3DGS 则彻底抛弃了这一模式,转而采用了一种高度并行化的、基于光栅化(Rasterization)的渲染管线,这与现代 GPU 的硬件架构完美契合。其渲染流程大致如下:
- 投影: 对于给定的相机视角,场景中的所有三维高斯椭球体被解析地投影到二维图像平面上,形成一系列二维高斯”泼溅”(splats)。
- 光栅化: 使用一种基于瓦片(tile-based)的高效算法,快速确定每个二维高斯泼溅所覆盖的像素瓦片。
- 排序与混合: 在每个瓦片内,根据深度对所有覆盖该瓦片的高斯进行排序,然后从前到后依次进行 Alpha 混合(alpha compositing),累积计算出每个像素的最终颜色。
由于整个渲染过程是可微的,因此可以计算出最终渲染图像的像素值相对于每个高斯参数(位置、协方差、颜色、不透明度)的梯度,从而实现端到端的优化。这一流程将 NeRF 中密集的、依赖神经网络的计算替换为高度优化的几何投影和像素混合操作,从而实现了惊人的性能提升,能够在 1080p 分辨率下达到超过 100 FPS 的实时渲染速率。
-
高效的优化策略: 3DGS 的训练过程同样高效。它通常从运动恢复结构(Structure-from-Motion,SfM)算法生成的稀疏点云开始,将每个点初始化为一个三维高斯。随后,在渲染损失的驱动下,通过梯度下降对所有高斯的参数进行优化。其核心是一种自适应密度控制(adaptive density control)策略:
- 致密化(Densification): 在优化的早期阶段,系统会周期性地识别那些梯度较大(即重建误差显著)的区域。对于”欠重建”(under-reconstructed)区域中的高斯,系统会将其”克隆”成一个或多个更小的高斯;对于”过重建”(over-reconstructed)区域中过大的高斯,则会将其”分裂”成两个较小的高斯。
- 剪枝(Pruning): 系统会周期性地移除那些不透明度极低(几乎透明)或者尺寸过大(超出合理范围)的高斯。
这种”克隆-分裂-剪枝”的动态过程,使得高斯基元的分布能够自适应地匹配场景的几何复杂性,将计算资源集中在最需要细节的区域,从而在保证重建质量的同时,极大地加速了收敛过程。一个高质量的 3DGS 模型通常在几十分钟内即可训练完成,相比于同等质量的 NeRF 模型动辄数十小时的训练时间,效率提升了数个数量级。
这种混合范式可以被理解为一种”离散化的解析解”。它没有像 NeRF 那样试图用一个庞大而复杂的全局解析函数来拟合整个世界,而是将这个宏大的问题分解为用数百万个简单、局部的解析函数(即高斯分布)来拟合世界的各个微小部分。每一个局部函数都易于计算和求导,而将它们组合在一起的渲染过程又可以被高效地并行化。3DGS 的成功证明,要获得隐式场的连续性和高质量渲染能力,并不一定需要依赖于一个单一的、巨大的神经网络。通过将场景分解为大量显式的、可微的基元,可以同时获得隐式表示的质量和显式表示的效率与灵活性。这一设计思想不仅是 3DGS 本身成功的关键,更为未来三维表示技术的发展开辟了全新的道路,激发了对其他类型可微基元(如神经面元、凸体等)的研究,标志着三维表示领域从”显式 vs 隐式”的二元对立,迈向了二者深度融合的新纪元。
4. SLAM 的演进:从定位到高保真建图
Section titled “4. SLAM 的演进:从定位到高保真建图”同步定位与建图(Simultaneous Localization and Mapping,SLAM)是机器人和增强现实领域的核心技术,其目标是在未知环境中实时估计自身位姿并同时构建环境地图。SLAM 技术的发展与三维表示方法的演进紧密相连,地图的表示形式直接决定了 SLAM 系统的性能、鲁棒性以及最终的应用价值。从稀疏的特征点图到稠密的几何地图,再到如今照片级的神经场地图,SLAM 的演进过程清晰地反映了三维表示范式的革命。
4.1 传统 SLAM 框架中的耦合与特征
Section titled “4.1 传统 SLAM 框架中的耦合与特征”在神经表示方法兴起之前,主流的 SLAM 系统主要围绕显式几何表示构建,并根据传感器的不同形成了两大技术路线。
- 基于特征的视觉 SLAM: 以 ORB-SLAM3 为代表的系统是这一路线的巅峰之作。这类系统首先从图像中提取稀疏但具有强辨识度和可重复性的关键点(如 ORB 特征),然后在连续的图像帧之间进行匹配,通过最小化重投影误差来估计相机运动。其构建的地图本质上是一个稀疏的 3D 点云,主要服务于定位任务,能够实现高精度的相机跟踪和鲁棒的回环检测。ORB-SLAM3 通过紧密耦合的视觉-惯性里程计(Visual-Inertial Odometry,VIO)和强大的多地图管理系统,在多种环境下都表现出卓越的性能。然而,其地图的稀疏性使其无法提供环境的稠密几何与外观信息,限制了其在需要高保真重建的应用中的价值。
- 基于优化的激光雷达-惯性 SLAM: 以 LIO-SAM 为代表的系统则专注于利用 LiDAR 和惯性测量单元(IMU)进行高精度建图。这类系统采用紧耦合(tightly-coupled)的策略,将 LiDAR 扫描匹配的几何约束、IMU 预积分的运动约束以及 GPS 的全局位置约束统一到一个因子图(Factor Graph)中进行联合优化。通过平滑与建图(Smoothing and Mapping),LIO-SAM 能够构建出大规模、高精度、几何结构清晰的稠密点云地图。这类地图在机器人导航、测绘等领域具有重要价值,但它们缺乏真实的光照和纹理信息,无法实现照片级的视觉渲染。
4.2 隐式与混合 SLAM:实时高保真重建的曙光
Section titled “4.2 隐式与混合 SLAM:实时高保真重建的曙光”NeRF 的出现为 SLAM 领域带来了全新的可能性:构建一个既能用于精确定位,又能进行照片级渲染的统一地图。这催生了神经 SLAM(Neural SLAM)这一新兴研究方向。
- 第一波浪潮:隐式 SLAM。 早期的神经 SLAM 系统尝试将 NeRF 的 MLP 作为地图表示。
- iMAP 是该领域的开创性工作,它首次证明了仅使用一个 MLP 作为场景表示,就可以在 RGB-D 相机的输入下实现实时的稠密 SLAM。iMAP 采用类似传统 SLAM 的关键帧机制,在跟踪线程中优化相机位姿,在建图线程中优化 MLP 参数。然而,其单一全局 MLP 的架构使其难以扩展到更大的场景,容易发生灾难性遗忘。
- NICE-SLAM 针对 iMAP 的可扩展性问题进行了改进,引入了一种分层的、基于特征栅格的场景表示。它将空间划分为粗糙到精细的多层级体素网格,每个网格点存储一个特征向量,再通过一个小型解码器网络将插值后的特征解码为颜色和密度。这种设计使得地图更新可以更加局部化,从而更好地适应大场景建图。尽管如此,这些基于纯隐式表示的 SLAM 系统仍然受限于渲染速度,难以在保持高重建质量的同时实现高速跟踪。
- 第二波浪潮:混合 SLAM。 3DGS 的出现彻底改变了神经 SLAM 的格局。其作为地图表示的天然优势——快速可微渲染与显式基元结构——完美契合了 SLAM 系统的需求,引发了一系列基于 3DGS 的 SLAM 系统的井喷式发展。
- 核心协同机制: 3DGS 与 SLAM 的结合展现出一种深刻的协同效应。一方面,3DGS 极快的渲染速度(>100 FPS)使得系统可以进行实时的、基于稠密光度误差的相机位姿跟踪,即直接将当前帧图像与从 3DGS 地图渲染出的图像进行对比来优化位姿,这比稀疏特征匹配更为鲁棒和精确。另一方面,3DGS 的显式基元结构使得地图的增量式更新变得高效。当新的关键帧到来时,系统可以仅在新的、未被观测到的区域初始化新的高斯基元,而无需像 iMAP 那样对整个全局模型进行优化。
- 代表性系统: 诸如 Gaussian-SLAM 和 SplaTAM 等工作,均展示了利用 RGB-D 输入进行实时、高保真稠密重建的能力,在相机跟踪精度、建图质量和新视角合成效果上全面超越了此前的隐式 SLAM 方法。更有研究者将这一框架成功应用于更具挑战性的单目相机设置,进一步证明了该表示方法的强大潜力。
4.3 激光特征场:融合 LiDAR 与神经场的前沿
Section titled “4.3 激光特征场:融合 LiDAR 与神经场的前沿”尽管基于视觉的 3DGS-SLAM 在外观重建上取得了巨大成功,但仅依赖 RGB(-D) 数据仍然面临尺度不确定性、几何精度有限以及在弱纹理区域容易漂移等问题。将具有高精度、尺度确定性的 LiDAR 数据与神经场表示相结合,成为构建终极 SLAM 系统的关键前沿。
- 基于隐式场的 LiDAR SLAM: PIN-SLAM 是一个代表性的工作,它展示了如何为纯 LiDAR SLAM 构建一个隐式神经地图。PIN-SLAM 使用一个基于点的神经网络来学习一个局部的隐式符号距离场(Signed Distance Field,SDF)。其核心创新在于,它通过一种无需显式数据关联的”点到隐式模型”(point-to-implicit model)配准方式来估计传感器位姿,并利用学习到的隐式地图实现了全局一致的高精度建图。
- LiDAR 监督的混合 SLAM: 最新的研究趋势是将 LiDAR 的精确几何信息直接融入 3DGS-SLAM 框架中。这类方法利用稀疏但极其精确的 LiDAR 深度点作为强几何先验,来监督和约束 3DGS 地图的优化过程。这相当于为视觉重建的、外观丰富的”血肉”(高斯基元)提供了一个由 LiDAR 测量的、几何精确的”骨架”。这种融合带来了多重好处:首先,它能有效纠正视觉里程计的累积漂移和尺度模糊;其次,它显著提升了在弱纹理或光照变化剧烈区域的建图质量和鲁棒性,因为在这些区域,几何信息比光度信息更可靠;最后,LiDAR 数据还可以用于在相机视野之外的区域初始化高斯基元,实现更完整的场景覆盖。
表 2:现代稠密 SLAM 系统分类
| 系统名称 | 底层表示 | 传感器模态 | 核心创新 / 贡献 |
|---|---|---|---|
| iMAP | 全局 MLP(隐式) | RGB-D | 首个实时的隐式神经 SLAM 系统 |
| NICE-SLAM | 分层特征栅格(隐式) | RGB-D | 引入分层表示,提升隐式 SLAM 的可扩展性 |
| Gaussian-SLAM | 3D 高斯(混合) | 单目 / RGB-D | 首批基于 3DGS 的 SLAM 系统之一,实现照片级实时重建 |
| SplaTAM | 3D 高斯(混合) | RGB-D | 利用显式体积表示进行高保真建图,性能卓越 |
| PIN-SLAM | 基于点的神经 SDF(隐式) | LiDAR | 利用点到隐式模型配准实现全局一致的纯 LiDAR SLAM |
| LiDAR 融合 3DGS SLAM | LiDAR 约束的 3D 高斯(混合) | LiDAR-惯性-视觉 | 融合 LiDAR 的几何精度与 3DGS 的视觉真实感 |
这场从定位到高保真建图的演进深刻地揭示了,SLAM 系统的发展与底层地图表示的革新之间存在着一种共生关系。3DGS 之所以能在 SLAM 领域掀起波澜,并非仅仅因为它是一个”更好看”的地图,而是因为它在本质上是一个”更适合 SLAM 过程”的表示。它的快速渲染能力解决了稠密跟踪的实时性难题,而其显式基元结构则解决了增量建图的效率难题。展望未来,将 LiDAR 的几何确定性、视觉 3DGS 的稠密真实感以及 IMU 的高频运动估计在一个统一的、实时的混合表示框架中进行融合,无疑是通往构建兼具厘米级精度和照片级外观的终极数字孪生的必由之路。
5. 感知的新维度:渲染即感知与知识蒸馏
Section titled “5. 感知的新维度:渲染即感知与知识蒸馏”随着三维表示方法在几何与外观重建上达到新的高度,研究的焦点开始转向一个更深层次的目标:让数字孪生不仅”看起来像”物理世界,更能”理解”物理世界。这意味着要为三维模型注入高层语义信息,使其从一个”哑”的几何与颜色容器,转变为一个”智能”的、可查询、可理解的感知实体。这一转变的核心技术路径是”渲染即感知”和知识蒸馏。
5.1 渲染即感知:从数字孪生中提取语义
Section titled “5.1 渲染即感知:从数字孪生中提取语义”“渲染即感知”(Rendering as Perception)是一个新兴的理念,它旨在打破传统计算机视觉中”重建”与”感知”两个独立任务的壁垒。其核心思想是,如果一个三维模型能够被渲染成带有语义信息的”特征图”,那么感知任务(如分割、识别)就可以直接从这个三维模型中”渲染”出来,而不是在二维图像上重新进行。实现这一理念的关键在于构建”特征场”(Feature Field)。
-
特征场的构建与知识蒸馏: 特征场是对 NeRF 或 3DGS 等表示方法的扩展。除了学习预测颜色和密度,模型还被训练来预测一个高维的特征向量。这个过程通常通过知识蒸馏(Knowledge Distillation)实现,即利用强大的、预训练的二维视觉基础模型(如 CLIP、DINOv2、SAM 等)作为”教师”。具体流程如下:
- 对于用于训练的每一张二维输入图像,首先使用一个或多个 2D 基础模型提取出密集的、像素级的特征图。
- 修改三维表示模型(如 3DGS),使其每个基元(高斯)除了存储颜色(SH 系数)外,还存储一个可优化的特征向量。
- 在训练时,除了计算渲染图像与真实图像之间的光度损失外,还额外计算”渲染特征图”与从 2D 基础模型提取的”教师特征图”之间的损失。
- 由于整个渲染管线是可微的,这个定义在特征空间中的损失可以被反向传播,从而将 2D 基础模型的丰富语义知识”蒸馏”并固化到三维模型的几何基元中。
-
从 Semantic-NeRF 到 Feature 3DGS: 这一思想的演进清晰可见。Semantic-NeRF 是早期的探索,它为 NeRF 增加了一个额外的”语义头”,用于预测每个空间点的离散类别标签,其监督信号来自于二维的语义分割图。而 Feature Splatting 或 Feature 3DGS 则是当前最前沿的实现。通过为每个高斯基元赋予一个高维特征向量,这些方法将 3DGS 模型的能力从单纯的新视角合成,扩展到了强大的三维感知任务。训练完成后,这个带有特征场的 3DGS 模型可以直接用于:
- 开放词汇查询: 通过输入文本提示(如”找到所有的椅子”),计算文本嵌入与渲染特征图之间的相似度,从而实现任意物体的三维分割。
- 语言引导的编辑: 结合文本提示对场景进行局部编辑,例如”把这辆车变成红色”。
- 物理属性赋予: 更进一步,可以利用特征的语义信息来自动为场景中的不同部分赋予物理材质属性,用于后续的物理仿真。
5.2 知识蒸馏:构建高效的 3D 感知模型
Section titled “5.2 知识蒸馏:构建高效的 3D 感知模型”虽然功能强大,但一个存储了高维特征场的 3DGS 模型可能会非常庞大,对存储和计算资源要求很高,这对于需要在边缘设备(如自动驾驶汽车、机器人)上实时运行的感知系统来说是一个挑战。知识蒸馏在这里扮演了第二个关键角色:模型压缩与加速。
- 教师-学生学习范式: 在这种情境下,一个庞大、精确但计算昂贵的”教师模型”(例如,一个在云端训练好的高分辨率 3DGS 特征场)被用来指导一个轻量级、高效的”学生模型”(例如,一个专为车载计算平台设计的紧凑型神经网络)的训练。学生模型的任务不仅仅是拟合标注数据,更重要的是学习模仿教师模型在中间层输出的特征表示或最终的预测分布。
- 在 3D 目标检测中的应用: 这一范式在基于多视图图像或 LiDAR 点云的 3D 目标检测任务中尤为重要。例如,一个复杂的 BEV(鸟瞰图)感知模型作为教师,可以将其在 BEV 空间中学习到的丰富空间-时间特征知识,蒸馏给一个网络结构更简单、计算量更小的学生模型。通过这种方式,学生模型能够在保持较高检测精度的同时,达到实时运行的效率,解决了高性能感知模型在资源受限平台上的部署难题。
可微渲染机制是实现这一切的技术基石。正是因为从三维表示到二维图像(或特征图)的渲染过程是端到端可微的,我们才能够将一个定义在抽象”特征空间”中的损失函数,通过梯度反向传播,直接作用于三维模型的底层参数。这使得三维模型能够直接学习和内化二维基础模型所蕴含的丰富语义知识。
这一系列进展标志着数字孪生正从一个纯粹的几何与外观复制品,演变为一个真正”智能”的感知代理。三维模型不再仅仅是一个被动渲染的对象,而是一个可以主动响应查询、蕴含高级语义的交互式世界模型。这预示着计算机图形学(关注合成)与计算机视觉(关注理解)之间的界限正在消融:用于渲染的模型与用于感知的模型正逐渐统一。这种统一的、富含语义的、实时的三维世界表示,极有可能成为未来具身智能体(Embodied AI)的核心数据结构,为它们提供一个既能导航(SLAM)又能理解(Perception)的内在世界模型。
6. 核心挑战与前沿突破
Section titled “6. 核心挑战与前沿突破”随着混合表示范式的崛起及其在 SLAM 和感知领域的广泛应用,新的挑战和研究前沿也随之浮现。其中两个问题尤为突出:一是如何将这些新型的、以渲染为中心的表示方法与传统基于网格的数字资产生态系统相兼容,即模型转换的挑战;二是如何从源头上获取更丰富、更本质的场景信息,以构建真正可编辑、可重光照的数字资产,这指向了传感器层面的革命。
6.1 模型转换的”翻译失真”风险
Section titled “6.1 模型转换的”翻译失真”风险”尽管 NeRF 和 3DGS 在渲染质量和效率上取得了巨大成功,但它们本质上是为”视图合成”这一任务设计的。然而,在游戏、电影特效、CAD 和工业设计等众多领域,标准的三维资产格式是具有明确表面拓扑的三角网格(Mesh)。因此,将 NeRF 或 3DGS 转换为传统网格是一个至关重要但又充满挑战的需求。这个转换过程类似于在两种截然不同的语言之间进行翻译,不可避免地会产生”翻译失真”。
- 从 NeRF 到网格的挑战: 从 NeRF 的连续体积密度场中提取表面网格,通常采用”移动立方体”(Marching Cubes)算法。该算法通过在三维空间中寻找密度值等于某一阈值的等值面来生成网格。然而,由于 NeRF 的密度场本质上是”模糊”的,并不一定能形成一个清晰、封闭的表面,这种转换常常伴随着多种问题:
- 几何噪声与”浮空物”: 在密度较低或未被充分观测的区域,提取出的网格表面可能充满噪声,或者在空中出现不应存在的孤立几何碎片(即”floaters”)。
- 过度平滑: 为了获得一个干净的表面,往往需要对密度场进行平滑处理,但这会导致精细的几何细节(如尖锐的棱角)被抹去,使得重建结果过于平滑,失去真实感。
- 拓扑错误: 对于薄片结构或复杂的拓扑,NeRF 的密度场可能无法准确表达,导致提取的网格出现孔洞或错误的连接。
- 从 3DGS 到网格的挑战: 3DGS 的表示虽然基于离散的点(高斯中心),但直接对这些点进行表面重建(如泊松重建)同样会产生质量不佳的网格,因为高斯基元的最优分布是为了渲染质量,而非几何精度。更深层次的挑战在于信息维度的失配:
- 视角相关外观的丢失: 3DGS 之所以能够渲染出逼真的高光和反射,关键在于其使用了球谐函数(SH)来表示与视角相关的颜色。然而,一个标准的纹理贴图(Texture Map)是视角无关的。将复杂的、动态的 SH 信息”烘焙”(bake)到一个静态的纹理贴图中,必然会导致视角相关效果的严重损失,最终得到的网格资产将失去原有的光泽和生动感。这是一种从高维动态表示到低维静态表示的根本性信息压缩损失。
- 透明与体积效应的丧失: 3DGS 通过半透明的高斯基元叠加来模拟烟雾、玻璃等效果。这种体积信息无法被一个纯粹的表面网格所表达。
模型转换的困难揭示了一个深刻的问题:这些为渲染而优化的新范式,其内部的数据结构与传统以几何为核心的范式存在根本性的不兼容。强行转换无异于”削足适履”,必然会丢失大量使它们之所以出色的关键信息。
6.2 传感器革命:多模态数字 LiDAR 与”材质解耦”
Section titled “6.2 传感器革命:多模态数字 LiDAR 与”材质解耦””面对模型转换的困境,一个更具颠覆性的思路是:与其在软件层面费力地从不完整的信息(如 RGB 图像)中”猜测”场景的物理属性,不如从硬件层面,即传感器本身,直接获取更丰富、更本质的数据。新一代多模态数字 LiDAR 的发展,正预示着这一革命性的可能性。
- 超越几何的数字 LiDAR: 传统的 LiDAR 主要提供高精度的三维几何信息(距离)。而新一代数字 LiDAR 架构的传感器在发射激光脉冲并接收回波时,不仅能测量每个点的精确距离,还能同时输出另外两个关键的物理量:校准的反射率(Calibrated Reflectivity) 和环境光(Ambient Light)。这意味着,对于场景中的每一个三维点,都能从单一传感器、单一数据流中同步获得其几何位置、对激光波长的反射强度以及周围环境光的强度。这是一种原生的、硬件层面的多模态数据融合。
- 通往”材质解耦”之路: 这种多模态数据的获取,为解决计算机图形学中的一个圣杯级问题——“材质解耦”(Material Decoupling)或”逆渲染”(Inverse Rendering)——提供了前所未有的机遇。一个物体的最终外观(即相机图像中的颜色)是其固有材质、场景光照和物体几何三者复杂作用的结果。RGB 图像捕捉到的是这三者纠缠在一起的最终效果。而这类传感器提供的同步数据,使得我们有可能将这三者分离开来:
- 几何(Geometry): 由 LiDAR 的距离测量直接提供。
- 材质(Material): 物体的固有反射特性,可以通过校准的反射率数据来近似或作为求解双向反射分布函数(BRDF)的关键输入。
- 光照(Lighting): 场景的环境光照条件,可以由环境光测量数据来估计。
- 颠覆性影响: 一旦实现了材质解耦,我们就能创造出真正意义上的”可用数字资产”。一个解耦了材质属性的 3D 模型,将具备以下革命性能力:
- 可重光照(Relightable): 由于模型的材质属性(如漫反射颜色、粗糙度、金属度)是独立于原始光照存储的,因此可以将该模型置于任何新的虚拟光照环境中,并进行物理上正确的、照片级的渲染。
- 可编辑材质: 用户可以像在 Photoshop 中改变颜色一样,直接修改模型的材质参数,例如”将这张木桌的材质换成大理石”。
- 物理真实性: 这样的资产不再仅仅是”看起来真实”(photorealistic),而是”物理上真实”(physically realistic),能够无缝集成到基于物理的渲染(PBR)引擎和仿真环境中。
这一传感器层面的突破,为解决前述的”复刻”与”可用”的矛盾提供了另一条路径。与其在软件算法的”下游”苦苦挣扎,试图从纠缠的信息中分离出有用的部分,不如在数据采集的”上游”就直接获取解耦的、更本质的物理量。未来的发展方向很可能不再是传感器和算法的独立演进,而是二者的深度协同设计:开发能够捕捉解耦物理属性的新型传感器,并为这些传感器量身定制能够高效存储、处理和渲染这些属性的新型三维表示方法(例如,一个将 SH 系数替换为 BRDF 参数的 3DGS 变体)。这将使我们从追求依赖于特定视角和光照的”照片真实感”,迈向追求不变的、普适的”物理真实感”,从而最终实现可编辑、可重光照、物理精确的终极数字孪生。
7. 结论与展望:在”完美复刻”与”可用资产”之间权衡
Section titled “7. 结论与展望:在”完美复刻”与”可用资产”之间权衡”本报告系统性地回顾并分析了三维数字世界表示方法的范式革命。这场革命的演进路径清晰地呈现为三个阶段的辩证发展:从以网格和点云为基础、强调结构与可编辑性的显式表示(“数值解”),到以神经辐射场(NeRF)为代表、追求极致视觉真实感的隐式表示(“解析解”),最终演进至由 3D 高斯泼溅(3DGS)所开创的、在性能与质量上取得突破性平衡的混合表示新范式。3DGS 通过将场景解构为数百万个可微的、显式的”高斯基元”,同时保留了隐式场连续优化的能力,并借助高度并行化的光栅化渲染管线,历史性地将照片级渲染带入了实时应用的范畴,从而深刻地重塑了 SLAM 和三维感知等领域的技术图景。
在整个技术演进的历程中,一条核心的权衡主线贯穿始终,即在”完美复刻现实”与”构建可用数字资产”这两个看似矛盾的目标之间的持续博弈。
- 显式表示时代,我们拥有了高度”可用”的数字资产——易于编辑、结构清晰的网格模型,但它们距离”完美复刻”现实世界的复杂光影与材质细节相去甚远。
- 隐式表示的兴起,以 NeRF 为旗帜,几乎实现了对静态场景的”完美复刻”,但其产物是一个难以编辑、难以交互的”数字照片”,在”可用性”上做出了巨大牺牲。
- 混合表示的出现,特别是 3DGS,是解决这一核心权衡的关键一步。它在”复刻”的质量上逼近 NeRF,同时由于其显式基元的特性,在实时渲染、快速训练以及潜在的可编辑性上,极大地提升了资产的”可用性”。而 Feature Splatting 等技术的出现,通过为这些基元注入语义,进一步增强了资产的功能性与智能性,使其向真正的”可用资产”迈进了一大步。
然而,当前的混合范式仍未完全消除这一权衡。正如分析所示,将 3DGS 这类以渲染为中心的表示转换为传统的、以几何为中心的网格资产时,仍然存在严重的信息损失风险,特别是视角相关的外观信息。这表明,尽管我们在构建”看起来真实”的数字孪生方面取得了巨大进展,但在构建”行为和属性与真实世界一致”的数字资产方面,挑战依然严峻。
展望未来,彻底打破”完美复刻”与”可用资产”之间壁垒的路径,将依赖于本报告所探讨的几大前沿方向的深度融合:
- 表示方法的持续演进: 以 3DGS 为代表的混合范式仍有巨大的探索空间。未来的研究将致力于开发更高效、更具表达能力的基元,优化其存储效率,并探索能够同时完美保留外观与几何信息的、与传统图形管线更兼容的表示结构。
- 感知与重建的深度统一: “渲染即感知”的理念将继续深化。未来的三维表示将不再仅仅是几何与颜色的容器,而是原生集成了高维语义特征、物理材质参数乃至动态行为模型的”世界模型”。三维重建的过程将与场景理解的过程合二为一。
- 传感器与算法的协同设计: 这是最具颠覆性的方向。与其依赖算法从有限的传感器数据中进行复杂的逆向推演,不如从源头设计能够直接捕获解耦物理信息(如几何、反射率、环境光)的多模态传感器。这种硬件层面的突破将从根本上简化软件算法的难度,使构建物理上精确、可重光照的数字资产成为可能。
最终,这场范式革命的终点,是创造出动态、可交互、且具备内在智能的数字孪生。它们不仅在视觉上与现实世界无法区分,更在语义上可被机器理解,在物理上遵循现实规律。这样的终极”可用资产”,将成为驱动下一代机器人技术、具身智能、元宇宙乃至科学研究的核心引擎,真正实现数字世界对物理世界的全面赋能。
- Mildenhall et al., NeRF: Representing Scenes as Neural Radiance Fields for View Synthesis (ECCV 2020) — https://arxiv.org/abs/2003.08934
- Kerbl et al., 3D Gaussian Splatting for Real-Time Radiance Field Rendering — https://repo-sam.inria.fr/fungraph/3d-gaussian-splatting/
- A Survey on 3D Gaussian Splatting — https://arxiv.org/abs/2401.03890
- iMAP: Implicit Mapping and Positioning in Real-Time — https://edgarsucar.github.io/iMAP/
- NICE-SLAM: Neural Implicit Scalable Encoding for SLAM — https://pengsongyou.github.io/nice-slam
- SplaTAM: Splat, Track & Map 3D Gaussians for Dense RGB-D SLAM — https://spla-tam.github.io/
- Gaussian-SLAM: Photo-realistic Dense SLAM with Gaussian Splatting — https://vladimiryugay.github.io/gaussian_slam/
- PIN-SLAM: LiDAR SLAM Using a Neural Implicit Ego-Odometry — https://arxiv.org/abs/2401.09101
- LIO-SAM: Tightly-coupled Lidar Inertial Odometry via Smoothing and Mapping — https://github.com/TixiaoShan/LIO-SAM
- ORB-SLAM3: An Accurate Open-Source Library for Visual, Visual-Inertial and Multi-Map SLAM — https://github.com/UZ-SLAMLab/ORB_SLAM3
- Semantic-NeRF: In-Place Scene Labelling and Understanding with Implicit Scene Representation — https://arxiv.org/abs/2103.15875
- Feature 3DGS: Supercharging 3D Gaussian Splatting to Enable Distilled Feature Fields — https://arxiv.org/abs/2312.03203
- Feature Splatting: Language-Driven Physics-Based Scene Synthesis and Editing — https://arxiv.org/abs/2404.01223
- How NeRFs and 3D Gaussian Splatting are Reshaping SLAM: a Survey — https://fabiotosi92.github.io/files/survey-slam.pdf