Skip to content

3D 感知范式重塑

1. 显式感知范式:基石、主流与瓶颈

Section titled “1. 显式感知范式:基石、主流与瓶颈”

在三维(3D)感知的宏大叙事中,显式感知范式构成了整个领域的基石。该范式直接在离散的几何基元(如点、体素)上进行操作,其核心目标是将传感器捕捉到的无序、稀疏的点云数据,转化为机器可理解的结构化信息,例如物体的边界框或逐点的语义标签。这一范式的演进历程,本质上是一场关于如何在保持几何保真度与追求计算效率之间取得最佳平衡的持续探索。两大主流学派——体素化方法和点基方法——分别代表了这一探索的两种截然不同的哲学路径,共同塑造了现代 3D 感知的基本格局。

1.1 体素化方法:以 PointPillars 为例

Section titled “1.1 体素化方法:以 PointPillars 为例”

体素化方法的核心思想在于,通过一种”离散化”的手段,将不规则的点云数据转换为主流卷积神经网络(CNN)所擅长处理的规则网格结构。这一思想为解决 3D 数据的处理难题提供了高效的工程路径。

这一流派的演进可以追溯到 VoxelNet。VoxelNet 的开创性在于它提出了一种端到端的学习框架,彻底摆脱了传统方法中手工设计特征的繁琐过程。其核心是 Voxel Feature Encoding(VFE)层,该层将 3D 空间划分为等距的体素(Voxel),并使用一个微型 PointNet 网络学习每个非空体素内点集的统一特征表示。通过这种方式,稀疏的点云被编码为一个稠密的、描述性的 4D 张量,随后便可输入到 3D CNN 中进行特征提取和区域提议。然而,VoxelNet 的成功也暴露了其致命的瓶颈:3D 卷积操作带来了巨大的计算和内存开销,严重制约了其在实时应用中的部署。

正是在这样的背景下,PointPillars 应运而生,它被视为 VoxelNet 思想的一次极致简化与工程优化。

  • 论文: Lang, A. H., Vora, S., Caesar, H., Zhou, L., Yang, J., & Beijbom, O. (2019). “PointPillars: Fast Encoders for Object Detection from Point Clouds”. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR).
    • 链接: https://arxiv.org/abs/1812.05784
    • 简介: PointPillars 提出了一种新颖的点云编码器,它将点云组织成垂直的柱状体(Pillars),并利用 PointNet 学习这些柱状体的特征表示。通过将 3D 问题巧妙地降维到 2D,该方法使得整个检测流程可以仅使用高效的 2D 卷积层完成,从而在速度和精度上都取得了显著的突破,尤其是在自动驾驶等实时性要求极高的场景中。
  • 源码: PointPillars 因其高效性和简洁性,在开源社区拥有众多实现。
    • 官方 / 核心实现: 最初由 nuTonomy(后来的 Motional)开发,其思想被整合在多个项目中,如 second.pytorch。
    • 社区实现: tyagi-iiitv/PointPillars(TensorFlow)、LKLQQ/pointpillars(MindSpore),以及 NVIDIA TAO Toolkit 的官方支持。
  • 核心课题组: nuTonomy(现为 Motional)。
  • 常用数据集: 该方法主要在大型自动驾驶数据集上进行评估,如 KITTI、nuScenes 和 Waymo Open Dataset。
  • 开创性相关工作: VoxelNet 是 PointPillars 最直接的思想源头。PointPillars 继承了 VoxelNet 端到端学习和体素化编码的思想,但通过将 3D 体素简化为 2D 柱状体,彻底解决了 3D 卷积的性能瓶颈。
  • 优缺点对比:
    • 优点:
      1. 极致的速度: 其核心创新在于将点云在鸟瞰图(BEV)视角下进行柱状划分,避免了在高度维度上的精细划分和昂贵的 3D 卷积。所有关键操作均可由高度优化的 2D 卷积实现,使得其推理速度能够达到 62 Hz 甚至 105 Hz,远超同期的其他方法,满足了实时应用的需求。
      2. 部署友好: 仅依赖标准的 2D 卷积,使得模型更容易被转换和部署到各种硬件加速平台(如 NVIDIA TensorRT),而无需像稀疏 3D 卷积那样依赖特殊的算子库。
      3. 出色的性能: 尽管结构简化,PointPillars 在发布时仍在 KITTI 等权威基准上取得了 SOTA(State-of-the-Art)或极具竞争力的检测精度,甚至超过了一些融合了图像信息的方法。
    • 缺点:
      1. 信息损失: 将 3D 空间压缩成 2D 柱状体是其速度的来源,也是其信息的瓶颈。这个过程不可避免地损失了高度方向上的精细几何信息。对于那些在垂直结构上具有丰富辨识特征的物体(例如,区分一个站立的人和一个蹲下的人),或者在垂直方向上相互堆叠、遮挡的场景,PointPillars 的感知能力会受到限制。
      2. 对小物体的敏感度: 由于固定的网格划分,对于尺寸远小于网格大小的物体,或者点数非常稀疏的远距离物体,其特征可能无法被有效捕获,导致漏检。

与体素化方法试图将点云”格式化”以适应 CNN 的思路不同,点基方法选择了一条更为”原生”的道路:直接在原始、无序的点集上进行学习,以期最大程度地保留数据的几何保真度。

这一流派的奠基之作是 PointNet。PointNet 革命性地提出了一种能直接处理无序点集的深度网络架构。其核心是通过共享的多层感知机(MLP)独立地提取每个点的特征,然后利用一个对称函数(如最大池化)来聚合所有点的特征,从而获得对整个点云的全局描述,解决了点集输入的置换不变性问题。然而,PointNet 的”全局性”也正是其局限所在:它忽略了点与点之间的局部邻域关系和几何结构,无法捕捉到由度量空间定义的局部模式。

PointNet++ 正是为了克服这一局限而设计的。它将 CNN 中”感受野”和”层级抽象”的思想成功地引入到点集处理中。

  • 论文: Qi, C. R., Yi, L., Su, H., & Guibas, L. J. (2017). “PointNet++: Deep Hierarchical Feature Learning on Point Sets in a Metric Space”. In Advances in Neural Information Processing Systems (NIPS).
    • 链接: https://arxiv.org/abs/1706.02413
    • 简介: PointNet++ 引入了一种层级式的神经网络结构,能够在度量空间中由小到大地学习点集的局部特征。它通过递归地应用 PointNet,在不断增大的邻域范围内提取和抽象特征,从而有效地捕捉到精细的几何结构,并对点云的非均匀密度具有很强的鲁棒性。
  • 源码:
  • 核心课题组: 斯坦福大学(Stanford University)。
  • 常用数据集: 主要用于形状分类和部件 / 场景分割任务,常用数据集包括 ModelNet40、ShapeNet Part 和 ScanNet。
  • 开创性相关工作: PointNet 是 PointNet++ 的直接前身和核心组件。
  • 优缺点对比:
    • 优点:
      1. 高几何保真度: 直接在原始点上操作,不经过任何体素化或投影,最大限度地保留了点云的精细几何细节。这使其在需要精确几何信息的任务(如部件分割、法向量估计)上表现优异。
      2. 强大的局部特征学习: 其核心的”集合抽象层”(Set Abstraction Level)通过”采样-分组-编码”的机制,显式地学习不同尺度下的局部上下文信息,这对于理解复杂的几何形态至关重要。
      3. 对非均匀密度的鲁棒性: 真实世界的 LiDAR 扫描往往密度不均,近处点密,远处点疏。PointNet++ 专门设计了多尺度分组(MSG)和多分辨率分组(MRG)策略,使网络能够自适应地结合不同尺度的信息,从而在这种挑战性条件下依然保持稳健的性能。
    • 缺点:
      1. 计算成本高: 相对于 PointPillars 等方法,PointNet++ 的计算更为密集。特别是最远点采样(Farthest Point Sampling,FPS)和球查询(Ball Query)等操作,在处理大规模点云时会成为显著的性能瓶颈。
      2. 感受野受限: 尽管是层级结构,但其感受野的扩张依赖于球查询的半径。要捕获非常大范围的上下文关系,需要更大的半径或更深的网络,这会进一步增加计算负担。
      3. 对点云规模敏感: 其内存和计算复杂度通常与输入点的数量呈非线性关系,这使得它在处理动辄数百万点的超大规模场景时面临挑战。

显式感知范式中的这两种主流方法,揭示了 3D 感知领域一个根本性的权衡:计算效率与几何保真度之间的张力。PointPillars 代表了”效率优先”的哲学,它通过巧妙的离散化和降维,将问题转化为成熟的 2D 图像处理流程,实现了卓越的速度,但牺牲了部分 3D 信息。PointNet++ 则代表了”保真度优先”的哲学,它忠于原始数据形态,通过复杂的层级结构来捕捉最精细的几何细节,但代价是更高的计算复杂性。任何一个具体的 3D 感知应用,其技术选型都无法回避对这一根本性权衡的考量。

2. 隐式感知范式:场景级理解的新维度

Section titled “2. 隐式感知范式:场景级理解的新维度”

当显式范式在离散几何的世界里精耕细作时,一场更为深刻的变革正在悄然发生。隐式感知范式,以神经场(Neural Fields)为核心,彻底颠覆了场景的表示方式。它不再将世界看作是点的集合或体素的网格,而是将其抽象为一个连续的、可微的函数。这一范式转换,为实现真正意义上的场景级稠密理解开辟了全新的维度。

隐式范式的核心,在于用一个深度神经网络(通常是多层感知机 MLP)来近似一个连续函数 FF,这个函数将空间中的任意一个三维坐标点 (x,y,z)(x, y, z) 映射到该点的一系列物理或语义属性。这一概念的演进,清晰地体现了从”渲染”到”理解”的跨越。

最初,以 NeRF(Neural Radiance Fields)为代表的工作,将这个函数定义为:

FΘ(x,y,z,θ,ϕ)→(c,σ)F_\Theta(x,y,z,\theta,\phi)\rightarrow(c,\sigma)

其中,(x,y,z)(x, y, z) 是空间坐标,(θ,ϕ)(\theta, \phi) 是观测方向,cc 是该点在该方向上发出的颜色(RGB 值),σ\sigma 是该点的体积密度。通过对相机光线路径上的点进行积分渲染,NeRF 能够合成照片般逼真的新视角图像。这本身就是一场革命,但其本质仍停留在对场景外观的重现。

真正的范式飞跃来自于神经语义场(Neural Semantic Field)的提出。以 Semantic-NeRF 为代表的工作,对这个核心函数进行了看似微小却意义深远的扩展:

FΘ(x,y,z,θ,ϕ)→(c,σ,s)F_\Theta(x,y,z,\theta,\phi)\rightarrow(c,\sigma,s)

这里,输出中增加了一个新的维度 ss,代表该空间点的语义类别 logits。这个简单的扩展意味着,这个由神经网络参数 Θ\Theta 定义的隐式函数,现在不仅知道场景”长什么样”(通过 cc 和 σ\sigma),还知道场景中每个点”是什么”(通过 ss)。

这种表示方式实现了对场景的连续和稠密理解。

  • 连续性: 场景不再被离散的体素或点所束缚。理论上,我们可以在任意精度的连续坐标上查询场景的属性,打破了分辨率的限制。
  • 稠密性: 场景中的每一个点,无论是被观测到的表面,还是内部被遮挡的空间,都被赋予了明确的语义定义。这与显式范式中通常只关注物体表面的稀疏表示形成了鲜明对比。

Semantic-NeRF 是神经语义场理念的杰出实践者,它清晰地展示了隐式表示在场景理解方面的巨大潜力。

  • 论文: Zhi, S., Laidlow, T., Leutenegger, S., & Davison, A. J. (2021). “In-Place Scene Labelling and Understanding with Implicit Scene Representation”. In Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV).
    • 链接: https://arxiv.org/abs/2103.15875
    • 简介: 该工作将 NeRF 扩展到能够联合编码场景的几何、外观和语义。通过在 NeRF 的 MLP 中增加一个语义输出头,Semantic-NeRF 能够利用带有稀疏或噪声标签的多视角图像,训练出一个能够生成稠密、三维一致的语义场的模型。它展示了隐式表示在标签传播、去噪和超分辨率等任务上的强大能力。
  • 源码: Harry-Zhi/semantic_nerf
  • 核心课题组: 伦敦帝国理工学院戴森机器人实验室(Dyson Robotics Laboratory at Imperial College London)。
  • 常用数据集: Replica 和 ScanNet,这两个数据集提供了高质量的室内场景 RGB-D 扫描和精细的语义 / 实例标注。
  • 开创性相关工作: NeRF(Mildenhall et al., ECCV 2020)是 Semantic-NeRF 所依赖的基石。Semantic-NeRF 的核心贡献在于将 NeRF 从一个纯粹的视图合成工具,提升为了一个具备高级场景理解能力的感知系统。
  • 算法流程与优缺点分析:
    • 算法流程:
      1. 联合编码: Semantic-NeRF 使用单个 MLP 网络,其输入是 3D 坐标和视角方向,输出是颜色 cc、密度 σ\sigma 和语义 logits ss。密度和语义仅依赖于 3D 坐标,而颜色还依赖于视角方向,这符合物理直觉。
      2. 可微渲染: 与 NeRF 一样,它沿着从相机发出的每条光线进行采样,并使用体积渲染公式对颜色和语义 logits 进行积分,以预测每个像素的最终颜色和语义标签分布。
      3. 联合优化: 模型的训练目标是最小化一个混合损失函数,该函数由两部分组成:一部分是渲染颜色与真实图像颜色之间的光度损失(如 MSE),另一部分是渲染的语义标签分布与(可能稀疏的)地面真值标签之间的交叉熵损失。
    • 巨大优势:
      1. 场景级分割与新视角合成: 这是隐式范式最引人注目的优势。它能够生成任意新视角的照片级图像,并同时附带像素级精确、三维空间完全一致的语义分割图。这种能力对于 AR/VR、机器人导航和数字孪生等应用具有革命性意义。
      2. 对稀疏 / 噪声标签的极强鲁棒性: NeRF 固有的多视角一致性约束,成为一种强大的正则化器。即使只有极少数(例如,低于 10%)的图像帧带有语义标签,甚至标签本身含有大量噪声,模型也能通过在所有视图间”寻找共识”的方式,学习到一个平滑、完整、准确的 3D 语义场。训练过程本身就成为了一种高效的标签传播、融合与去噪过程。
    • 致命缺陷:
      1. 实时性: 这是隐式感知范式当前最大的软肋。为了渲染单个像素,需要沿着光线采样数百个点,并对每个点进行一次完整的 MLP 前向传播。这导致其渲染速度极慢(通常以秒或分钟计),完全无法满足实时应用的需求。同时,每个场景的训练也需要数小时甚至数天。
      2. 目标级检测: Semantic-NeRF 的表示是”以场景为中心”的,它输出的是一个连续的场,而不是离散的物体。它无法直接给出物体的边界框、姿态、ID 等信息,而这些信息对于自动驾驶等任务至关重要。从语义场中提取实例需要复杂的后处理步骤,且效果往往不理想。
      3. 可编辑性: 场景的几何与语义信息被”纠缠”在数百万个网络权重之中。想要对场景进行局部编辑(如移动一把椅子、改变墙壁颜色)极其困难,因为任何权重的微小改动都可能对整个场景产生不可预测的影响。
      4. 场景特定性: 每个 Semantic-NeRF 模型都是针对单个特定场景从头训练的,不具备泛化到新场景的能力。这限制了其在大规模、动态环境中的应用。

隐式感知的出现,标志着 3D 感知从”分析”走向了”合成”。它不再满足于分析传感器数据以输出标签,而是试图构建一个能够**重新合成(渲染)**出原始传感器数据的内部模型。感知结果——无论是几何结构还是语义类别——都成为了这个成功构建的内部模型的”涌现属性”。这在哲学上是对传统计算机图形学流程的一次”逆转”:图形学从模型到图像,而神经场从图像到(函数的)模型。这种”通过合成来分析”的范式带来了前所未有的稠密性和一致性,但其巨大的计算代价和对物体级离散表示的缺失,也为下一代感知范式的演进埋下了伏笔。

在显式离散表示的高效与隐式连续表示的高保真之间,研究界一直在寻找一个能够兼顾二者的”第三条道路”。3D 高斯泼溅(3D Gaussian Splatting,3DGS)技术的横空出世,标志着这一探索取得了突破性进展。它通过一种新颖的、显式的、可微的基元——三维高斯体,成功地将显式表示的效率和可控性与神经场级别的高质量渲染能力结合起来,催生了”渲染即感知”这一前沿理念,并为多模态输入的融合提供了前所未有的想象空间。

3DGS 的核心思想是用大量的三维高斯体来表征一个场景。与点或体素不同,每一个高斯体都是一个”有体积、有形状、有方向”的基元,其属性包括:

  • 位置(Position): 高斯体的中心点坐标 μ\mu。
  • 协方差(Covariance): 一个 3×33\times3 的协方差矩阵 Σ\Sigma,描述了高斯体的形状和朝向。通过优化这个矩阵,高斯体可以自适应地变成任意形状的椭球体,从而精确地拟合场景的几何表面。
  • 颜色(Color): 使用球谐函数(Spherical Harmonics)系数来表示,使其能够展现与视角相关的复杂外观。
  • 不透明度(Opacity): 一个标量 α\alpha,控制其对光线的遮挡程度。

这种表示方式的革命性在于,它既是显式的(场景由一组离散的高斯基元构成,易于编辑和操作),又是可微的。通过一个专门设计的、基于瓦片(tile-based)的高效光栅化器,可以快速地将这些 3D 高斯体”泼溅”(splatting)到 2D 图像平面上,并计算出渲染图像与真实图像之间的差异,然后通过梯度下降来端到端地优化所有高斯体的属性。这使得 3DGS 在保持极高质量渲染效果的同时,实现了实时渲染(>100 FPS)和快速训练。

“渲染即感知”的理念在此基础上更进一步。如果每一个高斯基元不仅携带用于渲染的颜色和不透明度,还能携带一个高维的特征向量,那么整个场景就变成了一个**“高斯特征场”(Gaussian Feature Field)。构建这种特征场的关键技术是”知识蒸馏”(Knowledge Distillation)**。其流程如下:

  1. 从一个特定视角,将高斯特征场渲染成一张 2D 特征图。
  2. 将该视角对应的真实 RGB 图像输入到一个强大的、预训练的 2D 视觉基础模型(如 CLIP、DINOv2、SAM)中,得到一张”教师”特征图。
  3. 计算渲染出的学生特征图与教师特征图之间的损失。
  4. 将损失反向传播,更新附着在每个 3D 高斯体上的特征向量。

通过在多个视角上重复此过程,2D 基础模型的强大语义理解能力就被”蒸馏”并”提升”到了 3D 高斯基元上。一旦这个高斯特征场构建完成,就开辟了两条主要的感知路径:

  • 路径一:渲染 2D 特征图进行 2D 感知。 从任意新视角渲染出该场的特征图,然后将其送入任何标准的 2D 检测或分割模型中,以完成感知任务。
  • 路径二:直接在 3D 高斯基元上操作。 这是一个更高级的范式。例如,可以通过在特征空间中对高斯基元进行聚类,来实现 3D 实例分割,而无需经过 2D 渲染的中间步骤。

3.2 高级多模态输入对 3D 感知的颠覆性影响

Section titled “3.2 高级多模态输入对 3D 感知的颠覆性影响”

现在,让我们进行一次思想实验:假设存在一款理想的多模态”超级传感器”,它能在硬件层面提供时空完全对齐、物理层同构的多模态数据流(同步的几何、反射率、近红外与环境光等通道)。这种前所未有的输入源将如何颠覆现有的 3D 感知技术,特别是前沿的高斯特征场范式?

当前计算机视觉面临的一个核心难题是”内在图像分解”(Intrinsic Image Decomposition)。一张标准的 RGB 图像 II 是物体表面固有反射率 RR(Reflectance,即物体本来的颜色)与光照效果 SS(Shading)相互作用的结果,即:

I≈R⊙SI \approx R \odot S

这是一个经典的”病态问题”(ill-posed problem),因为存在无限组 (R,S)(R, S) 可以产生同一个图像 II。现有模型只能依赖大量数据学习到的先验知识去”猜测”这种分解,因此在面对极端或未见过的光照条件时,鲁棒性会急剧下降。

这样一款多模态传感器通过直接测量,从根本上解决了这个病态问题。

  • 数据流分析:
    • 被动环视相机(RGB + NIR + 混光): 提供了最终的图像 II。
    • 材质反射率通道(Calibrated Reflectivity): 提供了在特定激光波长下、经过距离解耦和绝对标定的物体表面反射率 RR 的直接测量值。这不再是一个需要猜测的量,而是一个物理测量值。
    • 主动激光回波强度(Active Intensity): 提供了另一个独立于环境光的表面属性测量,进一步佐证了材质信息。
    • 混光 / 环境光通道: 帮助模型直接感知光照强度 SS。

对模型的影响:

当一个神经网络(例如用于构建高斯特征场的网络)同时接收这些在像素级完美对齐的输入时,它不再需要去”学习如何从 II 中分离出 RR 和 SS“。相反,它可以学习 II、RR 和 SS 之间的物理关系。模型可以清晰地观察到:一个红色停止标志在 RGB 通道中的像素值,是由其在”材质反射率”通道中的高反射率值和在”环境光”通道中的光照强度共同决定的。

这种物理属性的解耦将带来革命性的鲁棒性提升。一个用此数据训练的模型,在判断物体类别时,可以学会主要依赖于光照不变的”材质反射率”和”近红外”通道,而不是高度可变的 RGB 通道。这意味着,无论是在正午阳光下、黄昏、黑夜还是隧道中,该模型都能稳定地识别出停止标志,因为它所依赖的判断依据——物体的固有物理属性——没有改变。这将极大提升材质分类、目标识别等任务在各种环境下的泛化能力和可靠性。

3.2.2 像素级对齐的高精度深度信息

Section titled “3.2.2 像素级对齐的高精度深度信息”

当前多模态融合(尤其是 LiDAR 与相机融合)的核心挑战之一是特征对齐。这种不对齐主要源于两大误差:(1)传感器之间外参标定的不精确;(2)将 2D 图像特征投影到 3D 空间时所依赖的深度估计不准确。特别是后者,对于纯视觉或稀疏 LiDAR 融合方案,模型需要先通过一个深度估算网络来预测每个像素的深度,这个过程本身就充满了不确定性。一个微小的深度误差,在投影到几十米外时,就可能导致特征落在完全错误的位置,这对小物体(如远处的行人、路牌)的检测是致命的。

这样一款传感器提供的高精度、像素级对齐的深度信息,彻底瓦解了这一难题。

  • 像素级对齐: 这意味着对于被动相机中的每一个像素,硬件层面都保证有一个与之在时空上完全同步的深度值。这消除了不同传感器数据在时间和空间上的配准误差。
  • 高精度: 提供了极高的深度分辨率,能够精确地描述物体的 3D 位置和表面形态。

对模型的影响:

对于一个多模态融合检测器,例如 BEVFusion 或基于高斯场的模型,输入处理流程将发生根本性改变。模型不再需要一个庞大而不可靠的深度估计子网络。将 2D 图像特征(如颜色、纹理、语义)提升到 3D 空间,从一个”基于学习的预测”问题,退化成了一个确定性的几何变换。

这种几何的确定性将带来巨大的性能增益。模型可以将从 RGB、NIR、反射率通道中提取的丰富外观和材质特征,以极高的置信度放置到由高精度深度信息定义的精确 3D 位置上。对于小物体的检测,这意味着:

  1. 定位精度: 物体的 3D 位置不再有深度估计带来的模糊性,定位将更加精准。
  2. 特征增强: 来自图像的密集、高分辨率的颜色和纹理特征可以被准确地”附着”到由 LiDAR 点云构成的稀疏几何骨架上,极大地丰富了小物体的特征表达,从而显著提升检测召回率和精度。

当前深度学习模型,包括前沿的高斯特征场,其核心问题之一是特征的不可解释性。一个高斯基元上附带的 64 维或 128 维特征向量,虽然能够有效地在渲染时被解码为正确的语义或实例,但向量本身是一个抽象的”黑箱”,我们无法知道其中哪个维度代表颜色,哪个维度代表材质,哪个维度代表”车”这个概念。这为模型调试、信任和安全部署带来了巨大障碍。

基于解耦的多模态输入进行训练,有望从根本上改变这一现状,锻造出可解释的、基于物理的特征场。

由于输入数据本身就是物理属性解耦的(RGB、反射率、深度、环境光),我们可以设计或引导网络学习一个同样结构化、解耦的特征向量。例如,我们可以不再让网络学习一个无结构的 64 维向量,而是定义一个结构化的特征向量,其不同”槽位”被显式地监督以对应不同的物理或语义属性:

fgaussian=[ f1,f2,f3⏟RGB, f4⏟反射率, f5⏟语义, … ]\mathbf{f}_{\text{gaussian}} = [\,\underbrace{f_1,f_2,f_3}_{\text{RGB}},\ \underbrace{f_4}_{\text{反射率}},\ \underbrace{f_5}_{\text{语义}},\ \ldots\,]

在训练过程中,向量的 f1f_1 至 f3f_3 部分将被监督去重建 RGB 图像,f4f_4 部分被监督去重建反射率图像,f5f_5 部分被监督去重建语义分割图,以此类推。因为输入信息是完备且解耦的,网络有能力学会这种”对号入座”式的映射。

这对”可解释 AI”(XAI)和下游应用的意义是极其深远的:

  1. 模型可解释性: 这将是 XAI 领域的一大步。我们可以通过直接”读取”高斯特征场中特征向量的特定维度,来理解模型的”想法”。例如,可视化所有高斯基元的”反射率”维度,就能看到模型所感知的场景材质分布。如果模型在一个区域检测失败,我们可以检查该区域的特征向量,判断是光照信息出了问题,还是语义信息理解有误,从而实现精准的调试。
  2. 下游应用的范式升级: 这将推动下游应用从”几何 / 语义感知”升级到**“物理-语义感知”**。一个智能机器人或自动驾驶汽车,在与环境交互前,不仅可以查询”这是什么物体?“(语义 ID),还可以查询”它是什么材质的?“(反射率),“它有多重?“(通过材质推断),“它的表面摩擦系数如何?“。这些物理属性对于规划更精细、更安全的交互动作(如抓取、避障、路径规划)至关重要。

总而言之,3DGS 代表了图形学与视觉的融合,而解耦的多模态传感器则可能催生从”推断现实”到”测量现实”的范式跃迁。前者统一了表示,后者提供了坚实的物理基础,二者的结合,预示着一个更强大、更鲁棒、也更易于理解的 3D 感知新时代的到来。

本报告系统性地梳理了 3D 感知技术从处理离散几何的显式范式,到以函数拟合为核心的隐式范式,再到融合二者之长的、以高斯泼溅为代表的前沿探索的演进脉络。每一代范式的更迭,都源于对前代核心矛盾的突破,并为我们揭示了通往更高级机器智能的可能路径。

为了清晰地展现不同技术路线的特性与权衡,下表从多个关键维度对报告中讨论的核心范式进行了总结对比。

性能指标显式-体素化(如 PointPillars)显式-点基(如 PointNet++)隐式-神经场(如 Semantic-NeRF)高斯特征场(如 Feature Splatting)
实时性极高(可达 60-100+ Hz),专为实时应用设计中等(FPS 和球查询操作耗时),不适合高频实时任务极低(每帧渲染需秒级或分钟级),完全无法实时高(渲染可达实时,但特征蒸馏训练耗时)
精度-几何中等。Z 轴压缩导致垂直方向的几何细节损失高。直接处理点云,能捕捉精细的局部几何结构极高。连续函数表示,理论上可达无限分辨率高。可优化的各向异性高斯能精确拟合复杂表面
精度-语义高。在自动驾驶检测基准上表现出色高。在部件和场景分割任务上表现优异高。多视图一致性使其语义分割结果平滑且准确高。依赖 2D 基础模型蒸馏,上限取决于教师模型
场景理解能力目标级。主要输出离散的 3D 边界框点 / 部件级。输出逐点标签或部件分割场景级。输出连续、稠密的 3D 语义场,可任意查询场景级 + 目标级。可渲染 2D/3D 特征图,也可直接对高斯聚类
训练 / 推理成本低。模型轻量,仅依赖高效的 2D 卷积中高。采样和分组操作计算密集,对点云规模敏感极高。训练和推理都需要对 MLP 进行海量查询高(训练),低(推理)。训练需蒸馏,但推理(渲染)很快
可解释性 / 可编辑性中等。结构相对清晰,但特征仍是黑箱中等。层级结构有一定可解释性,但难编辑极低。信息纠缠在网络权重中,几乎无法解释或编辑潜力高。显式基元易于编辑,若特征可解耦则可解释性强

这张表格清晰地揭示了不同范式间的根本性权衡。显式范式在效率与保真度之间抉择;隐式范式以巨大的计算代价换取了极致的场景表达连续性和一致性;而高斯特征场则通过一种巧妙的混合表示,试图在实时性、高保真度和感知能力这三个关键维度上取得新的平衡点,成为当前最具潜力的发展方向。

尽管 3D 感知技术已取得长足进步,但通往通用、鲁棒、可交互的机器智能感知系统之路依然充满挑战。展望未来,以下几个方向将是该领域需要攻克的关键难题:

  1. 实时神经渲染用于检测(Real-Time Neural Rendering for Detection)

    当前,“渲染即感知”主要体现在利用渲染进行离线训练或特征蒸馏。未来的挑战在于,如何将可微渲染过程本身深度集成到实时的感知循环中。这可能意味着开发出能够在线、快速优化场景表示的算法,或者利用渲染的梯度信息来指导跟踪、预测等更高级的任务。这要求算法不仅要快,还要能在动态变化的环境中快速收敛和适应。

  2. 开放世界与开集识别(Open-World and Open-Set Recognition)

    绝大多数现有系统都在一个封闭的、预定义类别的世界里运行。然而,真实世界是开放的。未来的 3D 感知系统必须具备处理未知物体和新概念的能力。这要求我们超越传统的监督学习框架,更多地探索如何将强大的视觉-语言模型(VLMs)的开放词汇能力有效地”提升”到 3D 空间。例如,构建一个能理解”那个被遗忘在角落的、红色的手提包”这类自然语言查询,并在 3D 场景中精确分割和定位该物体的系统。

  3. 渲染真实感与物理可交互性的平衡(Balancing Photorealism with Physical Interaction)

    正如 Feature Splatting 等工作所揭示的,感知的终极目标不仅是”看懂”,更是为了”交互”。未来的核心挑战在于,如何在一个统一的表示框架内,无缝地融合用于照片级真实感渲染的外观属性(如颜色、光泽)和用于物理仿真的内在属性(如质量、刚度、摩擦系数)。这需要一个能够同时被图形渲染管线和物理引擎高效处理的场景表示,这可能涉及到材质的神经表示、可微物理仿真等多个前沿领域的深度交叉。

  4. 通用化与场景特定性的统一(Unifying Generalization and Scene-Specificity)

    隐式神经场(如 NeRF)的”场景特定性”带来了无与伦比的细节保真度,但牺牲了泛化能力。而通用模型(如 PointPillars)虽然能处理任何新场景,但其表达能力受限于固定的结构。未来的一个”圣杯”级挑战是,如何开发出一种模型,既能利用从大规模数据中学到的通用先验知识,又能快速、高效地**特化(specialize)**于当前观测到的新场景,从而同时获得泛化能力和高保真度。这可能需要借助元学习(Meta-Learning)、在线自适应或少样本学习等技术,实现模型在通用性与特异性之间的动态平衡。

解决这些挑战,将推动 3D 感知技术从一个被动的场景描述工具,演变为一个主动的、可交互的、能够进行深度推理的智能体核心,为自动驾驶、机器人、增强现实等领域的未来发展奠定坚实的基础。