当前主流 3D 表示方法(3D Representation Methods)技术综述:从点云、体素到 NeRF 与 3D Gaussian Splatting
摘要
3D 表示(3D Representation)是计算机视觉(Computer Vision)、计算机图形学(Computer Graphics)、机器人(Robotics)、自动驾驶(Autonomous Driving)以及具身智能(Embodied AI)的核心基础技术之一。
其目标是将真实世界中的三维空间转换为计算机可以存储、理解、推理和渲染的数据结构。
随着深度学习和生成式 AI 的发展,3D 场景表示经历了从:
显式几何表示(Explicit Geometric Representation)
到:
隐式神经表示(Implicit Neural Representation)
再到:
可实时渲染的神经场表示(Neural Rendering Representation)
的发展过程。
当前主流方法包括:
- RGB-D 图像(RGB-D Image)
- 点云(Point Cloud)
- 体素(Voxel)
- 网格(Mesh)
- 有符号距离函数(Signed Distance Function, SDF)
- 神经辐射场(Neural Radiance Field, NeRF)
- 3D 高斯泼溅(3D Gaussian Splatting, 3DGS)
- 三平面表示(Tri-Plane Representation)
- 混合神经表示(Hybrid Neural Representation)
这些方法在几何精度、计算效率、语义理解能力和实时渲染能力之间存在不同权衡。相关综述工作系统总结了 Voxel、Point Cloud、Mesh、SDF、NeRF 和 3D Gaussian Splatting 等主要路线的发展。citeturn0academia9
1. 3D 表示概述(Overview of 3D Representation)
1.1 什么是 3D 表示(What is 3D Representation)
3D 表示(3D Representation)是指利用某种数据结构描述三维世界中的:
- 几何结构(Geometry)
- 空间关系(Spatial Relationship)
- 外观信息(Appearance)
- 语义信息(Semantic Information)
例如,一个真实物体:
一个咖啡杯
计算机需要知道:
- 它在哪里?
- 它是什么形状?
- 它是什么材质?
- 从不同角度观察时是什么样子?
- 是否可以被机器人抓取?
因此,一个完整的 3D 表示通常包含:
Scene=(Geometry,Appearance,Semantic)Scene=(Geometry,Appearance,Semantic)Scene=(Geometry,Appearance,Semantic)
其中:
| 信息 | 含义 |
|---|---|
| Geometry | 三维形状、空间位置 |
| Appearance | 颜色、纹理、光照 |
| Semantic | 类别、功能、用途 |
2. 3D 表示方法分类(Taxonomy of 3D Representation)
当前 3D 表示主要分为三大类:
| 类别 | 英文名称 | 代表方法 | 核心思想 |
|---|---|---|---|
| 显式表示 | Explicit Representation | Point Cloud、Voxel、Mesh、3DGS | 直接存储空间结构 |
| 隐式表示 | Implicit Representation | SDF、NeRF | 通过函数描述空间 |
| 混合表示 | Hybrid Representation | NeRF+3DGS、Feature Field | 结合几何与神经网络 |
3. RGB-D 图像表示(RGB-D Image Representation)
3.1 基本介绍
RGB-D 图像(RGB-D Image)是最直接的一种三维表示方式。
它将:
- RGB 彩色图像
- Depth 深度图
组合在一起。
表示形式:
I(x,y)=(R,G,B,D)I(x,y)=(R,G,B,D)I(x,y)=(R,G,B,D)
其中:
- R,G,BR,G,BR,G,B:颜色信息;
- DDD:深度距离。
3.2 三维恢复过程
通过摄像机参数:
K=[fx0cx0fycy001]K=\begin{bmatrix}f_x&0&c_x\\0&f_y&c_y\\0&0&1\end{bmatrix}K=fx000fy0cxcy1
可以将二维像素转换为三维点:
P=dK−1[u,v,1]TP=dK^{-1}[u,v,1]^TP=dK−1[u,v,1]T
因此 RGB-D 本质:
使用二维像素位置 + 深度信息恢复三维空间。
3.3 典型模型
| 模型 | 年份 | 特点 |
|---|---|---|
| KinectFusion | 2011 | 实时 RGB-D 三维重建 |
| ElasticFusion | 2015 | 非刚性 SLAM |
| BundleFusion | 2017 | 高精度室内重建 |
3.4 优点
- 获取成本低;
- 数据结构简单;
- 实时性强。
3.5 缺点
- 依赖深度传感器;
- 遮挡严重;
- 室外环境困难。
3.6 应用
主要用于:
- RGB-D SLAM
- AR/VR
- 室内机器人
- 三维扫描
4. 点云表示(Point Cloud Representation)
4.1 基本介绍
点云(Point Cloud)是机器人和自动驾驶领域最常见的 3D 表示方式。
它使用大量三维点描述空间。
形式:
P={p1,p2,...,pN}P=\{p_1,p_2,...,p_N\}P={p1,p2,...,pN}
其中:
pi=(xi,yi,zi,ci)p_i=(x_i,y_i,z_i,c_i)pi=(xi,yi,zi,ci)
4.2 数据来源
主要包括:
1. LiDAR
激光雷达直接测量距离。
2. RGB-D
通过深度反投影生成。
3. 多视角重建
Structure from Motion(SfM)。
4.3 典型模型
| 模型 | 年份 | 贡献 |
|---|---|---|
| PointNet | 2017 | 首次直接处理无序点集 |
| PointNet++ | 2017 | 层次化点云学习 |
| PointCNN | 2018 | 点云卷积 |
| Point Transformer | 2021 | Transformer 建模点云 |
4.4 优点
- 不需要规则结构;
- 保留真实几何;
- 适合大规模环境。
4.5 缺点
- 无拓扑关系;
- 数据稀疏;
- 难以直接渲染。
4.6 应用
- 自动驾驶
- LiDAR 感知
- 机器人导航
- 三维检测
5. 体素表示(Voxel Representation)
5.1 基本思想
体素(Voxel)是三维空间中的像素。
二维:
Pixel(x,y)Pixel(x,y)Pixel(x,y)
三维:
Voxel(x,y,z)Voxel(x,y,z)Voxel(x,y,z)
空间被划分为规则网格:
+---+---+ | | | +---+---+ | | | +---+---+5.2 类型
Occupancy Voxel
表示空间是否被占据:
V(x,y,z)∈{0,1}V(x,y,z)\in\{0,1\}V(x,y,z)∈{0,1}
TSDF
截断符号距离:
F(x,y,z)=dF(x,y,z)=dF(x,y,z)=d
5.3 典型模型
| 模型 | 作用 |
|---|---|
| VoxNet | 3D CNN 分类 |
| OctNet | 高效八叉树体素 |
| SparseConvNet | 稀疏三维卷积 |
5.4 优点
- 结构规则;
- 可以使用 CNN;
- 适合空间推理。
5.5 缺点
核心问题:
三维空间爆炸问题(Curse of Dimensionality)
例如:
10003=1091000^3=10^910003=109
需要巨大存储。
5.6 应用
- 自动驾驶占据网络
- 医学三维成像
- 机器人地图
6. 网格表示(Mesh Representation)
6.1 基本思想
Mesh(网格)使用:
- 顶点 Vertex
- 边 Edge
- 面 Face
描述物体表面。
数学:
M=(V,E,F)M=(V,E,F)M=(V,E,F)
6.2 典型算法
| 方法 | 作用 |
|---|---|
| Marching Cubes | 从体数据提取表面 |
| Poisson Reconstruction | 点云生成 Mesh |
| DMTet | 神经生成 Mesh |
6.3 优点
- 表面质量高;
- 工业标准;
- 渲染效率高。
6.4 缺点
- 拓扑维护困难;
- 动态场景困难。
6.5 应用
- 游戏
- CAD
- 影视
- 3D 打印
7. 隐式函数表示(Implicit Function Representation)
7.1 基本思想
传统方法:
存储表面在哪里。
隐式方法:
学习一个函数判断空间状态。
形式:
f(x,y,z)=sf(x,y,z)=sf(x,y,z)=s
8. SDF 表示(Signed Distance Function Representation)
8.1 基本思想
SDF 使用距离表示物体表面。
定义:
f(x,y,z)=df(x,y,z)=df(x,y,z)=d
其中:
| 值 | 意义 |
|---|---|
| d>0d>0d>0 | 物体外部 |
| d=0d=0d=0 | 表面 |
| d<0d<0d<0 | 内部 |
8.2 典型模型
| 模型 | 年份 |
|---|---|
| DeepSDF | 2019 |
| Occupancy Network | 2019 |
| NeuS | 2021 |
| VolSDF | 2021 |
8.3 优点
- 几何精确;
- 连续表达;
- 可生成 Mesh。
8.4 缺点
- 优化复杂;
- 渲染速度较慢。
9. NeRF 表示(Neural Radiance Field)
9.1 基本思想
NeRF(Neural Radiance Field)使用神经网络表示空间颜色和密度。
函数:
Fθ(x,y,z,θ,ϕ)→(c,σ)F_\theta(x,y,z,\theta,\phi)\rightarrow(c,\sigma)Fθ(x,y,z,θ,ϕ)→(c,σ)
其中:
- x,y,zx,y,zx,y,z:位置;
- θ,ϕ\theta,\phiθ,ϕ:视角;
- ccc:颜色;
- σ\sigmaσ:密度。
9.2 代表论文
NeRF: Representing Scenes as Neural Radiance Fields for View Synthesis
Mildenhall et al., 2020
9.3 典型改进
| 模型 | 改进 |
|---|---|
| Mip-NeRF | 抗锯齿 |
| Instant-NGP | 高速训练 |
| Zip-NeRF | 高质量渲染 |
9.4 优点
- 新视角生成质量极高;
- 连续空间;
- 真实感强。
9.5 缺点
- 训练慢;
- 几何提取困难。
10. 3D Gaussian Splatting 表示(3DGS)
10.1 基本思想
3D Gaussian Splatting(3DGS)使用大量三维 Gaussian 表示场景。该方法于 2023 年提出,通过显式 Gaussian 基元实现高质量实时渲染,被认为是 NeRF 之后的重要方向。turn0academia12
10.2 数据结构
每个 Gaussian:
gi=(μi,Σi,αi,ci)g_i=(\mu_i,\Sigma_i,\alpha_i,c_i)gi=(μi,Σi,αi,ci)
| 参数 | 含义 |
|---|---|
| μ\muμ | 中心位置 |
| Σ\SigmaΣ | 尺度和方向 |
| α\alphaα | 透明度 |
| ccc | 颜色 |
10.3 代表论文
3D Gaussian Splatting for Real-Time Radiance Field Rendering
Kerbl et al., SIGGRAPH 2023
10.4 优点
相比 NeRF:
- 训练快;
- 实时渲染;
- 显存效率更好。
10.5 应用
- VR
- 数字孪生
- 机器人建图
- 三维内容生成
11. 当前主流 3D 表示方法综合比较
| 方法 | 表示类型 | 几何能力 | 语义能力 | 实时性 | 主要用途 |
|---|---|---|---|---|---|
| RGB-D | 显式 | ⭐⭐ | ⭐ | ⭐⭐⭐⭐⭐ | SLAM |
| Point Cloud | 显式 | ⭐⭐⭐ | ⭐⭐⭐ | ⭐⭐⭐⭐ | 自动驾驶 |
| Voxel | 显式 | ⭐⭐⭐ | ⭐⭐⭐ | ⭐⭐⭐ | 空间理解 |
| Mesh | 显式 | ⭐⭐⭐⭐⭐ | ⭐⭐ | ⭐⭐⭐⭐⭐ | 工业建模 |
| SDF | 隐式 | ⭐⭐⭐⭐⭐ | ⭐⭐ | ⭐⭐ | 高精度重建 |
| NeRF | 隐式 | ⭐⭐⭐⭐ | ⭐⭐⭐ | ⭐⭐ | 新视角生成 |
| 3DGS | 显式神经表示 | ⭐⭐⭐⭐ | ⭐⭐⭐ | ⭐⭐⭐⭐⭐ | 实时渲染 |
12. 面向未来 AI 机器人的发展趋势
未来机器人系统不会只依赖单一 3D 表示,而更可能采用组合形式:
RGB / RGB-D | ↓ 3D Foundation Model | ↓ Semantic 3D Representation | ↓ Policy Model (Diffusion / VLA) | ↓ Robot Action趋势:
| 方向 | 目标 |
|---|---|
| 3D Foundation Model | 获得通用三维理解 |
| 3D Gaussian | 高质量实时环境表示 |
| NeRF | 真实世界建模 |
| VLA | 语言驱动机器人 |
| World Model | 预测未来世界 |
总结
当前 3D 表示的发展路线可以概括为:
Point Cloud→Voxel→Mesh→SDF→NeRF→3D Gaussian Splatting \textbf{Point Cloud} \rightarrow \textbf{Voxel} \rightarrow \textbf{Mesh} \rightarrow \textbf{SDF} \rightarrow \textbf{NeRF} \rightarrow \textbf{3D Gaussian Splatting}Point Cloud→Voxel→Mesh→SDF→NeRF→3D Gaussian Splatting
其中:
- Point Cloud解决“空间在哪里”;
- Voxel解决“三维空间结构”;
- Mesh解决“表面几何”;
- SDF解决“连续几何表达”;
- NeRF解决“真实世界视觉重建”;
- 3D Gaussian Splatting解决“高质量实时三维渲染”。
未来具身智能(Embodied AI)的核心方向,将是:
3D 几何表示 + 语义理解 + 世界模型 + 策略学习(Policy Learning)
的融合,而不是单纯追求某一种 3D 表示。