拓十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

当前主流 3D 表示方法(3D Representation Methods)技术综述:从点云、体素到 NeRF 与 3D Gaussian Splatting

当前主流 3D 表示方法(3D Representation Methods)技术综述:从点云、体素到 NeRF 与 3D Gaussian Splatting

当前主流 3D 表示方法(3D Representation Methods)技术综述:从点云、体素到 NeRF 与 3D Gaussian Splatting

摘要

3D 表示(3D Representation)是计算机视觉(Computer Vision)、计算机图形学(Computer Graphics)、机器人(Robotics)、自动驾驶(Autonomous Driving)以及具身智能(Embodied AI)的核心基础技术之一。

其目标是将真实世界中的三维空间转换为计算机可以存储、理解、推理和渲染的数据结构。

随着深度学习和生成式 AI 的发展,3D 场景表示经历了从:

显式几何表示(Explicit Geometric Representation)

到:

隐式神经表示(Implicit Neural Representation)

再到:

可实时渲染的神经场表示(Neural Rendering Representation)

的发展过程。

当前主流方法包括:

  • RGB-D 图像(RGB-D Image)
  • 点云(Point Cloud)
  • 体素(Voxel)
  • 网格(Mesh)
  • 有符号距离函数(Signed Distance Function, SDF)
  • 神经辐射场(Neural Radiance Field, NeRF)
  • 3D 高斯泼溅(3D Gaussian Splatting, 3DGS)
  • 三平面表示(Tri-Plane Representation)
  • 混合神经表示(Hybrid Neural Representation)

这些方法在几何精度、计算效率、语义理解能力和实时渲染能力之间存在不同权衡。相关综述工作系统总结了 Voxel、Point Cloud、Mesh、SDF、NeRF 和 3D Gaussian Splatting 等主要路线的发展。citeturn0academia9


1. 3D 表示概述(Overview of 3D Representation)

1.1 什么是 3D 表示(What is 3D Representation)

3D 表示(3D Representation)是指利用某种数据结构描述三维世界中的:

  • 几何结构(Geometry)
  • 空间关系(Spatial Relationship)
  • 外观信息(Appearance)
  • 语义信息(Semantic Information)

例如,一个真实物体:

一个咖啡杯

计算机需要知道:

  • 它在哪里?
  • 它是什么形状?
  • 它是什么材质?
  • 从不同角度观察时是什么样子?
  • 是否可以被机器人抓取?

因此,一个完整的 3D 表示通常包含:

Scene=(Geometry,Appearance,Semantic)Scene=(Geometry,Appearance,Semantic)Scene=(Geometry,Appearance,Semantic)

其中:

信息含义
Geometry三维形状、空间位置
Appearance颜色、纹理、光照
Semantic类别、功能、用途

2. 3D 表示方法分类(Taxonomy of 3D Representation)

当前 3D 表示主要分为三大类:

类别英文名称代表方法核心思想
显式表示Explicit RepresentationPoint Cloud、Voxel、Mesh、3DGS直接存储空间结构
隐式表示Implicit RepresentationSDF、NeRF通过函数描述空间
混合表示Hybrid RepresentationNeRF+3DGS、Feature Field结合几何与神经网络

3. RGB-D 图像表示(RGB-D Image Representation)

3.1 基本介绍

RGB-D 图像(RGB-D Image)是最直接的一种三维表示方式。

它将:

  • RGB 彩色图像
  • Depth 深度图

组合在一起。

表示形式:

I(x,y)=(R,G,B,D)I(x,y)=(R,G,B,D)I(x,y)=(R,G,B,D)

其中:

  • R,G,BR,G,BR,G,B:颜色信息;
  • DDD:深度距离。

3.2 三维恢复过程

通过摄像机参数:

K=[fx0cx0fycy001]K=\begin{bmatrix}f_x&0&c_x\\0&f_y&c_y\\0&0&1\end{bmatrix}K=​fx​00​0fy​0​cx​cy​1​​

可以将二维像素转换为三维点:

P=dK−1[u,v,1]TP=dK^{-1}[u,v,1]^TP=dK−1[u,v,1]T

因此 RGB-D 本质:

使用二维像素位置 + 深度信息恢复三维空间。


3.3 典型模型

模型年份特点
KinectFusion2011实时 RGB-D 三维重建
ElasticFusion2015非刚性 SLAM
BundleFusion2017高精度室内重建

3.4 优点

  • 获取成本低;
  • 数据结构简单;
  • 实时性强。

3.5 缺点

  • 依赖深度传感器;
  • 遮挡严重;
  • 室外环境困难。

3.6 应用

主要用于:

  • RGB-D SLAM
  • AR/VR
  • 室内机器人
  • 三维扫描

4. 点云表示(Point Cloud Representation)

4.1 基本介绍

点云(Point Cloud)是机器人和自动驾驶领域最常见的 3D 表示方式。

它使用大量三维点描述空间。

形式:

P={p1,p2,...,pN}P=\{p_1,p_2,...,p_N\}P={p1​,p2​,...,pN​}

其中:

pi=(xi,yi,zi,ci)p_i=(x_i,y_i,z_i,c_i)pi​=(xi​,yi​,zi​,ci​)


4.2 数据来源

主要包括:

1. LiDAR

激光雷达直接测量距离。

2. RGB-D

通过深度反投影生成。

3. 多视角重建

Structure from Motion(SfM)。


4.3 典型模型

模型年份贡献
PointNet2017首次直接处理无序点集
PointNet++2017层次化点云学习
PointCNN2018点云卷积
Point Transformer2021Transformer 建模点云

4.4 优点

  • 不需要规则结构;
  • 保留真实几何;
  • 适合大规模环境。

4.5 缺点

  • 无拓扑关系;
  • 数据稀疏;
  • 难以直接渲染。

4.6 应用

  • 自动驾驶
  • LiDAR 感知
  • 机器人导航
  • 三维检测

5. 体素表示(Voxel Representation)

5.1 基本思想

体素(Voxel)是三维空间中的像素。

二维:

Pixel(x,y)Pixel(x,y)Pixel(x,y)

三维:

Voxel(x,y,z)Voxel(x,y,z)Voxel(x,y,z)

空间被划分为规则网格:

+---+---+ | | | +---+---+ | | | +---+---+

5.2 类型

Occupancy Voxel

表示空间是否被占据:

V(x,y,z)∈{0,1}V(x,y,z)\in\{0,1\}V(x,y,z)∈{0,1}

TSDF

截断符号距离:

F(x,y,z)=dF(x,y,z)=dF(x,y,z)=d


5.3 典型模型

模型作用
VoxNet3D CNN 分类
OctNet高效八叉树体素
SparseConvNet稀疏三维卷积

5.4 优点

  • 结构规则;
  • 可以使用 CNN;
  • 适合空间推理。

5.5 缺点

核心问题:

三维空间爆炸问题(Curse of Dimensionality)

例如:

10003=1091000^3=10^910003=109

需要巨大存储。


5.6 应用

  • 自动驾驶占据网络
  • 医学三维成像
  • 机器人地图

6. 网格表示(Mesh Representation)

6.1 基本思想

Mesh(网格)使用:

  • 顶点 Vertex
  • 边 Edge
  • 面 Face

描述物体表面。

数学:

M=(V,E,F)M=(V,E,F)M=(V,E,F)


6.2 典型算法

方法作用
Marching Cubes从体数据提取表面
Poisson Reconstruction点云生成 Mesh
DMTet神经生成 Mesh

6.3 优点

  • 表面质量高;
  • 工业标准;
  • 渲染效率高。

6.4 缺点

  • 拓扑维护困难;
  • 动态场景困难。

6.5 应用

  • 游戏
  • CAD
  • 影视
  • 3D 打印

7. 隐式函数表示(Implicit Function Representation)

7.1 基本思想

传统方法:

存储表面在哪里。

隐式方法:

学习一个函数判断空间状态。

形式:

f(x,y,z)=sf(x,y,z)=sf(x,y,z)=s


8. SDF 表示(Signed Distance Function Representation)

8.1 基本思想

SDF 使用距离表示物体表面。

定义:

f(x,y,z)=df(x,y,z)=df(x,y,z)=d

其中:

值意义
d>0d>0d>0物体外部
d=0d=0d=0表面
d<0d<0d<0内部

8.2 典型模型

模型年份
DeepSDF2019
Occupancy Network2019
NeuS2021
VolSDF2021

8.3 优点

  • 几何精确;
  • 连续表达;
  • 可生成 Mesh。

8.4 缺点

  • 优化复杂;
  • 渲染速度较慢。

9. NeRF 表示(Neural Radiance Field)

9.1 基本思想

NeRF(Neural Radiance Field)使用神经网络表示空间颜色和密度。

函数:

Fθ(x,y,z,θ,ϕ)→(c,σ)F_\theta(x,y,z,\theta,\phi)\rightarrow(c,\sigma)Fθ​(x,y,z,θ,ϕ)→(c,σ)

其中:

  • x,y,zx,y,zx,y,z:位置;
  • θ,ϕ\theta,\phiθ,ϕ:视角;
  • ccc:颜色;
  • σ\sigmaσ:密度。

9.2 代表论文

NeRF: Representing Scenes as Neural Radiance Fields for View Synthesis

Mildenhall et al., 2020


9.3 典型改进

模型改进
Mip-NeRF抗锯齿
Instant-NGP高速训练
Zip-NeRF高质量渲染

9.4 优点

  • 新视角生成质量极高;
  • 连续空间;
  • 真实感强。

9.5 缺点

  • 训练慢;
  • 几何提取困难。

10. 3D Gaussian Splatting 表示(3DGS)

10.1 基本思想

3D Gaussian Splatting(3DGS)使用大量三维 Gaussian 表示场景。该方法于 2023 年提出,通过显式 Gaussian 基元实现高质量实时渲染,被认为是 NeRF 之后的重要方向。turn0academia12


10.2 数据结构

每个 Gaussian:

gi=(μi,Σi,αi,ci)g_i=(\mu_i,\Sigma_i,\alpha_i,c_i)gi​=(μi​,Σi​,αi​,ci​)

参数含义
μ\muμ中心位置
Σ\SigmaΣ尺度和方向
α\alphaα透明度
ccc颜色

10.3 代表论文

3D Gaussian Splatting for Real-Time Radiance Field Rendering

Kerbl et al., SIGGRAPH 2023


10.4 优点

相比 NeRF:

  • 训练快;
  • 实时渲染;
  • 显存效率更好。

10.5 应用

  • VR
  • 数字孪生
  • 机器人建图
  • 三维内容生成

11. 当前主流 3D 表示方法综合比较

方法表示类型几何能力语义能力实时性主要用途
RGB-D显式⭐⭐⭐⭐⭐⭐⭐⭐SLAM
Point Cloud显式⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐自动驾驶
Voxel显式⭐⭐⭐⭐⭐⭐⭐⭐⭐空间理解
Mesh显式⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐工业建模
SDF隐式⭐⭐⭐⭐⭐⭐⭐⭐⭐高精度重建
NeRF隐式⭐⭐⭐⭐⭐⭐⭐⭐⭐新视角生成
3DGS显式神经表示⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐实时渲染

12. 面向未来 AI 机器人的发展趋势

未来机器人系统不会只依赖单一 3D 表示,而更可能采用组合形式:

RGB / RGB-D | ↓ 3D Foundation Model | ↓ Semantic 3D Representation | ↓ Policy Model (Diffusion / VLA) | ↓ Robot Action

趋势:

方向目标
3D Foundation Model获得通用三维理解
3D Gaussian高质量实时环境表示
NeRF真实世界建模
VLA语言驱动机器人
World Model预测未来世界

总结

当前 3D 表示的发展路线可以概括为:

Point Cloud→Voxel→Mesh→SDF→NeRF→3D Gaussian Splatting \textbf{Point Cloud} \rightarrow \textbf{Voxel} \rightarrow \textbf{Mesh} \rightarrow \textbf{SDF} \rightarrow \textbf{NeRF} \rightarrow \textbf{3D Gaussian Splatting}Point Cloud→Voxel→Mesh→SDF→NeRF→3D Gaussian Splatting

其中:

  • Point Cloud解决“空间在哪里”;
  • Voxel解决“三维空间结构”;
  • Mesh解决“表面几何”;
  • SDF解决“连续几何表达”;
  • NeRF解决“真实世界视觉重建”;
  • 3D Gaussian Splatting解决“高质量实时三维渲染”。

未来具身智能(Embodied AI)的核心方向,将是:

3D 几何表示 + 语义理解 + 世界模型 + 策略学习(Policy Learning)

的融合,而不是单纯追求某一种 3D 表示。

返回列表