Skip to content

论文阅读记录 8.18

4D

NeRF: Representing Scenes as Neural Radiance Fields for View Synthesis

解决问题:新视角合成这一根本性挑战——仅使用少量输入照片,从任意新的视点生成3D场景的逼真图像。

先前办法问题:以往的方法通常分为几类,每类都有其明显的缺点,如需要的机位特别多;难以处理细节;受限于存储成本和计算复杂性等。

核心思想:将场景表示为 5D 神经辐射场。该方法使用多层感知机(MLP)对静态场景进行参数化,将一个5D坐标——由3D空间位置(x, y, z)和2D视角方向(θ, φ)组成——映射到体积密度 σ 和视点相关的RGB颜色。

关键模型结构:神经网络架构经过精心设计,包含两个分支。第一个分支通过8个全连接层处理3D空间坐标,输出体积密度和一个256维的特征向量。至关重要的是,密度仅取决于空间位置,这确保了不同视角方向上的几何一致性。然后,特征向量与视角方向拼接,并传入额外的层,以生成视点相关的RGB颜色,从而能够表示非朗伯效应,如镜面反射。(注:对这一段没有很透彻的理解,主要是很多专业知识不太知道)

输入:单个连续的5D坐标

输出:该空间位置的体素密度和视点相关的发射辐射(其实不太理解为什么输出这两个东西,甚至说不出来这两个东西是啥)

意义:NeRF 从根本上改变了神经渲染和 3D 场景表示领域。通过从离散表示转向连续表示,它同时解决了多个长期存在的问题:存储限制、混叠伪影以及表示复杂视点依赖外观的难度。该方法仅依赖于姿态已知的 2D 图像,使其在实际应用中具有高度实用性。

其他不理解的内容:体渲染原理;为什么位置编码的映射能解决几何和外观中难以学习的高频变化;分层提及采样是怎样提高效率的;消融研究是什么

询问GPT后更新理解:NeRF 是用于稀疏视角样本集进行新视角准确合成的方法,首先用一个全连接的神经网络采集场景的5D坐标,这之中使用位置编码捕捉高频、微小的变化,使用分层采样提高采集效率;其次使用这些坐标进行该空间位置的体积密度和视点相关的发射辐射输出;最后根据这些输出利用体渲染原理进行新视角的渲染。

D-NeRF: Neural Radiance Fields for Dynamic Scenes

解决问题:捕捉或表示移动或变形的物体允许从在场景中移动的单一摄像机重建和渲染具有刚性及非刚性运动的物体的新图像

先前办法问题:NeRF 只能用于静态场景。将其扩展到动态场景,面临时间一致性、训练数据有限、复杂变形等挑战。以前的动态场景重建方法通常需要多视图相机设置、显式 3D 模型或密集点对应关系。

核心思想:将 6D 神经辐射场(3D 空间 + 观察方向 + 时间)分解为两个协同工作的专用MLP神经网络。一个形变网络 Ψt,将点从形变场景映射到规范空间;以及一个规范网络 Ψx,在规范配置中预测颜色和密度。两个网络都实现为8层MLP,使用ReLU激活函数。遵循NeRF的设计,原始坐标通过正弦位置编码进行转换,以帮助网络捕捉高频细节。编码对空间坐标使用L=10,对视线方向和时间使用L=4。规范网络遵循NeRF的架构,带有跳跃连接,而变形网络输出3D位移向量,不带最终激活函数。

输入:在场景中移动的单一摄像机

输出:具有刚性及非刚性运动的物体的新图像

局限性:计算速度慢,2天GPU;无法准确处理复杂场景;仍然需要已知的相机姿态、稳定的光照条件等;仍可以继续扩展与泛化。

其他不理解的内容:是否可以认为D-NeRF是NeRF+时间维度用于扩展动态+形变网络用于定位?“规范空间”如何确定?

3D Gaussian Splatting for Real-Time Radiance Field Rendering

解决问题:引入了三个关键要素,使我们能够实现最先进的视觉质量,同时保持有竞争力的训练时间,能够在1080p分辨率下实现高质量实时(≥ 30 帧/秒)的新视角合成。

先前办法问题:实现高视觉质量仍需要训练和渲染成本高昂的神经网络,而近期更快速的方法则不可避免地以速度换取质量。对于无界和完整的场景(而非孤立物体)以及1080p分辨率渲染,目前没有方法能达到实时显示帧率。

核心思想:

  • 从相机标定期间产生的稀疏点开始,使用3D高斯表示场景,其保留了连续体积辐射场在场景优化方面的理想特性,同时避免了空闲空间中的不必要计算。
  • 对3D高斯进行交错的优化和密度控制,尤其值得一提的是,优化了各向异性协方差,以实现场景的精确表示。
  • 开发了一种快速的可见性感知渲染算法,该算法支持各向异性点扩散,既加速了训练又实现了实时渲染。

关键结构:该方法包括三个关键组成部分:

  1. 使用 3D 高斯的场景表示
  2. 交错的优化和密度控制过程
  3. 快速的、可见性感知渲染算法

与需要密集的多视图立体 (MVS) 重建的传统基于点的方法不同,3D 高斯溅射只需要稀疏的运动结构 (SfM) 点,这些点已经在相机校准期间生成。每个 3D 高斯由以下参数定义:

  • 一个 3D 位置
  • 一个代表各向异性形状的 3D 协方差矩阵
  • 不透明度
  • 用于视角相关外观的球谐系数

优化过程迭代地细化每个高斯函数的属性,以最小化渲染图像与真实图像之间的差异。一个关键的创新是自适应密度控制机制,该机制根据渲染质量动态地添加或删除高斯函数。

渲染算法是系统的关键组成部分,可实现快速训练和实时渲染。该过程包括:

  • 将 3D 高斯函数投影到 2D 屏幕空间
  • 按深度对高斯函数进行排序
  • 应用基于图块的可微光栅化器
  • 实现高效的向后传递以进行优化

4D Gaussian Splatting for Real-Time Dynamic Scene Rendering

解决问题:实现动态场景的实时渲染,同时兼顾高训练和存储效率

核心思想:4D-GS 不为每个时间步存储单独的高斯,而是维护一组单一的规范 3D 高斯,并使用紧凑的神经网络预测其时间变形,从而在保持高视觉质量和存储效率的同时实现实时渲染速度。

  • 该方法在参考空间中维护一组规范的 3D 高斯 G,其中每个高斯的特征由其位置 X、颜色系数 C、不透明度 α、旋转 r 和缩放 s 确定。
  • 对于任何给定的时间戳 t,一个高斯变形场网络 F 会预测每个规范高斯应如何变换。这个网络分为两个部分:
    • 空间-时间结构编码器,将4D神经体积网格分解为6个多分辨率的2D屏幕,有效捕获时空关系;
    • 多头高斯变形解码器,3个独立的MLP预测特定的变形分量。
  • 在前 3,000 次迭代中,仅优化规范 3D 高斯,这在引入时间变形之前建立了稳定的几何基础,防止变形网络在早期训练中与不稳定高斯作斗争。

局限性:该方法难以处理非常大的运动、背景结构点的缺失以及不精确的相机姿态,特别是在单目设置中,运动消歧变得具有挑战性。未来的研究方向包括提高对挑战性输入条件的鲁棒性,开发更高效的大规模场景变形网络,以及整合深度或语义信息等额外模态以增强场景理解。

Shape of Motion: 4D Reconstruction from a Single Video

解决问题:单目动态重建

现有方法问题:仅在准静态场景中有效,或者未能显式地建模三维运动

核心思想:复杂的2D图像动态通常源于更简单的、低维的3D刚体运动。该方法不是为每个点独立建模运动,而是将场景运动分解为一组紧凑的可学习SE(3)运动基,这些运动基可以在相似的运动元素之间共享。

MonST3R: A Simple Approach for Estimating Geometry in the Presence of Motion

世界模型

World Model

解决问题:该框架解决了基于模型的强化学习中的一个关键挑战:防止策略利用模型缺陷。传统方法可能会学习到在模拟中表现良好但在现实中因模型错误而失败的策略。世界模型方法通过在梦境环境中控制随机性来解决这个问题。

核心架构:VMC模型

  • V:视觉模型,通过变分自编码器VAE)处理高维感官输入。将原始像素观测压缩成紧凑的潜在表示 $z_t$ ,有效地学习提取最相关的视觉特征,同时丢弃不必要的细节。
  • M:使用混合密度网络结合循环神经网络MDN-RNN)来捕获时间动态。学习根据当前观测和动作预测未来的潜在状态。
  • C:一个将连接特征映射到动作的单层线性层。
  • VAE架构采用卷积层进行空间处理,将64×64×3像素的图像压缩为32维的潜在向量。编码器使用带ReLU激活的步长卷积,而解码器使用转置卷积来重建图像。潜在空间遵循对角高斯分布,从而实现平滑插值和采样。
    MDN-RNN将LSTM单元与混合密度输出相结合,通常使用5个高斯分量来建模下一状态的分布。

关键创新:在由学习到的世界模型生成的“幻觉”环境中完全训练控制器。

局限性:

  • 当前基于LSTM的记忆模型对于极长期的依赖关系或具有丰富动态的复杂环境可能容量有限。
  • 依赖于相对简单的控制器架构。对于需要分层推理或多步规划的更复杂任务,可能需要更精密的控制器设计。

World Models (2018) 提出了现代世界模型的基本范式:智能体首先通过视觉模型将高维观察压缩到潜在状态空间,再学习状态随时间和动作变化的动力学模型,最后在模型生成的“想象环境”中训练控制策略。提出“学习一个内部世界模拟器,并利用该模拟器进行规划和学习”的思想,为后续 PlaNet、Dreamer 等基于模型强化学习方法奠定基础。

PlaNet — Learning Latent Dynamics for Planning from Pixels

解决问题:解决了该领域最具挑战性的问题之一:直接从高维像素观测中学习控制复杂系统。

About this Post

This post is written by Ezra Yang, licensed under CC BY-NC 4.0.

#notes #essays

Comments