研究:稀疏视角图像生成完整3D场景的新方法SPAR3S,无需3D真值监督
SPAR3S在合成室内场景中实现优于先前工作的新视角质量,并在RealEstate10k数据集上验证了泛化能力。
AI解读:这篇论文针对的是3D视觉中的一个老问题:从几张稀疏、角度不固定的照片生成完整3D场景。过去的方法要么只能补全照片里看得见的部分,要么需要海量3D标注数据来训练,成本很高。SPAR3S的思路是把场景压缩成一种只记录被占用的体素的稀疏3D潜在空间,靠多视角图像的光度信息来学习,绕开了对3D真值数据的依赖;然后用一个掩码自回归Transformer同时预测哪些地方有物体以及具体的场景内容。对需要处理不完整扫描或视角有限的场景重建任务来说,这意味着可以用更少的3D标注代价获得更完整的场景。论文在合成室内场景上表现优于此前方法,并在真实场景数据集RealEstate10k上做了验证。需要留意的是,目前公开的实验证据集中在合成环境和单个真实数据集,距离通用场景生成还有距离,而且论文的发表状态是ECCV 2026接受,尚未正式刊出。
arXiv论文介绍了SPAR3S,一个稀疏体素对齐的 3D潜在生成模型,用于从稀疏多视角图像进行条件场景补全,且训练时不需要ground-truth 3D数据作为监督。论文称,SPAR3S在合成室内场景上实现了比先前工作更高的新视角(novel-view)质量,并在RealEstate10k数据集上验证了其对真实世界数据的泛化能力。
该论文由Thomas Lucas、Maxime Pietrantoni、Philippe Weinzaepfel、Wonjune Cho、Bardienus Pieter Duisterhof、Vincent Leroy、Jerome Revaud撰写,已被European Conference on Computer Vision (ECCV) 2026 接收。论文于 2026 年 9 月 3 日提交至arXiv。
方法:稀疏体素潜在空间与掩码自回归Transformer
SPAR3S的核心思路是在结构化的、紧凑的、体素对齐的 3D潜在空间中建模,只表示被占用的体素(occupied voxels)。这个稀疏潜在空间直接使用多视角图像通过可微分的 3D Gaussian Splatting进行光度监督来学习。
给定从稀疏输入视角编码的部分观测体素后,场景补全任务被简化为预测缺失的潜在token及其在体素网格中的空间位置。为此,作者训练了一个掩码自回归Transformer,同时建模体素占用情况和潜在token值,从而使模型能够生成空间一致的新区域。
结果与限制
论文称,SPAR3S在合成室内场景上优于先前的新视角合成质量,并在RealEstate10k数据集上验证了方法的泛化能力。
方法针对的挑战包括:现有前馈重建方法本质上受限于输入图像中可见的内容,而 3D生成建模则受限于稠密体积表示的高计算成本和大规模 3D监督数据的稀缺性。论文未提供计算成本的具体数字或与其他方法的详细对比数据。