拓冰建站拓冰建站
首页 / 资讯中心 / 正文

【三维重建】QuerySplat:在 3DGS 预测中解耦几何与外观表征

图 1QuerySplat 概览。对不同视角数量的未校准图像QuerySplat 采用无姿态约束、前向传播且无需像素对齐的方式重建出清晰且高保真度的3DGS场景。与现有方法相比该方法能够生成结构更为连贯的场景并可在数秒内处理真实场景下的输入图像。目录摘要一、相关工作基于查询的三维场景表示视觉几何模型VGMs二、 整体架构与预训练特征提取三、 几何/外观 解耦查询Decoupled Queries四、 损失函数与优化策略实验标题QuerySplat: Decoupling Geometry and Appearance Representations in 3DGS Prediction北京航空航天大学虚拟现实技术与系统国家重点实验室InSpatio Research 浙江大学CADCG国家重点实验室链接https://inspatio.github.io/querysplat摘要尽管前馈式 3DGS 能够实现高效的三维重建但实现高保真渲染仍面临挑战。现有的像素对齐方法存在空间灵活性不足和结构冗余严重的问题而基于查询的方法则缺乏三维先验信息且将几何结构与外观信息混为一谈导致渲染结果模糊且受姿态影响。QuerySplat 是由几何先验信息和显式外观解耦驱动的前馈式 3DGS 框架。具体设计了一个双分支基于查询的解码器几何分支利用预训练的视觉几何模型进行空间理解这使 QuerySplat 自然具备无姿态建模能力而外观分支则通过一条与几何属性回归分离的专用路径来恢复高频细节。大量实验表明QuerySplat 有效缓解了早期基于查询模型存在的模糊渲染问题并在渲染保真度方面 consistently 优于像素对齐方法。在具有挑战性的 DL3DV 基准测试集上该方法实现了最先进的新视角合成性能——相较于最佳的无姿态和需姿态基准模型其平均 PSNR 增益分别达到 2.30 dB 和 1.04 dB。一、相关工作基于查询的三维场景表示为克服像素对齐的约束基于查询的方法采用可学习的token来聚合空间信息。该范式源于2D视觉的 DETR2020现已成功拓展至3D感知领域DETR3D与Mask3D以及通过体素VoxFormer2023或三平面LRM2024表示进行场景重建的场景。近期TokenGS将这一机制引入 FFR 3DGS 中彻底摆脱了对二维像素网格的依赖。然而尽管这种方法释放了空间自由度但通过统一查询同时学习复杂几何结构与细粒度纹理会引发严重的属性纠缠问题。这一优化瓶颈会降低渲染质量——导致结果过度平滑或模糊——并且仍对精确的相机位姿保持严格依赖。TokenGS 抛弃了“每个像素对应一个高斯点”的强绑定转而采用Encoder-Decoder 架构Encoder 提取输入图像的多视角特征Decoder 引入一组可学习的 Gaussian TokenQuery通过 Cross-Attention 机制动态地从图像特征中聚合三维空间与外观信息实现高斯体元数量与输入分辨率的解耦。直接 3D 空间坐标回归 Token 直接回归 3D 高斯的真实世界坐标( x , y , z ) (x, y, z)(x,y,z)、缩放尺度、旋转四元数、不透明度以及球谐颜色系数。这种无约束的连续空间回归赋予了模型更强的空间分配自由度细节区域分配更多高斯平坦区域分配更少。可见性约束Visibility Loss 为防止高斯点优化发散到无梯度的空白空间可见性损失惩罚那些未投影到任何有效监督视角的体元确保高斯点集中分布在物体表面附近。支持测试时优化Token-Tuning与动静态分离推理时模型允许仅微调特定的 Token 嵌入而无需改动网络权重以极低的计算开销进一步提高重建保真度同时支持划分静态/动态 Token灵活处理动态场景的 4D 重建。视觉几何模型VGMs在海量数据集上进行预训练后展现出强大的多视图空间推理能力。这一范式由DUSt3R 和 MASt3R 针对无姿态点云映射回归任务率先提出近期通过诸如 VGGT、Pi3、DA3以及 VGGT -Ω等高性能架构得到了进一步发展。为将这些基础模型扩展至大规模场景诸如 ZipMap 和 Scal3R等方法引入了测试时训练TTT机制以确保全局一致性而 LingBot-Map 则采用纯前馈流式处理范式无需后优化开销。尽管在架构和系统层面取得了这些快速进展但将 VGMs 集成到下游三维生成流水线中的程度仍相对有限。二、 整体架构与预训练特征提取给定一组输入图像I in { I i } i 1 N \mathcal{I}_{\text{in}} \{I_i\}_{i1}^NIin​{Ii​}i1N​网络旨在通过单次前馈预测一个可渲染的 3D 高斯集合。G F θ ( I in ) { g k } k 1 K , g k ( r k , p k , s k , α k , c k ) \mathcal{G} F_\theta(\mathcal{I}_{\text{in}}) \{g_k\}_{k1}^K, g_k (\mathbf{r}_k, \mathbf{p}_k, \mathbf{s}_k, \alpha_k, \mathbf{c}_k)GFθ​(Iin​){gk​}k1K​,gk​(rk​,pk​,sk​,αk​,ck​)其中g k g_kgk​的参数分别代表旋转四元数、中心坐标、各向异性缩放、不透明度和球谐颜色系数。为了提供强大的多视角几何先验模型引入了冻结的预训练视觉几何模型VGM用的VGGT它可以推断几何特征F geo \mathbf{F}_{\text{geo}}Fgeo​、相机位姿、内参以及稠密深度。冻结 VGM 可以有效保留其通用几何推理能力防止与高斯生成器联合微调时破坏相机和几何的一致性。同时模型通过 Sim(3) 变换实现了一个无需外部标注的自校准坐标系Self-Calibrated Coordinate System。图 2方法概览。视觉几何模型VGM用于编码具有几何感知能力的内存并定义相机参数几何查询从 VGM 特征中解码空间高斯参数而外观查询则读取 RGB/Plucker 内存以预测其余参数。所得的高斯分布通过在 VGM 定义的坐标系中采用可微分的“splatting”方法进行监督训练。三、 几何/外观 解耦查询Decoupled Queries模型将“高斯点放在哪里”几何与“高斯点长什么样”外观分开处理。这是因为过早混入包含高频局部纹理的外观特征会干扰依赖空间布局的几何梯度导致高斯点生成不稳定。几何查询Geometry Queries一组可学习的 TokenQ geo \mathbf{Q}_{\text{geo}}Qgeo​通过 Transformer 解码器与几何特征F geo \mathbf{F}_{\text{geo}}Fgeo​进行交叉注意力交互。Z geo D geo ( Q geo , F geo ) \mathbf{Z}_{\text{geo}} D_{\text{geo}}(\mathbf{Q}_{\text{geo}}, \mathbf{F}_{\text{geo}})Zgeo​Dgeo​(Qgeo​,Fgeo​)解码后的Z geo \mathbf{Z}_{\text{geo}}Zgeo​被映射为高斯点的中心坐标p \mathbf{p}p、缩放s \mathbf{s}s和旋转r \mathbf{r}r。外观查询Appearance Queries利用带有 Plücker 射线嵌入的 RGB 图像构建外观特征F app \mathbf{F}_{\text{app}}Fapp​。外观解码器以Z geo \mathbf{Z}_{\text{geo}}Zgeo​为基础状态结合可学习的外观查询Q app \mathbf{Q}_{\text{app}}Qapp​提取特征。Z app D app ( Z geo , Q app , F app ) \mathbf{Z}_{\text{app}} D_{\text{app}}(\mathbf{Z}_{\text{geo}}, \mathbf{Q}_{\text{app}}, \mathbf{F}_{\text{app}})Zapp​Dapp​(Zgeo​,Qapp​,Fapp​)最终Z app \mathbf{Z}_{\text{app}}Zapp​被映射为不透明度α \alphaα和球谐颜色c \mathbf{c}c。四、 损失函数与优化策略训练总损失L L photo λ vis L vis β cd ( t ) L cd β α ( t ) L α \mathcal{L} \mathcal{L}_{\text{photo}} \lambda_{\text{vis}}\mathcal{L}_{\text{vis}} \beta_{\text{cd}}(t)\mathcal{L}_{\text{cd}} \beta_{\alpha}(t)\mathcal{L}_{\alpha}LLphoto​λvis​Lvis​βcd​(t)Lcd​βα​(t)Lα​光度重建损失Photometric reconstruction结合了像素级L 1 L_1L1​、结构级 SSIM 和感知级 LPIPS是主要的渲染监督信号。L photo L 1 λ ssim L ssim λ lpips L lpips \mathcal{L}_{\text{photo}} \mathcal{L}_1 \lambda_{\text{ssim}}\mathcal{L}_{\text{ssim}} \lambda_{\text{lpips}}\mathcal{L}_{\text{lpips}}Lphoto​L1​λssim​Lssim​λlpips​Llpips​可见性正则化Visibility regularization借鉴 TokenGS惩罚落在相机视锥外的高斯点防止产生无渲染梯度的“漂浮物”。早期阶段正则化Early-stage regularization仅在初始化阶段使用随后逐步移除。–倒角距离损失Chamfer distance约束预测的高斯中心G p \mathcal{G}_pGp​贴近 VGM 深度反投影生成的伪点云P \mathcal{P}P。L cd d CD ( G p , P ) \mathcal{L}_{\text{cd}} d_{\text{CD}}(\mathcal{G}_p, \mathcal{P})Lcd​dCD​(Gp​,P)–不透明度下限约束Opacity-floor regularizer防止高斯点过早变得完全透明而消失α min ⁡ \alpha_{\min}αmin​为设定的下限。L α E α ∈ A [ max ⁡ ( 0 , log ⁡ α min ⁡ − log ⁡ ( max ⁡ ( α , ϵ ) ) ) ] \mathcal{L}_{\alpha} \mathbb{E}_{\alpha \in \mathcal{A}} [\max(0, \log\alpha_{\min} - \log(\max(\alpha, \epsilon)))]Lα​Eα∈A​[max(0,logαmin​−log(max(α,ϵ)))]此外该模型支持可选的测试时优化TTO通过冻结网络权重并仅优化提取的特征来在运行时间与重建保真度之间取得平衡。这种几何与外观双分支解耦的设计在处理复杂 3D 场景时通常能显著减少模糊和过度平滑的现象。实验实现细节与渐进式查询扩展Progressive Fine-tuning核心特征提取器确认使用预训练的 VGGT-Ω \OmegaΩ作为 3D 重建特征提取器每个查询 Token 负责预测 64 个高斯基元。硬件与数据在 64 张 A800 GPU 上使用 DL3DV 数据集BF16 精度训练。渐进式查询扩展核心 Trick模型并非一开始就使用全部高斯点。基础训练使用 1024 个查询点训练 300K 次迭代。微调阶段将查询数量翻倍递增最终达到 8192 个。新增的查询 Token 并非随机初始化而是通过对旧 Token 施加微小扰动来继承先验q i new q i m o d N old old ξ q_{i}^{\text{new}} q_{i \bmod N_{\text{old}}}^{\text{old}} \xiqinew​qimodNold​old​ξ这种策略类似于传统 3DGS 中的高斯分裂Splitting能以可控的计算代价显著增加高斯数量提升高频细节表达。对比实验与性能结论严格防泄漏.为了公平对比 Pose-free无位姿先验模型QuerySplat 仅使用 All-view 通道进行位姿估计和 Sim(3) 对齐绝对禁止用目标视角的 GT 特征来辅助重建。测试时优化TTO文章特别测试了仅用 20 步和 50 步的轻量级测试时优化。即便不使用 TTOQuerySplat 在 PSNR、SSIM 和 LPIPS 指标上也全面超越了现有的 Posed 和 Pose-free 前馈方法。定性优势突破了以往基于 Query 的 3DGS 容易出现模糊过度平滑的瓶颈。由于几何与外观的双分支解耦它在保留非像素对齐框架结构优势的同时达到了与像素对齐方法Pixel-aligned相媲美的视觉锐利度和纹理保真度。
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门