AdaAnchor4D:用于单目无人机4D重建的锚点条件时空特征聚合 大家读完觉得有帮助记得关注和点赞摘要单目无人机视频为复杂城市场景的动态重建提供了宝贵的观测数据。然而此类场景呈现出显著的时空异质性不同区域遵循各异的时间活动模式且部分动态区域的运动状态还可能随时间演化。尽管基于分解式共享时空特征场的动态高斯方法在物体中心或相对紧凑的场景中已实现高效精确的重建但其普遍采用的固定平面特征组合机制难以适应无人机场景的异构局部动态常导致重影伪影和动态细节模糊。为应对这一挑战我们提出AdaAnchor4D一种面向单目无人机动态场景重建的自适应锚点形变框架。其核心——锚点条件特征聚合——利用锚点特定的聚合嵌入和时序信息自适应地聚合共享时空特征使不同局部单元能够获得契合其局部与时态状态的动态表征。解耦局部几何形变将锚点状态形变量与局部高斯几何形变量分离而密度自适应坐标扭曲则根据轴向锚点分布对特征查询坐标进行重参数化缓解了非均匀几何采样与均匀网格参数化之间的失配。在UAV-Arc4D、VisDrone和UAVDT数据集上的实验表明AdaAnchor4D在保持实时渲染性能的同时相较于代表性动态高斯方法取得了更高的渲染质量。代码将公开。图1单目无人机场景在区域和时间维度上均表现出强烈的时空异质性。共享时空特征的固定聚合无法适应变化的局部动态常导致模糊和重影。我们的锚点条件特征聚合利用锚点特定嵌入和时序线索自适应地重新加权共享特征以改进动态建模。1. 引言3D高斯泼溅技术的最新进展在高质量新视角合成方面展现了卓越性能这得益于其显式的场景表示和高效的可微分渲染。在此基础上动态高斯泼溅方法进一步引入了时间维度为动态场景的连续时空表示和实时渲染提供了新范式。单目无人机视频提供了灵活的视角、广域覆盖和便捷的数据采集为复杂城市场景的动态重建提供了宝贵观测。因此将动态高斯泼溅扩展至单目无人机视频是其部署于大规模复杂城市场景的自然延伸。然而此类场景呈现出显著的时空异质性。如图1所示在视频序列中不同区域遵循各异的时间活动模式部分区域长期稳定部分区域仅在特定时间间隔内变化而其他区域则经历持续复杂的运动。同时同一动态区域的运动状态也可能随时间演化。因此不同局部单元在不同时间步长需要不同的动态表征。如何在保持整体建模效率的同时构建适应局部场景条件和时态状态的动态表征成为动态无人机场景重建的重要挑战。为平衡表征能力与计算效率许多动态高斯方法采用规范空间形变框架并利用分解的共享时空场来建模场景动态。这些方法通过多个低维特征平面紧凑地编码高维时空信息并按照预定义规则聚合查询到的平面特征。这种共享建模方式紧凑高效在物体中心或相对紧凑的场景中表现优异。然而固定的特征组合规则无法针对不同局部单元及其时态状态调整不同平面和通道的贡献限制了共享时空表征在建模无人机场景异构局部动态时的灵活性并可能在复杂运动区域导致重影伪影和动态细节模糊。因此共享时空场应在保持其紧凑表示的同时实现基于不同局部单元及其时态状态的条件自适应特征聚合。为此我们提出AdaAnchor4D一个以锚点条件时空特征聚合为核心的单目无人机4D重建框架。AdaAnchor4D采用锚点作为局部动态建模的紧凑单元构建基于锚点特定聚合嵌入和时序信息的局部自适应动态表征同时保留共享时空表征的效率。具体而言锚点条件特征聚合基于锚点特定聚合嵌入和时序信息预测通道级的平面聚合权重自适应地调制不同共享时空特征的贡献。这使得不同时间步长的不同局部单元能够从同一共享时空场中提取契合其局部动态需求的表征。ACFA保留统一的共享时空表示仅对特征聚合过程进行条件化从而在增强其对异构局部动态适应性的同时保持了表征的紧凑性。基于ACFA我们进一步观察到联合建模不同表示层级的形变变量可能会限制细粒度几何建模的灵活性。因此我们引入解耦局部几何形变将ACFA驱动的锚点状态形变与局部几何残差预测分离为不同层级的形变提供专用的建模路径。此外受无人机成像几何和场景结构影响锚点在空间中常呈非均匀分布这与共享特征网格的均匀坐标参数化不相匹配。为此我们提出密度自适应坐标扭曲根据轴向锚点分布对查询坐标进行重参数化使有限的网格容量能更好地适应非均匀几何采样。在UAV-Arc4D、VisDrone和UAVDT上的实验证明AdaAnchor4D在保持实时渲染性能和紧凑神经表征的同时提升了渲染质量。主要贡献总结如下我们提出AdaAnchor4D一种用于单目无人机4D重建的自适应锚点形变框架。其核心锚点条件特征聚合利用锚点特定聚合嵌入和时序信息自适应地聚合共享时空特征。我们引入解耦局部几何形变将锚点状态形变与局部高斯几何形变量分离实现更灵活的局部几何建模。我们提出密度自适应坐标扭曲使特征查询坐标适应非均匀锚点分布优化共享特征网格的容量分配。2. 相关工作2.1 动态高斯泼溅动态高斯泼溅通过显式时空建模或规范空间形变将3DGS扩展至动态场景。显式方法利用时变高斯状态、时间基函数或参数化轨迹或直接定义在四维时空中的高斯图元来表示时间演化。这些方法虽能直接描述高斯随时间的变化但通常引入了额外的时态参数或更高维的图元。规范空间形变方法则维护一个基础高斯表示并通过形变场预测其时态相关状态。为提高效率许多方法采用分解的时空场将动态信息存储在低维特征平面中并聚合查询到的特征以预测形变。然而它们的平面特征通常采用预定义规则组合无法适应不同的局部单元和时态状态。Grid4D将4D输入分解为空间和时空3D哈希编码并利用空间导出的方向注意力调制时间特征。相比之下ACFA保留紧凑的多平面共享场并基于锚点特定聚合嵌入和时序信息预测通道级的平面聚合权重。近期若干方法受Scaffold-GS启发采用基于锚点的表示来组织动态高斯。代表性方法包括MoDec-GS、4D Scaffold Gaussian Splatting和MoRel。MoDec-GS先建模全局锚点形变再进行局部高斯形变4D-SFGS从网格对齐的4D锚点生成局部神经4D高斯MoRel则通过双向形变和时态混合连接局部规范锚点空间。与这些方法不同AdaAnchor4D利用锚点特定聚合嵌入自适应聚合共享时空场以进行锚点状态形变同时通过几何条件嵌入为局部高斯几何形变提供专用路径。2.2 无人机场景重建凭借灵活视角和广域覆盖无人机已广泛应用于城市环境、道路和自然场景的3D重建。现有研究多聚焦于静态航拍场景通过相机位姿优化、几何一致性约束、大规模场景划分与表示以及模型压缩来提升重建质量与效率。相比之下动态无人机场景重建的研究相对有限。TK-Planes扩展了K-Planes表示利用分层特征向量建模高空视角下的小规模动态物体。UAV4D结合3D基础模型与人体先验从包含多个移动行人的单目无人机视频中联合恢复静态背景和动态人体。AeroGS面向未知相机位姿的单目无人机视频联合恢复相机轨迹和动态场景表示并引入尺度感知时空锚点以缓解相机运动、物体运动和尺度变化之间的耦合。AeroDGS通过引入单目几何提升和物理一致性约束解决单目航拍环境中的深度和运动歧义实现更稳定的动态几何和运动估计。这些研究主要从人体先验、相机轨迹恢复以及动态物体的几何或运动约束角度解决动态无人机场景重建问题。相反我们的工作聚焦于动态场景表示本身旨在提升共享时空场对异构局部动态的适应性。3. 预备知识基于锚点的高斯表示基于锚点的表示不独立维护每个高斯图元而是将每个锚点与K个局部高斯相关联。每个规范锚点包含一个中心点xi​和一个可学习特征fi​表征其锚点层级状态以及局部偏移Oi​{oi,k​}k1K​和尺度参数si​∈R6用于刻画锚点内高斯层级的几何。si​的前三个分量缩放局部偏移每个高斯中心通过将缩放后的偏移加到锚点中心获得其余三个分量提供协方差相关缩放。每个局部高斯的不透明度、视角相关颜色、旋转和各向异性尺度遵循标准锚点表示从可学习锚点特征fi​和相机到锚点的观测信息中解码得到。时空特征分解与4D-GS类似共享时空特征场被分解为六个可学习的2D特征平面而非表示为(x,y,z,t)的稠密特征网格。这些平面对应所有成对的坐标组合P{xy,xz,yz,xt,yt,zt}。在分辨率层级l平面p∈P上的特征网格记为Hp(l)​∈RC×Rp,1(l)​×Rp,2(l)​其中C为特征维度Rp,1(l)​和Rp,2(l)​为相应的平面分辨率。给定时空查询坐标q(x,y,z,t)其在平面p上的特征通过双线性插值获得其中πp​(⋅)将4D坐标投影到平面p。得到的逐平面特征通过逐元素相乘进行聚合然后将所有L个分辨率层级的特征拼接起来这种固定聚合对所有查询应用相同的平面组合规则无法根据空间位置和时态状态调整各平面的贡献。4. 方法图2AdaAnchor4D概览。锚点条件特征聚合执行依赖锚点和时间的特征聚合解耦局部几何形变通过独立分支处理锚点状态和局部高斯几何形变密度自适应坐标扭曲则将查询坐标调整至粗阶段锚点分布。4.1 AdaAnchor4D概览为了在基于锚点的表示中建模单目无人机场景的异构动态我们提出AdaAnchor4D一个用于单目无人机视频动态场景重建的自适应锚点形变框架。如图2所示AdaAnchor4D由密度自适应坐标扭曲、锚点条件特征聚合和解耦局部几何形变组成。给定规范空间锚点Ai​和目标时间tACFA基于锚点特定的聚合嵌入和时间预测共享特征平面上的通道级聚合权重。生成的动态表征用于预测锚点位置和特征的残差。与此同时DLGD使用两个几何条件嵌入和专用分支来预测局部高斯偏移和尺度参数的残差而DACW则通过由粗阶段获得的轴向锚点分布构建的非线性映射对空间特征查询坐标进行重参数化。ACFA使用的共享平面特征在扭曲后的坐标处进行查询。这些残差将规范锚点形变为Ai​(t)(xi​(t),fi​(t),Oi​(t),si​(t))。关联的局部高斯随后从形变后的锚点实例化用于可微分渲染。4.2 锚点条件特征聚合分解的时空场通过全局共享特征平面提供了场景动态的紧凑表示。然而固定聚合对所有锚点应用相同的特征读取规则限制了其建模城市场景中常见的异构且演化的局部运动的能力。为解决此局限我们提出锚点条件特征聚合它在保留全局共享时空场的同时允许每个锚点随时间自适应地聚合平面特征。具体而言ACFA为每个锚点关联一个可学习的聚合嵌入eiacfa​∈RC为平面特征聚合提供锚点特定条件。该嵌入与其他锚点参数联合优化并在锚点致密化过程中传播。结合归一化时间t∈[0,1]该嵌入被输入一个轻量级预测器Φw​以产生通道级的平面分数对于每个通道分数沿平面维度通过softmax进行归一化这产生了每个特征通道上依赖锚点和时间的平面权重。在分辨率层级l的聚合特征为其中gi,p(l)​(t)表示在DACW扭曲坐标处查询的平面特征wi,p​(t)包含平面p的通道级权重⊙表示逐元素相乘。相同的权重跨分辨率层级共享最终特征通过hi,ACFA​(t)Concatl1L​(hi,ACFA(l)​(t))获得。为提高优化稳定性我们对Φw​的输出层进行零初始化使训练初期每个平面获得均匀的权重1/∣P∣。因此ACFA从均匀平面加权开始逐步学习随锚点和时间变化的聚合模式。通过这种方式ACFA在保留共享时空场的同时允许不同锚点针对异构局部动态采用差异化的特征读取模式。4.3 解耦局部几何形变ACFA为每个锚点在每个时间步提供了自适应动态特征。然而锚点位置和特征表征锚点层级状态而局部高斯偏移和尺度参数描述的是关联高斯的锚点内几何。从同一动态表征预测所有这些属性会将不同表示层级的形变变量耦合在一起可能限制局部几何建模的灵活性。因此我们提出解耦局部几何形变它保留基于ACFA的锚点层级属性预测同时为局部几何形变引入专用条件路径。给定hi,ACFA​(t)锚点位置和特征的残差由一个共享动态编码器后接两个属性特定的头部预测相应的锚点状态更新为对于局部几何我们为每个锚点关联两个可学习的几何条件嵌入eio​∈RC和eis​∈RC分别为偏移和尺度参数形变提供专用条件。两个轻量级分支预测偏移和尺度残差局部几何随后更新为Φo​和Φs​的输出层进行零初始化确保优化从规范几何开始。通过将局部几何预测与ACFA驱动的锚点状态形变解耦DLGD为不同表示层级的形变变量提供了专用的条件路径实现了更灵活的细粒度几何建模。4.4 密度自适应坐标扭曲无人机场景中的锚点常沿不同空间轴呈非均匀分布而共享特征网格通常采用均匀坐标参数化导致有限的特征容量与底层几何采样分布之间的失配。为缓解此失配我们提出密度自适应坐标扭曲它根据锚点沿每个空间轴的边缘分布构建密度自适应的非线性查询映射。给定线性归一化的规范锚点坐标ui​(ui,x​,ui,y​,ui,z​)DACW为三个空间轴独立构建非线性重参数化映射。对于轴d∈{x,y,z}我们将[−1,1]均匀划分为B个区间。然后构建轴向锚点直方图应用高斯平滑并将其归一化以获得第b个区间的概率质量pd,b​其中∑b1B​pd,b​1。为使扭曲强度适应局部采样密度我们首先计算每个区间相对于均匀分布的密度响应其中γ控制对密度变化的敏感度。随后将响应缩放到预定义范围内其中0≤λmin​≤λmax​≤1指定了密度自适应强度的上下界。为平衡密度自适应和均匀坐标分配我们定义未归一化的目标分配为设输入区间边界为eb​−12Bb​,∀b∈{0,⋯,B}。相应的输出边界则由累积目标区间质量构建e~d,0​−1,e~d,b​−12∑j1b​rˉd,j​。对于ui,d​∈[eb−1​,eb​]扭曲后的坐标通过相应输出边界间的线性插值获得该设计将更多坐标容量分配给采样密集的区间同时使稀疏区域保持接近均匀分配。应用三个轴向映射后得到最终的时空查询q~​i​(t)(u~i,x​,u~i,y​,u~i,z​,t)平面特征在该坐标处查询为gi,p(l)​(t)gp(l)​(q~​i​(t))。为防止特征查询坐标在优化过程中持续变化我们在粗阶段结束时利用当前锚点分布一次性构建轴向直方图和坐标映射并在随后的精阶段优化和锚点致密化过程中保持固定。5. 实验5.1 数据集与实现细节图3UAV-Arc4D和VisDrone上的定性比较。前三行对应UAV-Arc4D后三行对应VisDrone。红框突出了移动物体和挑战性的运动边界。数据集与评估我们在三个单目无人机动态场景数据集上评估我们的方法自建的UAV-Arc4D包含10个城市道路与交通场景以及来自VisDrone的6个序列和来自UAVDT的5个序列。详情见补充材料。对于所有场景我们在完整视频序列上运行COLMAP以估计相机位姿并生成初始稀疏点云。我们使用PSNR、SSIM和LPIPS评估渲染质量。我们还报告了完整渲染流水线的速度、训练时间和神经表示大小。所有对比方法使用相同的相机位姿、稀疏初始化、训练/测试划分、输入图像和主要阶段优化迭代次数。所有效率相关指标均在相同硬件和渲染分辨率下测量。实现细节AdaAnchor4D在PyTorch中实现在单张NVIDIA RTX 3090 GPU上使用Adam优化器进行优化粗阶段3,000次迭代精阶段30,000次迭代。对于ACFA聚合嵌入维度和权重预测网络的隐藏维度分别设置为32和256。对于DLGD偏移和尺度分支采用独立的MLP几何条件嵌入维度为32隐藏维度为128。对于DACW沿每个空间轴构建包含64个区间的密度直方图。补充材料中提供了更多配置和超参数。表1UAV-Arc4D和VisDrone上的定量比较。PSNR、SSIM、FPS越高越好LPIPS、训练时间、神经表示大小越低越好。最佳和次佳结果分别以粗体和下划线标出。方法出处UAV-Arc4D​VisDrone​PSNR↑SSIM↑LPIPS↓FPS↑时间↓大小↓PSNR↑SSIM↑LPIPS↓FPS↑时间↓大小↓D3DGSCVPR 202429.210.9290.12018.4275.702.0028.950.9000.14914.32126.172.004D-GSCVPR 202431.900.9220.14952.4545.6027.3030.000.8700.21042.1256.8327.50MoDec-GSCVPR 202532.050.9370.11433.8573.8030.0030.710.9130.13324.33105.0030.504D-SFGSAAAI 202631.670.9370.1092.3039.700.1230.430.9100.1271.7987.670.11SpeeDe3DGSCVPR 202628.490.9110.165133.4247.002.0028.160.8690.21698.8670.832.00MoRelCVPR 202629.680.9300.11524.5172.5017.0029.250.9070.13210.7186.0019.50Ours​–33.74​0.943​0.102​47.04​43.29​9.00​31.91​0.921​0.118​32.41​57.60​7.60​5.2 对比实验我们将AdaAnchor4D与几种代表性的动态高斯重建方法进行比较包括D3DGS、4D-GS、MoDec-GS、4D-SFGS、SpeeDe3DGS和MoRel。重建质量如表1和表2所示AdaAnchor4D在UAV-Arc4D、VisDrone和UAVDT上均取得了最佳的渲染质量。在UAV-Arc4D上我们的方法PSNR达到33.74 dBSSIM为0.943LPIPS为0.102PSNR和SSIM分别优于次佳结果1.69 dB和0.006LPIPS降低0.007。在VisDrone上AdaAnchor4D的PSNR为31.91 dBSSIM为0.921LPIPS为0.118PSNR和SSIM分别提升1.20 dB和0.008LPIPS降低0.009。在UAVDT上我们的方法PSNR为29.51 dBSSIM为0.909LPIPS为0.101PSNR和SSIM分别超越次佳结果0.59 dB和0.006LPIPS降低0.004。这些结果表明AdaAnchor4D在三个动态无人机场景数据集上均能持续提升渲染质量。定性比较如图3所示我们在UAV-Arc4D和VisDrone的动态无人机场景上将AdaAnchor4D与代表性方法进行比较。红框突出了移动车辆和挑战性的运动边界。现有方法在复杂运动区域常产生重影伪影、轮廓模糊和局部结构畸变。相比之下AdaAnchor4D恢复了更清晰的物体边界以及更连贯的局部几何和外观结果更接近真实情况。补充材料中提供了更多定量结果和定性可视化。表2UAVDT上的定量比较。最佳和次佳结果分别以粗体和下划线标出。方法PSNR↑SSIM↑LPIPS↓FPS↑时间↓大小↓D3DGS26.830.8960.1268.25150.232.004D-GS27.520.8360.21831.6563.1828.60MoDec-GS28.220.8980.12323.45141.6030.204D-SFGS28.920.9030.1052.1493.000.11SpeeDe3DGS26.120.8490.207104.4468.802.00MoRel26.210.8710.14511.52115.4026.60Ours​29.51​0.909​0.101​32.94​67.21​9.40​效率分析AdaAnchor4D保持了实时渲染性能在UAV-Arc4D、VisDrone和UAVDT上分别达到47.04、32.41和32.94 FPS相应训练时间为43.29、57.60和67.21分钟。尽管SpeeDe3DGS实现了更高的渲染速度部分对比方法需要更少的神经表示存储但它们的渲染质量仍低于AdaAnchor4D。我们的方法在三个数据集上的神经表示大小分别为9.0、7.6和9.4 MB表明其神经表示存储适中。总体而言AdaAnchor4D在显著提升渲染质量的同时保持了实时渲染能力和紧凑的神经表征实现了优越的质量-效率权衡。图4学习到的ACFA聚合权重可视化。(a) 两个不同时间步的真实图像白色和黑色框分别表示代表性的静态和动态区域。(b) 相应区域内锚点的归一化空间平面和时空平面贡献随时间的变化。实线表示锚点间的均值阴影区域表示一个标准差范围。5.3 消融实验模块消融表3展示了在UAV-Arc4D和VisDrone上对ACFA、DLGD和DACW的消融研究。基线采用相同的基于锚点的动态框架使用哈达玛积聚合共享时空特征仅建模锚点位置和特征的时态变化并采用线性坐标归一化。引入ACFA后UAV-Arc4D/VisDrone上的PSNR从32.18/30.68 dB提升至33.16/31.29 dBLPIPS从0.111/0.130降至0.106/0.126。在ACFA基础上加入DLGDPSNR进一步提升至33.52/31.51 dB而加入DACW则达到33.54/31.66 dBSSIM为0.943/0.919LPIPS为0.104/0.124。组合所有三个模块取得了最佳整体性能PSNR达33.74/31.91 dBSSIM达0.943/0.921LPIPS达0.102/0.118。与基线相比完整模型在两个数据集上分别提升了1.56/1.23 dB的PSNR。这些结果证明了ACFA、DLGD和DACW分别在自适应特征聚合、解耦局部几何形变和密度自适应坐标扭曲方面的有效性以及它们的互补效益。特征聚合如表4所示乘积和均值操作在两个数据集上表现相似表明仅替换固定聚合算子益处有限。“仅锚点”在UAV-Arc4D上提升了结果但在VisDrone上未见增益而“仅时间”主要有益于VisDrone表明任一单独的条件源都不足以带来一致的提升。相比之下ACFA联合纳入了锚点特定聚合嵌入和时序信息并在所有指标上取得了最佳性能。与乘积操作相比ACFA在UAV-Arc4D/VisDrone上提升了0.98/0.61 dB的PSNR并降低了0.005/0.004的LPIPS。这些结果表明ACFA受益于联合利用锚点特定聚合嵌入和时序信息来调节平面特征聚合。为进一步验证ACFA的适应性图4可视化了代表性静态和动态区域中学习到的聚合权重。静态区域更依赖空间平面而动态区域则为时空平面分配了更高的平均权重表明ACFA能够根据局部动态状态自适应调整共享特征聚合。表3UAV-Arc4D和VisDrone上的消融结果。最佳结果以粗体标出。ACFADLGDDACWUAV-Arc4D​VisDrone​PSNR↑SSIM↑LPIPS↓PSNR↑SSIM↑LPIPS↓32.180.9370.11130.680.9130.130✓33.160.9410.10631.290.9160.126✓✓33.520.9430.10431.510.9170.120✓✓33.540.9430.10431.660.9190.124✓✓✓33.74​0.943​0.102​31.91​0.921​0.118​表4特征聚合与条件策略的消融研究。所有变体仅形变锚点位置和特征使用相同的共享时空特征场和训练配置。策略UAV-Arc4D​VisDrone​PSNR↑SSIM↑LPIPS↓PSNR↑SSIM↑LPIPS↓乘积32.180.9370.11130.680.9130.130均值32.140.9370.11130.690.9120.131仅锚点32.530.9380.11030.670.9130.131仅时间32.190.9380.11230.910.9140.130ACFA​33.16​0.941​0.106​31.29​0.916​0.126​6. 结论我们提出了AdaAnchor4D一种用于单目无人机4D重建的自适应锚点形变框架。ACFA将分解式共享时空场的聚合过程条件于锚点特定聚合嵌入和时序信息使局部单元能从同一紧凑共享场中获取自适应动态表征。DLGD进一步将锚点状态形变与局部高斯几何形变量分离而DACW则根据轴向锚点分布对特征查询坐标进行重参数化。在三个无人机动态场景数据集上的实验表明AdaAnchor4D在保持实时渲染性能和紧凑神经表征的同时提升了渲染质量。我们的框架依赖于预估计的相机位姿对严重的位姿误差、遮挡和稀疏观测可能鲁棒性不足。未来工作将联合优化相机位姿和动态场景表示。