文献阅读1 MUCD: Unsupervised Point Cloud Change Detection via Masked Consistency摘要3D Change Detection (3DCD) has gradually become another research hotspot after image change detection. Recent works focus on using artificial labels for supervised or weakly-supervised training of siamese networks to segment changed points. However, labeling every points of multitemporal point clouds is very expensive and time-consuming. In addition, these works lack effective self-supervised signals, and existing self-supervised signals often fail to capture sufficiently rich change information. To solve this problem, we assume that the powerful representation of 3D objects should model the consistency information of unchanged regions and distinguish different objects. Based on this assumption, we propose a new unsupervised framework called MUCD to learn change information of multi-temporal point clouds through bidirectional optimization of change segmentor and feature extractor. The training of network is divided into two stages. We first design a foreknowledge point contrastive loss based on the characteristics of the 3DCD task to initialize the feature extractor, and then propose a masked consistency loss to further learn the shared geometric information of unchanged regions in the multi-temporal point clouds, utilizing it as a free and powerful supervised signal to train a change segmentor. In the inference stage, only the segmentor is used to take multi-temporal point clouds as input and produce change segmentation result. Extensive experiments are conducted on SLPCCD and Urb3DCD, two real-world datasets of streets and urban buildings, to verify that our proposed unsupervised method is highly competitive and even outperforms supervised methods in scenes where semantic information changes occur, exhibiting better performance in generalization ability and robustness.三维点云变化检测3DCD已继图像变化检测之后成为又一大研究热点。现有相关研究大多依靠人工标注采用有监督 / 弱监督方式训练孪生网络实现变化点分割。但对多时相点云逐点标注成本高昂、耗时严重同时现有方法缺少有效的自监督信号已有的自监督信号也难以捕捉足够丰富的变化特征。 针对上述问题本文提出核心假设三维物体的优质特征表征应当能够建模未变化区域的一致性特征并区分不同物体。基于该假设本文提出一种无监督框架 MUCD通过变化分割器与特征提取器的双向协同优化学习多时相点云的变化信息。 网络训练分为两个阶段第一阶段结合三维点云变化检测任务特性设计先验点对比损失完成特征提取器初始化第二阶段提出掩码一致性损失挖掘多时相点云未变化区域共享几何特征将其作为免费且高效的监督信号训练变化分割器。推理阶段仅需输入多时相点云至分割器即可输出变化分割结果。 本文在面向街道、城市建筑场景的真实数据集 SLPCCD 与 Urb3DCD 上开展大量实验结果证明所提无监督方法具备极强的竞争力在存在语义变更的场景中性能甚至超越有监督算法拥有更优异的泛化能力与鲁棒性。然后下来我会从问题定义、核心方法与创新点、实验验证以及个人理解哥部分去梳理一下全文的内容问题定义解决的问题本文解决的是三维点云变化检测任务即从同一地点、不同时间采集的两帧多时相点云中自动识别并分割出发生变化的点。问题为什么重要或者有挑战性我们可以从以下四个维度去回答这个问题挑战维度具体描述标注代价极高现有所有方法均依赖全监督或弱监督训练需要对每个点进行人工标注耗时耗力泛化能力差有监督模型在特定带标签数据集上训练面对语义变化场景如路牌变树木时检测能力有限自监督信号匮乏现有自监督信号如自重建无法捕捉足够丰富的变化信息特征差异趋向均值难以区分变化与未变化区域点云特殊性与图像像素不同多时相点云的点对之间不存在一一对应关系增加了特征对齐与学习的难度核心方法与创新点整体框架第一阶段特征提取器初始化自重建任务Self-Reconstruction→ Lrec先验点对比损失Foreknowledge Point Contrastive Loss→ Lfpc第二阶段双向联合优化分割器PointNet NFF生成变化概率图 Mx/My掩蔽一致性损失Masked Consistency Loss→ Lmcon1.用变化概率屏蔽变化点的干扰2.强制未变化区域特征保持一致推理阶段仅保留分割器 → 阈值分割threshold0.5→ 最终变化检测结果总损失函数关键创新点方法提出了三个核心创新点掩蔽一致性损失、先验点对比损失、最近邻特征融合然后下面对三个核心创新点进行详细整理掩蔽一致性损失Masked Consistency Loss, MCL核心思想未变化区域在两帧点云中具有几何/语义一致性变化区域则差异显著——以此作为无标签的自监督信号。具体做法对 PxPx​ 中每个点在 PyPy​ 中搜索 KNN 邻域并取特征均值利用分割器输出的变化概率 mx,i mx,i​ 对变化点进行掩蔽权重为 1−mx,i1−mx,i​只强制未变化点的特征保持跨时相一致性。优势形成分割器与特征提取器的双向优化闭环——特征提取器引导分割器分割器反过来帮助特征提取器排除噪声干扰。先验点对比损失Foreknowledge Point Contrastive Loss, FPC核心思想在 3DCD 任务中部分点的变化状态可以先验判断——同一场景的地面点必然未变化正样本不同场景的非地面点必然发生了相对变化负样本。具体做法以当前场景不同时相的地面点为正样本对以不同场景的非地面点为负样本设计对比损失初始化特征提取器。优势相比纯自重建任务能提取更具判别性的特征避免特征差异均值化问题为后续联合训练打下坚实基础。最近邻特征融合Nearest Feature Fusion, NFF核心思想变化检测需融合孪生网络两个分支的特征但点云点对并非一一对应。具体做法在分割器最后一层对每个点从另一时相点云中查找空间最近邻将其特征融合后再送入 MLP 输出变化概率。优势无需点对点的精确对应即可实现跨时相特征融合有效提升变化分割性能。实验验证数据集方法在实验设置这里主要选用了SLPCCD和Urb3DCD两个数据集。数据集场景类型采集方式特点SLPCCDChange3D街道小尺度场景车载激光雷达含行人、车辆等详细目标形状信息Urb3DCD城市大尺度三维地图航空激光雷达5个子集分辨率/噪声/传感器各异对比消融实验设置在实验设置这里文章设计了对比、迁移和消融实验其中对比实验用于证明方法相较于之前的有监督和弱监督方法确实实现了提升迁移实验用于证明方法的泛化性消融实验用于证明方法的三个核心创新在整体方法流程中所具体起到的作用。对比试验结果方法与有监督sota方法实验结果对比方法与弱监督sota方法实验结果对比迁移实验消融实验结果在 SLPCCD 测试集上的消融研究结果MCL 中 kk 值在 SLPCCD 测试集上的消融研究结果。个人理解我认为可以通俗的理解方法是做了这样一个事情把找变化这个需要监督的问题转化为维持一致性这个不需要监督的问题。整个方法设计了三个最核心的改动从整个流程从前往后说首先是特征提取器的优化过程中设计了一个先验点对比损失在这个设计中作者发现了一个事实就是在一个场景中有一个一定不变的东西那就是地面因为地面就在那里。所以不需要任何标注因此我们可以得知同一场景两帧里的地面点特征应该相似也就是正样本对不同场景的非地面点特征应该不相似也就是负样本对。这个设计的好处在于它用场景本身的物理先验替代了人工标注地面点是免费的、天然可靠的监督信号用它来预热特征提取器让网络在联合训练开始前就已经具备基本的特征判别能力。然后是MCL掩码一致性损失我们知道整个方法的框架是包含两个核心模块的特征提取器和分割器分割器输出每个点是变化点的概率。然后对于那些被分割器认为没变的点强制它们在两帧点云里提取到的特征要尽量相似。在MCL的设计中实现了一个很巧妙的双向优化1.分割器说这个点没变 特征提取器就努力让这个点在两帧里特征一致。2.特征提取器提取得越好 变化点的特征差异就越大分割器就能更准确地把变化点识别出来3.分割器越准确掩蔽掉的变化点越干净特征提取器学得越纯粹。实现了两个模块间的一个自我增强的闭环。最后是最近邻特征融合我们知道图像有像素对齐但点云没有所以NFF通过在空间上找最近邻的方法解决了这个问题对于对 Px里的每个点去 Py里找空间距离最近的k个点把它们的特征取平均作为对应区域的特征代表。把点对点变成点对区域。进而解决了问题。