
261008-reportAuthorZenosOverview本文档主要记录26年10月第一周学习内容以及后续学习计划。文章目录261008-report[toc]一、研究背景1.1 微小目标检测1.1.1 微小目标检测面临的挑战1.1.2 常见的一阶段目标检测流程二、近期学习内容2.1 [SET: Official implementation of SET: Spectral Enhancement for Tiny Object Detection (CVPR 2025).](https://github.com/HuixinSun/SET)**总损失函数** $$ \mathcal L2.2 相关实验三、后续学习计划问题附录一、研究背景1.1 微小目标检测在无人机视角中的目标通常包括人、车辆、船只、动物、建筑物局部目标等。和普通目标检测相比难点不是有没有目标而是这些目标在图像里往往只占很少的像素这给目标检测任务带来了很大的挑战。1.1.1 微小目标检测面临的挑战样本分布不平衡航拍图像样本正负不均、密集遮挡空间分布与背景干扰优化聚焦目标密集区域抑制背景噪声。类别与样本数量优化处理长尾类别分布稀有样本少动态样本选择平衡正负样本解决类别不平衡问题。遮挡与特征混淆优化挖掘漏检目标特征对齐融合增强小目标特征解决密集遮挡下的漏检问题。尺度变化多样性航拍目标跨度大图像感知增强放大小目标区域增强小目标特征表达。上下文信息聚合整合不同尺度的上下文信息提升模型对尺度变化的适应性。特征对齐优化解决多尺度特征的不对齐问题因为下采样、旋转或视角变化导致它和原始图像中的物体在位置、形状或方向上对不上抑制大目标对小目标的特征压制。全局特征感知整合全局语义信息减少复杂背景的干扰。小目标检测回归优化回归指标优化适配小目标的标签分配改进传统分配策略通过中心区域采样、动态标签分配为小目标生成更多正样本解决小目标正样本不足的问题。边界框回归优化针对航拍旋转目标设计定向边界框回归方法解决任意方向目标的定位问题。损失函数设计提出适配小目标的新度量同时改进旋转目标的损失函数提升角度预测精度。1.1.2 常见的一阶段目标检测流程下面以FCOS为例,介绍常见的单阶段目标检测算法流程Backbone首先输入图像经过Backbone 主干网络进行特征提取。随着网络不断加深特征图会逐渐下采样例如图中的 (C3、C4、C5)它们大致对应原图的 (1/8、1/16、1/32) 尺度。浅层特征分辨率高保留的细节信息比较多深层特征分辨率低但语义信息更强。Neck不同尺度的特征会进入FPN特征金字塔进行多尺度特征融合得到 (P3、P4、P5) 等特征层同时还可以继续生成 (P6、P7)。这样做的目的是让高分辨率特征获得更强的语义信息同时保留不同尺度目标的检测能力。Head最后每一个 FPN 层都会输入到Detection Head输出预测类别分类和检测框位置。二、近期学习内容近期学习主要围绕SET方法迁移到yolo26进行相关实验展开。2.1SET: Official implementation of SET: Spectral Enhancement for Tiny Object Detection (CVPR 2025).小结本文针对微小物体检测中目标像素少、背景高频噪声干扰强、特征判别性不足的问题提出一种频谱增强方法 SET。作者首先通过频域遮挡归因分析发现微小物体在特征编码后高频特征较弱、更易受高频噪声影响据此设计两个模块层次化背景平滑模块 HBS根据真值掩码分离前景与背景对背景进行自适应平滑以抑制高频噪声对抗扰动注入模块 API在 FPN 特征上注入多分支对抗扰动增强关键区域显著性并提升特征鲁棒性。实验在 AI-TOD、VisDrone2019、DOTA-v2.0 和 COCO 上进行结果表明 SET 可广泛提升多种检测器性能例如在 AI-TOD 上将 RFLA 提升 3.2% AP在 COCO 上将 FCOS 提升 1.0% AP。研究意义在于从频域视角为微小物体检测提供新的分析和增强思路且 SET 训练后不增加推理开销具有较强的通用性和实用性。SET方法SET方法主要运用训练时在FPN特征检测和检测头之间p i p_ipi→ HBS → API → Head。SET方法主要在训练阶段的使用推理阶段不会给基础检测器添加额外负担。HBS分层背景平滑。对不同层的特征背景进行平滑处理先将特征图中的目标和背景分离将训练数据中标定的目标和背景通过一个二值掩码进行分离目标标记为1背景标记为0。利用 GT box 构造这个二值 mask然后把 FPN 特征拆成前景和背景两部分。将P3特征切割成两块目标P i f g P i ⊙ M P_i^{fg}P_i\odot MPifgPi⊙M背景P i b g P i ⊙ ( 1 − M ) P_i^{bg}P_i\odot(1-M)PibgPi⊙(1−M)训练可学习的smoothing对背景特征进行卷积、通道压缩-c-c/r-Relu-卷积、通道恢复-C/r-cResidual 残差连接背景特征不能被压缩的太狠所以使用了处理后的背景和原始背景残差连接APIHBS使背景更安静了但是小目标的特征表现仍然很弱引入对抗扰动注入API根据Loss梯度有目的地对抗学习让网络对小目标特征学习更加鲁棒。API的目标函数min P i , θ i ( max ∥ ϵ i , c l s ∥ 2 ≤ ρ L c l s ( P i ϵ i , c l s ) γ ∥ P i ∥ 2 2 ) \min_{P_i,\theta_i} \left( \max_{\|\epsilon_{i,\mathrm{cls}}\|_2\le \rho} \mathcal L_{\mathrm{cls}}(P_i\epsilon_{i,\mathrm{cls}}) \gamma\|P_i\|_2^2 \right)Pi,θimin(∥ϵi,cls∥2≤ρmaxLcls(Piϵi,cls)γ∥Pi∥22)其中L c l s L_{cls}Lcls表示分类损失内部优化将对抗性扰动ϵ i , c l s \epsilon_{i,\mathrm{cls}}ϵi,cls注入到P i P_iPi的特征空间中,其中ρ ρρ定义扰动大小,γ \gammaγ是控制正则化强度的超参数θ i θ_iθi表示第i ii层的模型参数。扰动选择特征图添加的扰动并非随机生成而是选择梯度上升的方向ϵ i , c l s ∗ ≈ ρ ∇ P i L c l s ( P i ) ∥ ∇ P i L c l s ( P i ) ∥ 2 \epsilon_{i,\mathrm{cls}}^* \approx \rho \frac{ \nabla_{P_i}\mathcal L_{\mathrm{cls}}(P_i) }{ \|\nabla_{P_i}\mathcal L_{\mathrm{cls}}(P_i)\|_2 }ϵi,cls∗≈ρ∥∇PiLcls(Pi)∥2∇PiLcls(Pi)其中∇ P i L \nabla_{P_i}L∇PiL表示如何改变P i P_iPi会改变Lossρ \rhoρ是学习率。作者把多种任务扰动分类分支、回归分支等组合起来ϵ i a d v ∑ m 1 M λ m ϵ i , m ∗ \epsilon_i^{adv} \sum_{m1}^{M} \lambda_m\epsilon_{i,m}^{*}ϵiadvm1∑Mλmϵi,m∗将扰动加到特征图中P i ϵ i a d v P_i\epsilon^{adv}_iPiϵiadv再进行训练。总损失函数$$\mathcal L\mathcal L_{\mathrm{detection}}\lambda\sum_{i1}^{N}\mathcal L_i^{\mathrm{aux}}\left(P_iE\epsilon_i{adv}\right)$$2.2 相关实验ARmAP50mAP50-95A P v t AP_{vt}APvtA P t AP_{t}APtA P s AP_{s}APsA P m AP_{m}APmA R v t AR_{vt}ARvtA R t AR_{t}ARtA R s AR_{s}ARsA R m AR_{m}ARmOrigin38.56%37.62%21.86%2.49%9.88%21.84%36.47%9.42%22.91%37.27%51.28%Gaussian38.33%37.35%21.65%2.18%9.02%20.97%37.23%7.29%22.05%36.51%53.67%HBS39.19%37.27%21.53%2.21%9.11%21.32%35.98%7.25%21.70%36.90%53.12%EnHBS37.93%36.40%21.12%2.16%8.78%20.60%36.12%8.00%21.31%35.96%52.63%API38.64%37.54%21.85%2.39%9.16%21.36%36.96%9.70%22.65%37.31%53.72%HBS API39.12%37.46%21.81%2.93%9.84%21.67%35.33%10.93%23.08%36.40%50.58%三、后续学习计划问题附录