
本文基于YOLOv13 官方仓库(iMoonLab/yolov13,ultralytics 8.3.63 fork)实测整理,Windows/CPU 全程可跑。RepMixer(Wang et al., CVPR 2024《RepViT: Revisiting Mobile CNN From ViT Perspective》,官方源码 github.com/THU-MIG/repvit,论文里的 RepMixer 在代码中就是 RepVGGDW)把 ViT 的 token mixer 重参数化:训练态三路并联——3×3 DW+BN、1×1 DW、identity——相加过 BN,fuse() 把三路折叠成单个 3×3 DW。本文把官方 RepVGGDW(连 Conv2d_BN、fuse 一起内嵌)替换进 v13n 主干的层 6,实测训练态 −172,800 参数、GFLOPs 6.5→5.97,部署态再折叠到 −173,440,与官方逐位一致(train/deploy max diff = 0,折叠前后 1.91e-06 浮点误差级),1 轮冒烟训练正常完成。前言重参数化家族在卷积层篇已经收了五篇:RepConv、DBB、MobileOneBlock、RepGhost,以及上一批的 UniRepLKBlock(第 91 篇,膨胀分支合并)。这篇回到最小最便宜的一档:RepViT 用"ViT 的宏观结构 + MobileNet 的微观算子"重做轻量 backbone,其 token mixer RepMixer 的答