ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

CANN GroupNorm 使用指南:分组标准化一步讲清原理与用法

CANN GroupNorm 使用指南:分组标准化一步讲清原理与用法 CANN GroupNorm 使用指南分组标准化一步讲清原理与用法【免费下载链接】BabelDOCYet Another Document Translator项目地址: https://gitcode.com/GitHub_Trending/ba/BabelDOCCANN GroupNorm 是昇腾 AI Core 提供的分组标准化算子它沿通道维度把特征图分组做标准化再做缩放和平移。本文用 3 分钟讲清它的适用场景、和其他 Norm 算子的差异、以及调用流程。一、什么时候需要它场景切入先给个画面一桌 8 个通道的特征装进 2 个杯子里每杯 4 个通道每个杯子各自归一——这就是 GroupNorm 在做的事。落到实现上对 shape 为 [N, C, H, W] 的输入它把 C 维切分成 groupNum 组组内各自做标准化最后再按通道做 γ、β 仿射。两类典型场景batch 很小检测、跟踪、少样本学习BatchNorm 的统计量不稳。GroupNorm 的统计逐样本逐组计算不依赖 batch 大小。想要比 BatchNorm 更强的归一但 LayerNorm 又太重。GroupNorm 给你两档之间可调的强度。 groupNum C 时它退化成 InstanceNormgroupNum 1 时退化成 LayerNorm。分组就是那个旋钮。二、它和 BatchNorm / LayerNorm / InstanceNorm 到底差在哪核心一句话不同 Norm 的差异只在「均值和方差在哪些维度上计算」。以输入 [N, C, H, W] 为例算子统计范围等价分组BatchNorm每通道在 [N, H, W] 上每通道一组InstanceNorm每个 (N, C) 在 [H, W] 上每通道独立groupNum CGroupNormC 切组后每组在 [H, W] 上C 切成 groupNum 组LayerNorm每个 N 在 [C, H, W] 上全部通道一组groupNum 1可以看到 GroupNorm 站在 BatchNorm 和 LayerNorm 之间组数越多越像 BN组数越少越像 LN。三、计算过程公式 走一遍例子标准化公式是通用的μ (1/m)·Σxᵢσ² (1/m)·Σ(xᵢ−μ)²x̂ᵢ (xᵢ−μ)/√(σ²ε)yᵢ γ·x̂ᵢ β其中 m 是组内元素个数ε 是防除 0 的小常数γ、β 是按通道可训练的参数shape [C]。GroupNorm 独有的规则只有一条把 [N, C, H, W] 的 C 维切 groupNum 组μ、σ² 只在各自组内统计。走一遍数字设 N1、C2、H×W2groupNum2每组 1 通道ε≈0组 1 通道 [1, 3]μ2σ²1 → 标准化为 [-1, 1]组 2 通道 [2, 6]μ4σ²4 → 标准化为 [-1, 1]再用 γ[1.5, 2]、β[0.5, -0.5] 做仿射最终输出组 1 为 [-1.0, 2.0]组 2 为 [-2.5, 1.5]。注意标准化的值相同输出却不同因为 γ、β 是按通道生效的。四、接口长什么样主原型内部自动申请临时空间template typename T, bool isReuseSource false __aicore__ inline void GroupNorm(const LocalTensorT output, const LocalTensorT outputMean, const LocalTensorT outputVariance, const LocalTensorT inputX, const LocalTensorT gamma, const LocalTensorT beta, const T epsilon, GroupNormTiling tiling)还有一个重载多一个const LocalTensoruint8_t sharedTmpBuffer参数中间临时空间不再从栈自动分配改由你传入大小从 Tiling 文档获取。参数逐个看output—— 标准化后做缩放、平移的结果shape [N, C, H, W]输出。outputMean / outputVariance—— 每组的均值和方差shape 都是 [N, groupNum]输出反传和调试时常用。inputX—— 源特征shape [N, C, H, W]。若开了 isReuseSource它的内存会被改写后面还要用原始数据的话要小心。gamma / beta—— 缩放与平移参数shape 都是 [C]建议取值范围 [-100, 100]。sharedTmpBuffer—— 仅第二个重载有。存中间变量按字节计的 tensor大小见 Tiling 文档。epsilon—— 防除 0 小常数数据类型必须和 inputX/output 一致。tiling—— 切分信息用 shape、栈空间大小、groupNum 调 GetGroupNormNDTillingInfo 得到。五、约束与注意事项仅支持 ND 格式输入NHWC 等其他格式不支持。Ascend 950PR/950DT、Atlas A3 训练/推理系列、Atlas A2 训练/推理系列均可用数据类型支持 half 和 float。isReuseSource 复用 inputX 的内存以省空间但只对 float 输入可开启half 不支持。γ、β 取值范围 [-100, 100]epsilon 类型必须和 inputX/output 一致。操作数地址要满足通用地址对齐约束。⚠️ 易混点γ、β 是按通道生效均值方差是按组统计的——参数按通道统计按组。六、调用示例走读一个最精简的调用模板template typename T __aicore__ inline void GroupNormDemo(GM_ADDR xGm, GM_ADDR gGm, GM_ADDR bGm, GM_ADDR yGm, uint32_t n, uint32_t c, uint32_t h, uint32_t w, uint32_t g) { T epsilon 0.001f; uint32_t total n * c * h * w; GlobalTensorT xGlobal, gGlobal, bGlobal, yGlobal; xGlobal.SetGlobalBuffer(reinterpret_cast__gm__ T*(xGm), total); gGlobal.SetGlobalBuffer(reinterpret_cast__gm__ T*(gGm), c); bGlobal.SetGlobalBuffer(reinterpret_cast__gm__ T*(bGm), c); yGlobal.SetGlobalBuffer(reinterpret_cast__gm__ T*(yGm), total); TPipe pipe; TQueTPosition::VECIN, 1 xQue, gQue, bQue; TQueTPosition::VECOUT, 1 yQue; TBufTPosition::VECCALC meanBuf, varBuf; uint32_t hwAlign (sizeof(T) * h * w ONE_BLK_SIZE - 1) / ONE_BLK_SIZE * ONE_BLK_SIZE / sizeof(T); pipe.InitBuffer(xQue, 1, sizeof(T) * n * c * hwAlign); pipe.InitBuffer(gQue, 1, (sizeof(T) * c 31) / 32 * 32); pipe.InitBuffer(bQue, 1, (sizeof(T) * c 31) / 32 * 32); pipe.InitBuffer(yQue, 1, sizeof(T) * n * c * hwAlign); pipe.InitBuffer(meanBuf, (sizeof(T) * n * g 31) / 32 * 32); pipe.InitBuffer(varBuf, (sizeof(T) * n * g 31) / 32 * 32); LocalTensorT xLocal xQue.AllocTensorT(); LocalTensorT gLocal gQue.AllocTensorT(); LocalTensorT bLocal bQue.AllocTensorT(); LocalTensorT yLocal yQue.AllocTensorT(); LocalTensorT meanLocal meanBuf.GetT(); LocalTensorT varLocal varBuf.GetT(); DataCopyParams copyX{static_castuint16_t(n * c), static_castuint16_t(h * w * sizeof(T)), 0, 0}; DataCopyPadParams padX{true, 0, static_castuint8_t(hwAlign - h * w), 0}; DataCopyPad(xLocal, xGlobal, copyX, padX); DataCopyParams copyG{1, static_castuint16_t(c * sizeof(T)), 0, 0}; DataCopyPadParams padG{false, 0, 0, 0}; DataCopyPad(gLocal, gGlobal, copyG, padG); DataCopyPad(bLocal, bGlobal, copyG, padG); PipeBarrierPIPE_ALL(); uint32_t stackSize 0; { LocalTensorfloat stack; PopStackBufferfloat, TPosition::LCM(stack); stackSize stack.GetSize(); } GroupNormTiling tiling; uint32_t shape[4] {n, c, h, w}; ShapeInfo shapeInfo{(uint8_t)4, shape, (uint8_t)4, shape, DataFormat::ND}; GetGroupNormNDTillingInfo(shapeInfo, stackSize, sizeof(T), false, g, tiling); GroupNormT(yLocal, meanLocal, varLocal, xLocal, gLocal, bLocal, epsilon, tiling); PipeBarrierPIPE_ALL(); DataCopyPad(yGlobal, yLocal, copyX); xQue.FreeTensor(xLocal); gQue.FreeTensor(gLocal); bQue.FreeTensor(bLocal); yQue.FreeTensor(yLocal); }逐段走读用 TPipe 申请输入/输出队列和均值、方差缓冲注意给 inputX 分配空间时H×W 要按块大小对齐补 pad。DataCopyPad 把 x、gamma、beta 拷进 VECIN 队列行末补齐量就是 pad 到 hwAlign 的差。PopStackBuffer 查栈空间大小再用 GetGroupNormNDTillingInfo 按 shape、栈大小、groupNum 生成 tiling。GroupNorm 一次完成标准化加仿射均值、方差结果写进你传入的两个缓冲。结果拷回 GM、释放 tensorPipeBarrier 分段隔离各阶段。七、相关文档GroupNorm Tiling 文档算 sharedTmpBuffer 大小、填 tiling 信息的方法。LocalTensor 文档VECIN/VECCALC/VECOUT 三种 tensor 位置与队列、缓冲的用法。通用说明和约束地址对齐、数据格式等通用约束。【免费下载链接】BabelDOCYet Another Document Translator项目地址: https://gitcode.com/GitHub_Trending/ba/BabelDOC创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表