ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

如何循环 MoE:压平专家,解开注意力

如何循环 MoE:压平专家,解开注意力 从今天觉醒,技术赋予每一个人数字生命如何循环 MoE压平专家解开注意力① 技术背景过去两年大模型架构的演进基本沿着两条独立路线展开。一条是循环 TransformerLooped Transformer把同一组层反复用几遍用额外算力把固定尺寸的模型榨得更充分让参数被复用得更彻底。另一条是稀疏混合专家MoE每个 token 只激活众多专家中的少数几个从而在总参数量膨胀的同时控制单 token 计算量。两条路线其实在回答同一个问题——如何更划算地花算力。循环是时间维度上的复用MoE 是参数维度上的稀疏。把它们合起来直觉上很诱人循环 MoE 应该能同时吃到两份红利。但真正动起手来问题立刻冒出来——MoE 到底该怎么循环是把整个 MoE 块原封不动循环几遍还是把专家拆开注意力要不要跟着一起循环这篇论文给出的答案叫Foil核心就两个动作压平专家flatten the experts和解开注意力untie the attention。下面我们顺着要回答什么问题 → 怎么设计 → 为什么有效的链路把关键抽象拆开看。② 主流方案盘点方案一标准循环 Transformer。代表工作是 Universal Transformer 一脉。职责很清晰——把一层或一个块重复 N 次每一遍共享同一套权重。优点是参数零增长就能加深有效深度缺点是循环次数一多梯度传播和表达多样性都会受限。方案二标准稀疏 MoE。代表如近年的 DeepSeek、Qwen 系列 MoE 变体。职责是让每层有大量专家、每 token 只路由到 top-k 个。核心抽象是路由器router和专家池expert pool。优点是总参数大、激活参数小缺点是路由容易塌缩到少数专家负载不均。方案三朴素循环 MoEbaseline。把整个 MoE 块循环几遍专家和路由器全共享。这是最省事的做法也是论文要对比的基线。问题是每一遍的路由决策都从同一个专家池里选循环带来的额外计算并没有扩大可选范围。方案四Foil。在固定专家参数总量和固定单 token 专家计算量的前提下做两件事把专家层数减半、每层专家数翻倍、循环遍数翻倍让每次路由从更大的池子里选同时解开注意力每一遍有独立的注意力参数而专家和路由器仍然共享。③ 对比与优劣维度标准循环 Transformer标准稀疏 MoE朴素循环 MoEFoil参数复用方式全块共享不循环全块共享专家/路由共享注意力独立单 token 专家计算无固定固定固定路由可选池无每层固定每遍相同池每遍更大池注意力多样性低单遍低高每遍独立主要风险表达塌缩负载不均循环收益递减实现复杂度上升论文实验里20B token 时每个 Foil 模型的预训练 loss 都低于未压平的循环基线到 100B tokenloss 随压平程度单调改善压得最狠的 Foil 在等参数等算力下比基线低 0.012 nat下游准确率持平或更好。解开注意力还带来了更均衡、更自信的路由。④ 选型建议场景一算力紧张、想压榨小模型。优先考虑循环结构但别急着上 Foil——先把循环 Transformer 跑通确认循环确实带来收益再考虑引入 MoE。场景二已有 MoE 想提效。Foil 的压平思路值得试把专家层减半、每层专家翻倍、循环翻倍。关键约束是保持专家参数和单 token 专家计算不变否则对比就不公平。场景三研究路由行为。解开注意力是低成本高回报的改动。论文指出路由置信度比负载均衡更能反映专家是否被健康使用——如果你在调路由别只盯 load balance 指标。面试/作业常被追问的点为什么压平能提升路由因为可选池变大路由决策的信息量更高为什么注意力要解开因为循环时若注意力也共享每一遍看到的表示几乎一样循环就退化成重复计算。⑤ 未来展望Foil 给出的设计指引很明确稀疏循环 MoE 应该用更多专家、更多遍数。循环的收益和加宽专家层的收益会相互放大而不是简单叠加。但仍有未解问题压平到什么程度会触顶路由置信度作为健康指标是否在所有规模都成立注意力解开后参数量上升如何在更大模型上控制成本代码和配置已开源这些问题正等着被更多人验证。对在校学生和转行者来说这是一个很好的可写进作品集的小课题——复现 Foil 的压平策略对比路由指标成本不高却能完整体验提出假设 → 控制变量 → 验证的研究闭环。
返回列表