专家耦合方法降低MoE预训练通信开销
热点事件持续更新
专家耦合方法降低MoE预训练通信开销
1 篇报道1 个报道来源2 小时前更新
先了解这件事
AI 综述
MoE预训练中路由器在早期就会把token分配给相关专家:在top-2路由下,每层0.8%的专家对会被42%的token同时选中。Radha Gulhane、Quentin Anthony和Beren Millidge据此提出"专家耦合"方法,通过将常被同时选中的专家放在同一GPU(相关专家放置),以及在序列并行将token切分到EP组时重排token,使更多token-专家分配留在token所在GPU上,从而减少跨GPU和跨节点通信。 作者称,在Megatron-LM、EP规模8至64、top-2与top-6路由下,两种方法使all-to-all时间降低1.16-2.63倍,端到端步时最多降低1.41倍,且不改变模型的路由决策或专家参数。
AI 根据报道生成 · 1 小时前更新
最新进展10月8日 12:00
MoE 预训练中的专家耦合:用相关性放置与 token 重排降低 All-to-All 开销报道时间线
沿着报道,了解事件的不同侧面。
10月8日
- arXiv:cs.CLMoE 预训练中的专家耦合:用相关性放置与 token 重排降低 All-to-All 开销
MoE 预训练中路由器早期就学会将 token 分配给相关专家,研究发现 top-2 下每层 0.8% 的专家对会被 42% 的 token 同时选中。作者据此提出相关专家放置和 token 重排两种方法,在 Megatron-LM 中将 all-to-all 时间降低 1.16-2.63X,端到端步时最多降低 1.41X,且不改变路由决策或专家参数。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。