跳到正文
原文
arXiv:cs.LG(机器学习,全量分类)· Ali Abbasi, Justin Shi, Soheil Kolouri·· 1 天前AI 评分38

BASE:基于预测移除误差的批感知专家选择,加速 MoE 解码

BASE: Batch-Aware Selection of Experts Using Predicted Removal Error for Efficient MoE Decoding

AI 导读

针对 MoE 模型批量解码时专家权重传输开销大的问题,研究者提出 BASE,按“移除某专家对 MoE 层输出的影响”对专家排序,并在校准阶段训练轻量线性预测器估计每个 token 的专家移除代价,配合定制 GPU kernel 完成代价预测与专家选择。

来源:arXiv:cs.LG(机器学习,全量分类) · arxiv.org