跳到正文
热点事件持续更新

MaskCoFT:掩码协同微调提升MoE推理内存效率

1 篇报道1 个报道来源4 小时前更新

先了解这件事

AI 综述

Junfeng Wu等作者提出MaskCoFT,一种面向MoE模型推理内存效率的掩码协同自适应微调方法。该方法仅用交叉熵损失同时训练路由器与专家,微调时用可学习二值掩码将每层Top-K路由限制到部分专家。 推理时该掩码作为软先验对专家重排序,所有专家仍可被选中,因此不改变模型可用的专家范围。该论文发布于arXiv的cs.LG分类。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月5日
  1. arXiv:cs.LG
    MaskCoFT:面向内存高效 MoE 推理的掩码协同自适应微调

    MaskCoFT 是一种掩码协同自适应微调方法,仅用交叉熵损失同时训练路由器与专家,微调时用可学习二值掩码将每层 Top-K 路由限制到部分专家,推理时该掩码作为软先验对专家重排序,所有专家仍可被选中。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。