跳到正文
热点事件持续更新

论文:MoE在重复数据下比稠密模型更易过拟合

1 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

arXiv 上一项由 Atindra Jha 等作者发布的研究发现,在 80M 至 1B 激活参数(8.5B 总参数)规模下,Mixture-of-Experts(MoE)模型在数据重复训练时退化速度快于稠密模型,稀疏度越高越严重:80M 稠密模型可重复数据超 8 次而几乎无退化,MoE 在 4 次时即开始受损,32 次后性能低于稠密模型。 研究称 dropout 等方法可缓解过拟合,其中强掩码正则化能让 MoE 在数据重复超 64 次时仍优于稠密模型;但没有任何方法能完全媲美全唯一数据训练的效果。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月8日
  1. arXiv:cs.CL
    MoE 模型对重复数据比稠密模型更易过拟合

    研究发现,在 80M 至 1B 激活参数(8.5B 总参数)规模下,Mixture-of-Experts(MoE)模型在数据重复训练时退化速度快于稠密模型,且稀疏度越高越严重。80M 稠密模型可重复数据超 8x 而几乎无退化,MoE 在 4x 时即开始受损,32x 后性能低于稠密模型。强掩码正则化可使 MoE 在数据重复超 64 次时仍优于稠密模型,但无任何方法能完全媲美全唯一数据训练。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。