跳到正文
热点事件持续更新

研究:平坦极小值不必然带来泛化

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

arXiv 上的一项机器学习研究提出,用 SAM 偏置训练并不能可靠诱发 Grokking 中从记忆到泛化的转变,即便产生了更平坦的解;平坦性本身无法区分记忆解与泛化解。作者 Mohnish Harwani 称,用两层 ReLU 模型可从理论上证明这一点,而 weight decay 才偏好泛化解。 研究同时发现,SAM 与 weight decay 结合时,可将泛化转变在 epoch 级别加速最多 4 倍。该结论针对论文设定的 Grokking 实验与两层 ReLU 模型,其摘要称平坦损失景观与更好泛化的关联虽被长期讨论,但作为泛化因果机制的角色尚不明确。

AI 根据报道生成 · 54 分钟前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月9日
  1. arXiv:cs.LG
    平坦极小值能带来更好泛化吗?Grokking 中的算法分离

    研究用 SAM 偏置训练并不能可靠诱发 Grokking 中从记忆到泛化的转变,即便产生了更平坦的解。但 SAM 与 weight decay 结合时,可将泛化转变在 epoch 级别加速最多 4 倍。作者用两层 ReLU 模型从理论上证明,平坦性本身无法区分记忆解与泛化解,而 weight decay 偏好泛化解。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。