跳到正文
热点事件持续更新

论文定位灾难性遗忘并提出优化器干预

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

一项 arXiv 论文系统冻结参数分析大语言模型持续预训练,发现灾难性遗忘集中在输出嵌入中那些在新语料里罕见 token 的行上,并称其由语料词表覆盖不足而非训练模式决定。 作者提出训练期干预:仅对输出投影提高 Adam epsilon,在 160M 至 12B 参数、四个模型家族的八个设置中消除 39.4% 至 67.9% 的遗忘,且不损害目标学习、无需逐模型调参。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月8日
  1. arXiv:cs.CL
    灾难性遗忘藏在数据未见 token 的输出嵌入中:一行 Adam epsilon 调整可消除最多 67.9% 遗忘

    研究系统冻结参数分析 LLM 持续预训练中的灾难性遗忘,发现遗忘集中在新语料中罕见 token 的输出嵌入上,且由语料的词表覆盖不足而非训练模式决定。为此提出仅对输出投影提高 Adam epsilon 的训练期干预,在 160M 至 12B 参数、四个模型家族的八个设置中消除 39.4% 至 67.9% 的遗忘,且不损害目标学习、无需逐模型调参。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。