论文定位灾难性遗忘并提出优化器干预
热点事件持续更新
论文定位灾难性遗忘并提出优化器干预
1 篇报道1 个报道来源2 小时前更新
先了解这件事
AI 综述
一项 arXiv 论文系统冻结参数分析大语言模型持续预训练,发现灾难性遗忘集中在输出嵌入中那些在新语料里罕见 token 的行上,并称其由语料词表覆盖不足而非训练模式决定。 作者提出训练期干预:仅对输出投影提高 Adam epsilon,在 160M 至 12B 参数、四个模型家族的八个设置中消除 39.4% 至 67.9% 的遗忘,且不损害目标学习、无需逐模型调参。
AI 根据报道生成 · 1 小时前更新
最新进展10月8日 12:00
灾难性遗忘藏在数据未见 token 的输出嵌入中:一行 Adam epsilon 调整可消除最多 67.9% 遗忘报道时间线
沿着报道,了解事件的不同侧面。
10月8日
- arXiv:cs.CL灾难性遗忘藏在数据未见 token 的输出嵌入中:一行 Adam epsilon 调整可消除最多 67.9% 遗忘
研究系统冻结参数分析 LLM 持续预训练中的灾难性遗忘,发现遗忘集中在新语料中罕见 token 的输出嵌入上,且由语料的词表覆盖不足而非训练模式决定。为此提出仅对输出投影提高 Adam epsilon 的训练期干预,在 160M 至 12B 参数、四个模型家族的八个设置中消除 39.4% 至 67.9% 的遗忘,且不损害目标学习、无需逐模型调参。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。