多语言模型持续预训练中的知识保持研究
热点事件持续更新
多语言模型持续预训练中的知识保持研究
1 篇报道1 个报道来源3 小时前更新
先了解这件事
AI 综述
arXiv 2026年10月5日的一篇论文研究了多语言模型在持续预训练中的灾难性遗忘问题。作者 Sanchit Ahuja 和 Terra Blevins 通过插值 gemma-3-4b 在持续预训练前后的模型状态,在五个语系上定位遗忘:中层回退对阅读理解恢复效果最大,翻译效果则因语系和方向而异。 基于此,作者评估了层冻结、层范围 L2 正则、事后层回退与 model souping 四种策略。层冻结平均超过基座模型表现,但翻译结果不一;密集训练或事后回退常优于训练时约束。作者提出以插值定位作为诊断手段,在投入训练干预前识别候选层。
AI 根据报道生成 · 2 小时前更新
最新进展10月5日 12:00
多语言模型适配中如何不遗忘:gemma-3-4b 层插值定位与知识保留策略分析报道时间线
沿着报道,了解事件的不同侧面。
10月5日
- arXiv:cs.CL多语言模型适配中如何不遗忘:gemma-3-4b 层插值定位与知识保留策略分析
研究通过插值 gemma-3-4b 在持续预训练前后的模型状态,在五个语系上定位灾难性遗忘:中层回退对阅读理解恢复效果最大,翻译效果则因语系和方向而异。基于此评估层冻结、层范围 L2 正则、事后层回退与 model souping 四种策略,层冻结平均超过基座模型表现,但翻译结果不一,密集训练或事后回退常优于训练时约束。作者提出以插值定位作为诊断手段,在投入训练干预前识别候选层。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。