论文:表示层损失无法修复Transformer秩崩塌
热点事件持续更新
论文:表示层损失无法修复Transformer秩崩塌
1 篇报道1 个报道来源3 小时前更新
先了解这件事
AI 综述
Martin Hofmann 与 Patrick Mäder 提交论文,研究深度诱导的 Transformer 秩崩塌能否通过加损失项修复。他们把小型 Transformer 的 skip connection 削弱,使网络陷入秩崩塌:所有 token 表征指向同一方向,学习停止。 作者称,加入任何损失项都未能修复这种崩塌;其中较强的一类损失项施加的推力约为任务梯度的十分之一。
AI 根据报道生成 · 1 小时前更新
最新进展10月8日 12:00
Transformer 训练中的深度诱导秩崩溃:表征上的损失项无法修复报道时间线
沿着报道,了解事件的不同侧面。
10月8日
- arXiv:cs.LGTransformer 训练中的深度诱导秩崩溃:表征上的损失项无法修复
研究发现,削弱 skip connection 会让小型 Transformer 陷入秩崩溃——所有 token 表征指向同一方向,学习停止,且添加任何损失项都无法修复。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。