Phase-HDC:免优化器状态的离散相位训练法
热点事件持续更新
Phase-HDC:免优化器状态的离散相位训练法
1 篇报道1 个报道来源2 小时前更新
先了解这件事
AI 综述
Ahmed Nebli 提出 Phase-HDC,一种不存储优化器历史记录的训练方法:每次更新仅让存储角度沿当前梯度符号移动至多一步,且仅在梯度足够大时触发。 在其余条件固定时,其准确率与使用 6-bit 动量的 Adam 相当,但逻辑存储量少 3 倍;在 11 个图像、表格和文本数据集上,逻辑存储量比标准 float32 Adam 少 16–23 倍,比 8-bit Adam 少 4–6 倍。论文称节省的是逻辑状态而非实测硬件内存。 代价是相对 float32 Adam 平均损失约 5 个准确率点;不过在 11 个数据集中的 6 个上,它比 8-bit Adam 更准,包括 8-bit Adam 崩溃的字节级文本预测任务。
AI 根据报道生成 · 2 小时前更新
最新进展10月9日 12:00
Phase-HDC:用梯度阈值替代优化器历史记录做离散相位学习报道时间线
沿着报道,了解事件的不同侧面。
10月9日
- arXiv:cs.AIPhase-HDC:用梯度阈值替代优化器历史记录做离散相位学习
Phase-HDC 提出一种无需存储优化器历史记录的训练方法,每次更新仅让存储角度沿当前梯度符号移动至多一步,且仅当梯度足够大时才触发。在其余条件固定时,它的准确率与使用 6-bit 动量(moments)的 Adam 相当,但存储量少 3 倍;相较标准 float32 Adam 存储少 16–23 倍,相较 8-bit Adam 少 4–6 倍。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。