跳到正文
热点事件持续更新

研究提出用Armijo回溯探测曲率限制Adam学习率

1 篇报道1 个报道来源4 小时前更新

先了解这件事

AI 综述

一项发表于《机器学习研究汇刊》(2026年10月)的研究提出,用Armijo回溯线搜索中接受的步长α估计方向曲率,作为Adam的学习率保护机制,无需运行Lanczos或Hessian-向量乘积。作者Ashmitha R与Jörg Frochte称,其学习率上限设为观测到的最小步长的两倍,在CIFAR-10、Fashion-MNIST和Imagenette上log α与最大Hessian特征值λ₁的Pearson相关性为-0.91至-0.95。 作者称该协议参数未针对任何特定架构微调,因而免校准;在研究所覆盖的学习率范围(10⁻³至3.0)及GPT-2预训练实验中,所有启用上限的运行均未发散。该机制的目标是避免发散,而非提升准确率;在一般架构分析中,仍有一个MLP架构对初始批次顺序敏感。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月8日
  1. arXiv:cs.LG
    基于 Armijo 回溯的方向曲率:一种低成本锐度探测与 Adam 免校准学习率保护机制

    研究者提出用 Armijo 回溯线搜索中接受的步长 α 来估计方向曲率,无需运行 Lanczos 或 Hessian-向量乘积。在 CIFAR-10、Fashion-MNIST 和 Imagenette 上,log α 与最大 Hessian 特征值 λ₁ 的 Pearson 相关性达 -0.91 至 -0.95。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。