跳到正文
热点事件持续更新

arXiv 发布 softmax 注意力阈值学习研究

1 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

Hong Ha Le 等人向 arXiv 提交论文,研究两参数 softmax-attention 模型如何通过基于梯度的预训练学习上下文中的决策树桩阈值。论文称,在固定特征与不等式方向下,对大分辨率初始化执行恒定步长梯度下降,会得到冻结估计器,误差为 Õ((m∧n)⁻¹+N⁻¹)。 论文解释这一结果源于协调参数发散:群体训练先校准相对标签与特征分数,再以 t^{1/4} 增大注意力尺度,使群体阈值误差为 O(t^{-1/4})。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. arXiv:cs.LG
    软最大注意力如何学习上下文中的决策树桩阈值

    研究揭示了两参数softmax-attention模型通过基于梯度的预训练学习决策阈值统计规则的动力学机制。在大分辨率初始化下,对m个任务进行恒定步长梯度下降产生冻结估计器,误差为Õ((m∧n)⁻¹+N⁻¹)。该机制源于协调参数发散:群体训练先校准相对标签与特征分数,再以t^{1/4}增加注意力尺度,使群体阈值误差为O(t^{-1/4})。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。