跳到正文
热点事件持续更新

RoFB:推理时读出反馈提升循环模型

1 篇报道1 个报道来源4 小时前更新

先了解这件事

AI 综述

研究者提出 Readout Feedback(RoFB),一种无需重训练的测试时干预方法,将循环模型的中间预测转化为 token 级成对耦合力注入潜在动态,用于引导循环推理模型。 在 AKOrN、ItrSA++、TRM 三个循环模型上测试 Sudoku 和 Maze,RoFB 在六组模型-任务组合中的四组取得明显提升、一组小幅提升;四组正向结果达到仅靠增加步数或多轨迹采样无法实现的性能,计算成本相当或更低。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月5日
  1. arXiv:cs.LG
    用读出反馈在推理时引导循环推理模型

    研究者提出 Readout Feedback(RoFB),一种无需重训练的测试时干预方法,将循环模型的中间预测转化为 token 级成对耦合力注入潜在动态。在 AKOrN、ItrSA++、TRM 三个循环模型上测试 Sudoku 和 Maze,RoFB 在六组模型-任务组合中的四组取得明显提升、一组小幅提升,且四组正向结果达到仅靠增加步数或多轨迹采样无法实现的性能,计算成本相当或更低。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。