LatentGRM 潜空间奖励建模论文发布
热点事件持续更新
LatentGRM 潜空间奖励建模论文发布
1 篇报道1 个报道来源2 小时前更新
先了解这件事
AI 综述
Mingqing Yuan 等人发布论文,提出生成式奖励建模框架 LatentGRM:基于语义分块、压缩与重建,由评分标准引导压缩,学习支持自主成对判断的紧凑连续轨迹,不生成文本即可完成评估。据报道,在相同训练数据和骨干下,LatentGRM 在 4B 和 8B 规模上的偏好准确率与显式 SFT 评判模型相当;LatentGRM-8B 在四个基准领域将评估轨迹压缩 8.9–9.2 倍,vote@5 下评判推理总时间减少 6.1–7.0 倍。
AI 根据报道生成 · 1 小时前更新
最新进展10月8日 12:00
LatentGRM:通过语义保持压缩实现高效生成式奖励建模报道时间线
沿着报道,了解事件的不同侧面。
10月8日
- arXiv:cs.CLLatentGRM:通过语义保持压缩实现高效生成式奖励建模
LatentGRM 是一种基于语义分块、压缩与重建的隐空间评估框架,利用评分标准引导压缩,学习支持自主成对判断的紧凑连续轨迹,无需生成文本评估。在相同训练数据和骨干下,LatentGRM 在 4B 和 8B 规模上的偏好准确率与显式 SFT 评判模型相当;LatentGRM-8B 在四个基准领域将评估轨迹压缩 8.9–9.2 倍,vote@5 下评判推理总时间减少 6.1–7.0 倍。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。