跳到正文
热点事件持续更新

研究者提出HARPO强化学习框架

1 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

研究者提出HARPO强化学习框架,通过幻觉感知生成奖励模型(HA-GRM)与选择性激活机制(SAM)联合优化语言生成的忠实性与创造性。 基于Qwen3-4B的HA-GRM在RAGTruth上取得78.08%的响应级F1,高于监督微调基线的66.37%。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月5日
  1. arXiv:cs.CL
    HARPO:面向忠实且富有创造性的语言生成的幻觉感知强化学习框架

    研究者提出 HARPO 强化学习框架,通过幻觉感知生成奖励模型(HA-GRM)与选择性激活机制(SAM)联合优化语言生成的忠实性与创造性。基于 Qwen3-4B 的 HA-GRM 在 RAGTruth 上取得 78.08% 的响应级 F1,高于监督微调基线的 66.37%。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。