跳到正文
热点事件持续更新

RoP框架为知识图谱问答学路径奖励

1 篇报道1 个报道来源5 小时前更新

先了解这件事

AI 综述

针对知识图谱问答中答案标签监督把所有通向答案的路径都视为正确、信号噪声大的问题,Shengxiang Gao、Chao Lei、Jey Han Lau、Linhao Luo、Jianzhong Qi 提出 RoP 框架,用非对称目标从答案标签学习轻量的、以问题为条件的路径奖励。 该奖励经蒸馏与 GRPO 在策略优化两阶段训练 LLM 关系路径生成器。研究团队报告称,在多个 KGQA 数据集上 F1 较答案标签方法至少提升 2.6%,且无需 LLM 精炼监督的高昂成本。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. arXiv:cs.AI
    Reward on Path:为知识图谱问答学习中间监督信号

    针对知识图谱问答中答案标签监督将所有通向答案的路径视为正确、信号噪声大的问题,研究者提出 RoP 框架,用非对称目标从答案标签学习轻量的、以问题为条件的路径奖励。该奖励经蒸馏与 GRPO 在策略优化两阶段训练 LLM 关系路径生成器,在多个 KGQA 数据集上 F1 较答案标签方法至少提升 2.6%,且无需 LLM 精炼监督的高昂成本。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。