跳到正文
热点事件持续更新

GraphOPD:图增强在线策略蒸馏方法

1 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

Bohan Lin 等作者提交的论文提出 GraphOPD,称这是首个将图结构增强引入 LLM 智能体同策略蒸馏的方法。它用环境自身状态变化记录构建步骤依赖图,以随机游走平稳分布为每步打分,再与教师-学生差异信号融合成轨迹相对掩码。 在 ALFWorld、WebShop、SearchQA 上跨三种模型规模、对比十一个基线,该方法最高较最强基线提升 +5.8 pp;论文称执行回放审计显示其结构信用分显著高于随机。上述提升与审计结论均出自该论文。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月8日
  1. arXiv:cs.LG
    GraphOPD:面向 LLM 智能体的图增强同策略蒸馏

    GraphOPD 是首个将图结构增强引入 LLM 智能体同策略蒸馏的方法,通过环境自身状态变化记录构建步骤依赖图,并用随机游走平稳分布为每步打分,再与教师-学生差异信号融合成轨迹相对掩码。在 ALFWorld、WebShop、SearchQA 上跨三种模型规模、对比十一个基线,最高较最强基线提升 +5.8 pp,执行回放审计验证其结构信用分显著高于随机地追踪真实因果影响。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。