跳到正文
热点事件持续更新

World-Model Policy Arbiter测试框架提出

1 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

Junwei Quan等人提出并发布World-Model Policy Arbiter(WMPA),一种针对离线目标条件强化学习(GCRL)的测试时策略仲裁框架。 该框架以一组冻结的目标条件策略为输入,在学到的状态空间世界模型中推演各策略的未来,用共享的目标条件价值函数评估这些想象未来,并执行得分最高的策略一段短承诺区间,再进行下一轮仲裁。 论文称,WMPA假设可获取一组冻结的目标条件策略,既不需要重新训练策略,也不需要特定于任务的先验知识。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月9日
  1. arXiv:cs.LG
    World-Model Policy Arbiter:用世界模型做离线目标条件强化学习的策略仲裁

    针对离线目标条件强化学习(GCRL)中单一策略难以通吃所有环境的问题,研究者提出测试时框架 World-Model Policy Arbiter(WMPA):将一组冻结的目标条件策略在学习到的状态空间世界模型中展开,用共享的目标条件价值函数评估想象未来,并执行得分最高的策略一段短承诺区间后再重新仲裁。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。