跳到正文
热点事件持续更新

SCOUT:离线多智能体强化学习框架

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

研究者 Dongsu Lee、Haoran Xu、Amy Zhang 提出 SCOUT,一个离线多智能体强化学习(MARL)框架,将生成式基础模型与学习到的价值函数通过测试时动作精炼结合。据其论文,这是首个采用该组合方式的离线 MARL 框架。 SCOUT 训练流匹配行为先验与分解价值函数两个解耦组件,测试时用 Stein 变分梯度下降将行为样本输运至高价值区域,输运步数可自适应调整以实现测试时扩展。 作者称,在离散与连续离线 MARL 基准上,SCOUT 取得最佳平均性能,并在所有离线到在线配置中均有提升。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月5日
  1. arXiv:cs.LG
    SCOUT:通过分解价值梯度流实现测试时多智能体协调

    研究者提出 SCOUT,首个将生成式基础模型与学习价值函数通过测试时动作精炼结合的离线多智能体强化学习框架。SCOUT 训练流匹配行为先验与分解价值函数两个解耦组件,测试时用 Stein 变分梯度下降将行为样本输运至高价值区域,输运步数实现自适应测试时扩展。在离散与连续离线 MARL 基准上,SCOUT 取得最佳平均性能,并在所有离线到在线配置中均有提升。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。