跳到正文
热点事件持续更新

研究者提出约束命令条件PPO与Bandit策略选择方法

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

研究者 Nick Leenders 等人发表论文,提出一种用于 MicroRTS 实时策略环境的约束命令条件 PPO(近端策略优化)执行器:离散命令指定经济、军队组成、军事姿态与工人策略等战略目标,执行器负责生成单元级动作。 研究同时采用 Thompson 采样 Bandit 作为策略家,依据游戏内观测估计对手策略,并选择命令元组。上述内容出自论文摘要,为作者自述的方法设计。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月9日
  1. arXiv:cs.AI
    基于约束命令条件强化学习与 Bandit 策略选择的实时策略游戏智能体

    研究者提出一种约束命令条件 PPO 执行器,用于 MicroRTS 环境:离散命令指定经济、军队组成、军事姿态与工人策略等战略目标,执行器负责生成单元级动作,Thompson 采样 bandit 作为策略家依据游戏内观测估计对手策略并选择命令元组。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。