研究者提出约束命令条件PPO与Bandit策略选择方法
热点事件持续更新
研究者提出约束命令条件PPO与Bandit策略选择方法
1 篇报道1 个报道来源2 小时前更新
先了解这件事
AI 综述
研究者 Nick Leenders 等人发表论文,提出一种用于 MicroRTS 实时策略环境的约束命令条件 PPO(近端策略优化)执行器:离散命令指定经济、军队组成、军事姿态与工人策略等战略目标,执行器负责生成单元级动作。 研究同时采用 Thompson 采样 Bandit 作为策略家,依据游戏内观测估计对手策略,并选择命令元组。上述内容出自论文摘要,为作者自述的方法设计。
AI 根据报道生成 · 2 小时前更新
最新进展10月9日 12:00
基于约束命令条件强化学习与 Bandit 策略选择的实时策略游戏智能体报道时间线
沿着报道,了解事件的不同侧面。
10月9日
- arXiv:cs.AI基于约束命令条件强化学习与 Bandit 策略选择的实时策略游戏智能体
研究者提出一种约束命令条件 PPO 执行器,用于 MicroRTS 环境:离散命令指定经济、军队组成、军事姿态与工人策略等战略目标,执行器负责生成单元级动作,Thompson 采样 bandit 作为策略家依据游戏内观测估计对手策略并选择命令元组。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。