跳到正文
原文
arXiv:cs.AI(全量分类)· Zergham Ahmed, Joshua B. Tenenbaum, Chris Bates, Samuel J. Gershman·· 3 小时前AI 评分44

Code to Control:合成参数化反应式控制器

Code to Control: Synthesizing Parameterized Reactive Controllers

AI 导读

Code to Control 让 LLM 合成 Python 控制器结构、再用无导数搜索拟合参数,生成的控制器在决策时无需 LLM 推理或规划,动作选择比 PPO 策略更快。在 Atari、Flappy Bird 和 MuJoCo 任务上,它优于基于规划的程序合成方法,与深度强化学习相当但环境交互更少,并能跨环境动态变化迁移、扩展到复杂运动任务。

来源:arXiv:cs.AI(全量分类) · arxiv.org