VLLR稠密奖励框架提升长时程机器人任务成功率
热点事件持续更新
VLLR稠密奖励框架提升长时程机器人任务成功率
1 篇报道1 个报道来源3 小时前更新
先了解这件事
AI 综述
Silong Yong等作者提出VLLR稠密奖励框架,将LLM/VLM提供的外部任务进度奖励与基于策略自确定性的内在奖励结合,无需人工设计奖励即可微调机器人基础策略。作者称,在CHORES基准上,VLLR相比预训练策略成功率最高提升56%;在分布内任务上超越当时最优RL微调方法最高5%,分布外任务最高提升10%。该工作已被IROS 2026接收,但目前仅为论文报告结果。
AI 根据报道生成 · 1 小时前更新
最新进展10月7日 12:00
VLLR:面向长时程机器人任务的通用密集奖励框架报道时间线
沿着报道,了解事件的不同侧面。
10月7日
- arXiv:cs.LGVLLR:面向长时程机器人任务的通用密集奖励框架
VLLR 是一种结合 LLM/VLM 外部奖励与策略自确定性内在奖励的密集奖励框架,无需人工设计奖励即可微调机器人基础策略。在 CHORES 基准上,VLLR 相比预训练策略成功率最高提升 56%,在分布内任务上超越 SOTA RL 微调方法最高 5%,分布外任务最高提升 10%。该工作已被 IROS 2026 接收。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。