域随机化如何实现 Sim2Real 迁移
域随机化(DR)通过在仿真器中随机化视觉外观与物理动力学参数,让策略在多样化环境中训练后直接迁移到真实机器人。相比需要真实数据的域适应,DR 几乎不需要真实样本;OpenAI 用该方法让灵巧手完成连续旋转物体的任务。DR 可被理解为一种双层优化,即学习随机化参数的分布以最大化真实环境表现。
域随机化(DR)通过在仿真器中随机化视觉外观与物理动力学参数,让策略在多样化环境中训练后直接迁移到真实机器人。相比需要真实数据的域适应,DR 几乎不需要真实样本;OpenAI 用该方法让灵巧手完成连续旋转物体的任务。DR 可被理解为一种双层优化,即学习随机化参数的分布以最大化真实环境表现。
OpenAI 发布新成果,用自研的通用强化学习算法 PPO 训练 5 个 Dota 智能体击败半职业选手,且对战两周前的旧智能体胜率达 90-95%。训练未使用人类对局数据,算法通过自我对弈学会玩法;Sam Altman 认为这表明深度强化学习在算力充足且模拟环境足够好时可解决极难问题,未来可迁移到更接近真实环境的问题。
这篇教程用 TensorFlow 和 OpenAI Gym 动手实现深度强化学习模型,完整代码见 lilian/deep-reinforcement-learning-gym。
Sam Altman 在其博文中提出,人类与机器的融合已经开始数年,且将是一个渐进过程而非单一时刻。他认为手机、社交媒体和搜索引擎背后的算法已在塑造人类行为,而超级智能 AI、基因增强和脑机接口终将实现。他主张融合是最好结果,人类应认真对待全球协调,并称自己曾难以抵抗算法的注意力劫持。