跳到正文

#OpenAI

今日 73 条
5月5日周日
  1. Lilian Weng:Lil'Log(RSS)38

    域随机化如何实现 Sim2Real 迁移

    域随机化(DR)通过在仿真器中随机化视觉外观与物理动力学参数,让策略在多样化环境中训练后直接迁移到真实机器人。相比需要真实数据的域适应,DR 几乎不需要真实样本;OpenAI 用该方法让灵巧手完成连续旋转物体的任务。DR 可被理解为一种双层优化,即学习随机化参数的分布以最大化真实环境表现。

6月26日周二
  1. Sam Altman:Blog(RSS)75

    Sam Altman 谈 OpenAI 强化学习进展:5 个智能体击败 Dota 半职业选手

    OpenAI 发布新成果,用自研的通用强化学习算法 PPO 训练 5 个 Dota 智能体击败半职业选手,且对战两周前的旧智能体胜率达 90-95%。训练未使用人类对局数据,算法通过自我对弈学会玩法;Sam Altman 认为这表明深度强化学习在算力充足且模拟环境足够好时可解决极难问题,未来可迁移到更接近真实环境的问题。

5月5日周六
12月8日周五
  1. Sam Altman:Blog(RSS)37

    Sam Altman:人类与机器的融合已经开始

    Sam Altman 在其博文中提出,人类与机器的融合已经开始数年,且将是一个渐进过程而非单一时刻。他认为手机、社交媒体和搜索引擎背后的算法已在塑造人类行为,而超级智能 AI、基因增强和脑机接口终将实现。他主张融合是最好结果,人类应认真对待全球协调,并称自己曾难以抵抗算法的注意力劫持。