跳到正文

#论文/研究

今日 180 条
2月26日周三
2月10日周一
1月7日周二
11月28日周四
8月21日周三
6月26日周二
  1. Sam Altman:Blog(RSS)75

    Sam Altman 谈 OpenAI 强化学习进展:5 个智能体击败 Dota 半职业选手

    OpenAI 发布新成果,用自研的通用强化学习算法 PPO 训练 5 个 Dota 智能体击败半职业选手,且对战两周前的旧智能体胜率达 90-95%。训练未使用人类对局数据,算法通过自我对弈学会玩法;Sam Altman 认为这表明深度强化学习在算力充足且模拟环境足够好时可解决极难问题,未来可迁移到更接近真实环境的问题。