Sam Altman:Blog(RSS)· Sam Altman·· 2018-06-26AI 评分75
Sam Altman 谈 OpenAI 强化学习进展:5 个智能体击败 Dota 半职业选手
Reinforcement Learning Progress
AI 导读
OpenAI 发布新成果,用自研的通用强化学习算法 PPO 训练 5 个 Dota 智能体击败半职业选手,且对战两周前的旧智能体胜率达 90-95%。训练未使用人类对局数据,算法通过自我对弈学会玩法;Sam Altman 认为这表明深度强化学习在算力充足且模拟环境足够好时可解决极难问题,未来可迁移到更接近真实环境的问题。
来源:Sam Altman:Blog(RSS) · blog.samaltman.com