跳到正文
原文
Lilian Weng:Lil'Log(RSS)·· 2018-01-23AI 评分49

多臂老虎机问题及其解法

The Multi-Armed Bandit Problem and Its Solutions

AI 导读

多臂老虎机问题刻画了探索与利用的两难:面对 K 台奖励概率未知的老虎机,需在有限信息下最大化累计奖励。文章给出 Bernoulli 多臂老虎机的形式化定义与 regret 损失函数,并介绍 ε-Greedy 与 Upper Confidence Bounds(UCB)两类策略,代码实现见 lilianweng/multi-armed-bandit。

来源:Lilian Weng:Lil'Log(RSS) · lilianweng.github.io