arXiv:cs.LG(机器学习,全量分类)· Xiaohui Tu, Yossiri Adulyasak, Erick Delage·· 1 天前AI 评分34
主次弱耦合马尔可夫决策过程中的公平策略优化
Fair Policy Optimization in Major-Minor Weakly Coupled Markov Decision Processes
AI 导读
研究针对主次弱耦合马尔可夫决策过程(M2WCMDP)中的公平资源分配问题,用单调、凹、置换不变、归一化的公平函数替代传统效用总和目标。在同质次子MDP下,该问题可化简为在置换不变策略类上优化平台加平均参与者的效用目标;更一般情形则提出基于计数比例的深度强化学习方法和优先采样器。在机器更换与纽约市定价及出租车调度两个应用中验证了方法的公平性与可扩展性。
来源:arXiv:cs.LG(机器学习,全量分类) · arxiv.org