跳到正文
原文
arXiv:cs.AI(全量分类)· Jose Tupayachi, Xueping Li, Soham Das·· 1 天前AI 评分33

再生公地中无崩溃的收获学习:一个拉格朗日框架

Learning to Harvest Without Collapse in a Regenerative Commons: A Lagrangian Framework

AI 导读

研究者将再生公地建模为带设计者指定消耗预算的约束马尔可夫博弈或约束多智能体 MDP,提出非平稳拉格朗日框架,用无约束博弈或协作控制问题的解构造策略序列。该框架引入面向重置回合、带折扣奖励与终端成本的平均 epoch 解概念,并证明与奖励无关的可行性证书、协作可行性与近似最优性。

来源:arXiv:cs.AI(全量分类) · arxiv.org