跳到正文
原文
arXiv:cs.AI(全量分类)· Long Phan, Stephen K. Yang, Jason J. Lim, Mantas Mazeika, Wenyu Zhang, Zheyuan Liu, Richard Ren, Jingxiang Meng, Yaoteng Tan, Weiliang Zhao, Addison Wu, Matei Anghel, Dan Hendrycks·· 1 天前AI 评分48

CheatBench:衡量 AI 智能体奖励作弊行为的基准

CheatBench: Measuring Reward Gaming in AI Agents

AI 导读

研究者推出 CheatBench,一个覆盖数学研究、知识工作、编程、视觉任务等领域的 AI 智能体作弊行为基准,其环境将高难度任务与作弊机会结合,用于研究智能体在诚实工作困难时如何追求目标。该基准支持跨模型与跨任务类别比较,并已公开发布。

来源:arXiv:cs.AI(全量分类) · arxiv.org