arXiv:cs.AI(全量分类)· Long Phan, Stephen K. Yang, Jason J. Lim, Mantas Mazeika, Wenyu Zhang, Zheyuan Liu, Richard Ren, Jingxiang Meng, Yaoteng Tan, Weiliang Zhao, Addison Wu, Matei Anghel, Dan Hendrycks·· 1 天前AI 评分48
CheatBench:衡量 AI 智能体奖励作弊行为的基准
CheatBench: Measuring Reward Gaming in AI Agents
AI 导读
研究者推出 CheatBench,一个覆盖数学研究、知识工作、编程、视觉任务等领域的 AI 智能体作弊行为基准,其环境将高难度任务与作弊机会结合,用于研究智能体在诚实工作困难时如何追求目标。该基准支持跨模型与跨任务类别比较,并已公开发布。
来源:arXiv:cs.AI(全量分类) · arxiv.org