跳到正文
原文
arXiv:cs.CL(计算语言学,全量分类)· Xunjian Yin, Tianchen Guan, Jinao Wang, Weili Cao, Daisy Xinlei Lin, Royce Cheng-Yue, Keagan Long, Kyle Wong, Bhuwan Dhingra, Xiangjun Wang, Shuyan Zhou·· 1 天前AI 评分48

BreakingWeb:通过受控环境干预构建高难度浏览器使用任务

Constructing Challenging Browser-Use Tasks by Controlled Environment Interventions

AI 导读

研究者提出 BreakingWeb 基准,通过受控环境干预将智能体已能完成的任务改造为高难度实例,包含 519 个干净/干预任务对,覆盖 7 个自托管网站和 29 类干预。干预使六款浏览器使用智能体的通过率平均下降 22.9%,并推翻近半数原本能干净解决的任务;人类首次尝试仅损失 10.0%。六款智能体 75% 的失败属于"信念失败",即在所需变更未发生时仍宣称成功。

来源:arXiv:cs.CL(计算语言学,全量分类) · arxiv.org