Berkeley RDI:Blog(AI 安全与评测)·· 12 小时前精选AI 评分74
Berkeley RDI:一个自动化 Agent 攻破了 8 个主流 AI Agent 基准
How We Broke Top AI Agent Benchmarks: And What Comes Next April 08, 2026
AI 导读
Berkeley RDI 用自动化扫描 Agent 审计 SWE-bench、WebArena、OSWorld、GAIA、Terminal-Bench、FieldWorkArena。
推荐理由
原文用可运行的漏洞利用说明主流 Agent 基准为何能被零能力刷分,并给出可复用的评测加固清单。
来源:Berkeley RDI:Blog(AI 安全与评测) · rdi.berkeley.edu