跳到正文
原文
arXiv:cs.AI(全量分类)· Yizhou Han, Di Wu, Dhananjay Saikumar, Blesson Varghese·· 3 小时前AI 评分50

AgBench:面向个人 AI 设备的智能体 AI 基准测试

AgBench: Agentic AI Benchmarks for Personal AI Devices

AI 导读

研究者发布 AgBench,一套用于在个人 AI 设备上可复现评估智能体 AI 的基准套件与开放工件,覆盖本地、混合与云端三种执行架构。基于超 1.6207 亿个数据点的结果显示,个人设备能在本地完成许多智能体任务,但纯本地执行的任务成功率通常低于纯云端,且并发升高时完成时间更长;纯本地执行可消除云端模型 API 成本与敏感信息暴露。

来源:arXiv:cs.AI(全量分类) · arxiv.org