ArrivalBench:重放执行评测Agent数据管道
热点事件持续更新
ArrivalBench:重放执行评测Agent数据管道
1 篇报道1 个报道来源2 小时前更新
先了解这件事
AI 综述
Pranay Kothari 发布论文提出评测基准 ArrivalBench,用于检验 Agent 生成的数据管道。该基准不再用固定快照单次运行打分,而是在延迟、重复、乱序和重试等可重放的对抗性投递调度下重新执行管道,并要求最终状态等于对完整日志的批量重算。 在作者构建的 40 项任务上,其复现的单次执行评分认定 11 个模型生成的管道中 86%–100% 合格;对同一产物重新执行后发现,这些被认定合格的管道中有 7.0%–79.2% 存在静默错误。作者称,11 组结果均经独立重跑,比率变动不超过 5.9 个百分点。 该论文被 NeurIPS 2026 研讨会“Who Verifies the Agents?”接收为海报展示。
AI 根据报道生成 · 1 小时前更新
最新进展10月5日 12:00
ArrivalBench:Agent 生成的数据管道单次验证正确、随时间推移出错报道时间线
沿着报道,了解事件的不同侧面。
10月5日
- arXiv:cs.LGArrivalBench:Agent 生成的数据管道单次验证正确、随时间推移出错
作者提出 ArrivalBench 基准,不再用固定快照单次运行给 Agent 生成的数据管道打分,而是在延迟、重复、乱序和重试等可重放的对抗性投递调度下重新执行管道,并要求最终状态等于对完整日志的批量重算。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。