跳到正文
热点事件持续更新

ArrivalBench:重放执行评测Agent数据管道

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

Pranay Kothari 发布论文提出评测基准 ArrivalBench,用于检验 Agent 生成的数据管道。该基准不再用固定快照单次运行打分,而是在延迟、重复、乱序和重试等可重放的对抗性投递调度下重新执行管道,并要求最终状态等于对完整日志的批量重算。 在作者构建的 40 项任务上,其复现的单次执行评分认定 11 个模型生成的管道中 86%–100% 合格;对同一产物重新执行后发现,这些被认定合格的管道中有 7.0%–79.2% 存在静默错误。作者称,11 组结果均经独立重跑,比率变动不超过 5.9 个百分点。 该论文被 NeurIPS 2026 研讨会“Who Verifies the Agents?”接收为海报展示。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月5日
  1. arXiv:cs.LG
    ArrivalBench:Agent 生成的数据管道单次验证正确、随时间推移出错

    作者提出 ArrivalBench 基准,不再用固定快照单次运行给 Agent 生成的数据管道打分,而是在延迟、重复、乱序和重试等可重放的对抗性投递调度下重新执行管道,并要求最终状态等于对完整日志的批量重算。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。