跳到正文
热点事件持续更新

研究者发布PBT-Bench测试基准

1 篇报道1 个报道来源5 小时前更新

先了解这件事

AI 综述

Lucas Jing等作者发布PBT-Bench,用40个真实Python库中的100道基于属性的测试题评测AI智能体。每题注入语义bug共365个,平均3.65个/题;智能体需从文档推导语义不变量,写出Hypothesis @given策略以触发随机搜索。作者称公开发布基准、测试框架和完整评估语料,以支持基于文档的语义推理后续研究。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. arXiv:cs.AI
    PBT-Bench:面向 AI 智能体基于属性的测试基准

    研究者推出 PBT-Bench,用 40 个真实 Python 库中的 100 道基于属性的测试题评测 AI 智能体,每题注入语义 bug 共 365 个(平均 3.65 个/题),需智能体从文档推导语义不变量并写出 Hypothesis @given 策略以触发随机搜索。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。