研究者发布PBT-Bench测试基准
热点事件持续更新
研究者发布PBT-Bench测试基准
1 篇报道1 个报道来源5 小时前更新
先了解这件事
AI 综述
Lucas Jing等作者发布PBT-Bench,用40个真实Python库中的100道基于属性的测试题评测AI智能体。每题注入语义bug共365个,平均3.65个/题;智能体需从文档推导语义不变量,写出Hypothesis @given策略以触发随机搜索。作者称公开发布基准、测试框架和完整评估语料,以支持基于文档的语义推理后续研究。
AI 根据报道生成 · 2 小时前更新
最新进展10月7日 12:00
PBT-Bench:面向 AI 智能体基于属性的测试基准报道时间线
沿着报道,了解事件的不同侧面。
10月7日
- arXiv:cs.AIPBT-Bench:面向 AI 智能体基于属性的测试基准
研究者推出 PBT-Bench,用 40 个真实 Python 库中的 100 道基于属性的测试题评测 AI 智能体,每题注入语义 bug 共 365 个(平均 3.65 个/题),需智能体从文档推导语义不变量并写出 Hypothesis @given 策略以触发随机搜索。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。