LongMemEval-S 长期记忆评测审计报告发布
热点事件持续更新
LongMemEval-S 长期记忆评测审计报告发布
1 篇报道1 个报道来源3 小时前更新
先了解这件事
AI 综述
Christopher J. Chanhnourack 发布了一项针对 LongMemEval-S 全部 500 道开发题的长期记忆检索链评估审计报告。审计发现,最强历史 reader lane 在适配 GPT-4o 评分标准下得分为 479 和 475;对同一批 pass-1 答案重新评判后,三个标签发生变化,得分变为 478。 报告说明,全部 500 道题都用于开发各组件,没有评估未触碰的留出集;方法来源仍被保留,阶段 1 至 4 仍处于关闭状态,原始 headline 请求无法重建。已发布的工件支持数据包检查、已保存判定结果的重新计数与重新评分,但不能重建该方法。
AI 根据报道生成 · 1 小时前更新
最新进展10月5日 12:00
长期记忆评估审计:重复评判、读者差异与负对照报道时间线
沿着报道,了解事件的不同侧面。
10月5日
- arXiv:cs.AI长期记忆评估审计:重复评判、读者差异与负对照
一项针对 LongMemEval-S 全部 500 道开发题的长期记忆检索链评估审计发现,最强历史 reader lane 在适配 GPT-4o 评分标准下得分为 479 和 475,对同一批 pass-1 答案重新评判后三个标签发生变化,得分变为 478。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。