跳到正文
热点事件持续更新

LongMemEval-S 长期记忆评测审计报告发布

1 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

Christopher J. Chanhnourack 发布了一项针对 LongMemEval-S 全部 500 道开发题的长期记忆检索链评估审计报告。审计发现,最强历史 reader lane 在适配 GPT-4o 评分标准下得分为 479 和 475;对同一批 pass-1 答案重新评判后,三个标签发生变化,得分变为 478。 报告说明,全部 500 道题都用于开发各组件,没有评估未触碰的留出集;方法来源仍被保留,阶段 1 至 4 仍处于关闭状态,原始 headline 请求无法重建。已发布的工件支持数据包检查、已保存判定结果的重新计数与重新评分,但不能重建该方法。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月5日
  1. arXiv:cs.AI
    长期记忆评估审计:重复评判、读者差异与负对照

    一项针对 LongMemEval-S 全部 500 道开发题的长期记忆检索链评估审计发现,最强历史 reader lane 在适配 GPT-4o 评分标准下得分为 479 和 475,对同一批 pass-1 答案重新评判后三个标签发生变化,得分变为 478。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。