跳到正文
热点事件持续更新

研究者发布GISTBench用户理解评测基准

1 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

研究者 Iordanis Fostiropoulos 等发布 GISTBench,一个评估大语言模型能否从推荐系统交互历史中理解用户的基准,区别于传统侧重物品预测准确率的 RecSys 基准。 该基准提出 Interest Groundedness(IG,含 precision 与 recall)和 Interest Specificity(IS)两类新指标,并发布基于全球短视频平台真实用户交互构建的合成数据集。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月5日
  1. arXiv:cs.AI
    GISTBench:通过基于证据的兴趣验证评估 LLM 用户理解能力

    研究者推出 GISTBench,一个评估 LLM 从推荐系统交互历史中理解用户能力的基准,区别于传统侧重物品预测准确率的 RecSys 基准。该基准提出 Interest Groundedness(IG,含 precision 与 recall)和 Interest Specificity(IS)两类新指标,并发布基于全球短视频平台真实用户交互构建的合成数据集。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。