研究者发布GISTBench用户理解评测基准
热点事件持续更新
研究者发布GISTBench用户理解评测基准
1 篇报道1 个报道来源3 小时前更新
先了解这件事
AI 综述
研究者 Iordanis Fostiropoulos 等发布 GISTBench,一个评估大语言模型能否从推荐系统交互历史中理解用户的基准,区别于传统侧重物品预测准确率的 RecSys 基准。 该基准提出 Interest Groundedness(IG,含 precision 与 recall)和 Interest Specificity(IS)两类新指标,并发布基于全球短视频平台真实用户交互构建的合成数据集。
AI 根据报道生成 · 1 小时前更新
最新进展10月5日 12:00
GISTBench:通过基于证据的兴趣验证评估 LLM 用户理解能力报道时间线
沿着报道,了解事件的不同侧面。
10月5日
- arXiv:cs.AIGISTBench:通过基于证据的兴趣验证评估 LLM 用户理解能力
研究者推出 GISTBench,一个评估 LLM 从推荐系统交互历史中理解用户能力的基准,区别于传统侧重物品预测准确率的 RecSys 基准。该基准提出 Interest Groundedness(IG,含 precision 与 recall)和 Interest Specificity(IS)两类新指标,并发布基于全球短视频平台真实用户交互构建的合成数据集。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。