跳到正文
热点事件持续更新

预注册研究:语言模型抑郁评分反映评分者

1 篇报道1 个报道来源5 小时前更新

先了解这件事

AI 综述

Baihan Lin 在 arXiv 论文(arXiv:2610.08501)中预注册了 880 个语言模型评分者,将 11 个开源模型与不同提示词和评分方式交叉,应用于 189 段访谈,并对照八项患者健康问卷(PHQ-8)。论文称,语言模型对抑郁的评分更多反映评分者本身,而非患者。 该研究把模型、提示词和评分方式作为变量交叉组合,用以检验评分结果的一致性;目前结论仅覆盖这 11 个开源模型、189 段访谈和 PHQ-8 的评估设置。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. arXiv:cs.AI
    arXiv 论文:语言模型对抑郁的评分更多反映评分者而非患者

    Baihan Lin 在 arXiv 论文(arXiv:2610.08501)中预注册了 880 个语言模型评分者,将 11 个开源模型与不同提示词和评分方式交叉,应用于 189 段访谈并对照 PHQ-8。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。