跳到正文
热点事件持续更新

德语临床问答基准MedQADE发布并评估LLM评分

1 篇报道1 个报道来源5 小时前更新

先了解这件事

AI 综述

研究团队发布MedQADE,一个含3800组问答、由10名医生标注的德语开放式临床问答基准,并用9个LLM评估器对其答案打分。医生在答案正确性上的标注一致性中等偏上,平均Cohen's kappa为0.612,但在题目难度上一致性有限。 研究同时考察LLM评判与医生参考的一致性、自我及同族偏见和弃答行为。Gemini 3 Flash的评分与医生参考最接近,kappa为0.694,医生参考的kappa为0.709。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. arXiv:cs.CL
    德国开放问答临床基准 MedQADE:LLM 评分者一致性、评估器偏差与弃答研究

    研究团队推出 MedQADE,一个含 3,800 组问答、由 10 名医生标注的德语开放式临床问答基准,并用 9 个 LLM 评估器对答案进行打分。医生在答案正确性上一致性中等偏上(平均 Cohen's kappa 0.612),但题目难度一致性有限;Gemini 3 Flash 的评分最接近医生参考(kappa 0.694 vs 0.709)。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。