德语临床问答基准MedQADE发布并评估LLM评分
热点事件持续更新
德语临床问答基准MedQADE发布并评估LLM评分
1 篇报道1 个报道来源5 小时前更新
先了解这件事
AI 综述
研究团队发布MedQADE,一个含3800组问答、由10名医生标注的德语开放式临床问答基准,并用9个LLM评估器对其答案打分。医生在答案正确性上的标注一致性中等偏上,平均Cohen's kappa为0.612,但在题目难度上一致性有限。 研究同时考察LLM评判与医生参考的一致性、自我及同族偏见和弃答行为。Gemini 3 Flash的评分与医生参考最接近,kappa为0.694,医生参考的kappa为0.709。
AI 根据报道生成 · 1 小时前更新
最新进展10月7日 12:00
德国开放问答临床基准 MedQADE:LLM 评分者一致性、评估器偏差与弃答研究报道时间线
沿着报道,了解事件的不同侧面。
10月7日
- arXiv:cs.CL德国开放问答临床基准 MedQADE:LLM 评分者一致性、评估器偏差与弃答研究
研究团队推出 MedQADE,一个含 3,800 组问答、由 10 名医生标注的德语开放式临床问答基准,并用 9 个 LLM 评估器对答案进行打分。医生在答案正确性上一致性中等偏上(平均 Cohen's kappa 0.612),但题目难度一致性有限;Gemini 3 Flash 的评分最接近医生参考(kappa 0.694 vs 0.709)。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。