跳到正文
原文
arXiv:cs.CL(计算语言学,全量分类)· Xueting Fang, Zehui Li, Yang Yang, Camilla Giovino, Shubh K. Patel, Shailly Prajapati, Vallijah Subasri, Caihua Shan·· 3 小时前AI 评分53

KlinikeBench:超越诊断准确率的语言模型临床评估基准

KlinikeBench: Evaluating Language Models Beyond Diagnostic Accuracy

AI 导读

研究者推出 KlinikeBench,一个包含 333 个临床医生编写任务的基准,每个任务提供带虚拟患者、临床工具和成功标准的沙盒环境,评估语言模型在完整临床问诊中的表现。

来源:arXiv:cs.CL(计算语言学,全量分类) · arxiv.org