arXiv:cs.AI(全量分类)· Abinitha Gourabathina, Haoran Zhang, Yuexing Hao, Walter Gerych, Marzyeh Ghassemi·· 3 小时前AI 评分51
arXiv 论文:以医生专家为基准评测 LLM 临床分诊建议的敏感性
Sense and Sensitivity: Benchmarking LLM Clinical Triage Recommendations with Physician Experts
AI 导读
arXiv 论文构建临床分诊基准,包含 6,000 多个临床场景、7,000 条医生标注和 225,000 条模型响应,对比 LLM 与执业医生在保持临床情境不变的文本扰动下的表现。
来源:arXiv:cs.AI(全量分类) · arxiv.org