arXiv:cs.CL(计算语言学,全量分类)· Lukas Thede, Yash Kumar Atri, David Chen, Danielle Bitterman, Matthias Bethge, Tom Hartvigsen, Zeynep Akata·· 3 小时前AI 评分48
MedKIT:评估大语言模型的知识整合与泛化能力
MedKIT: Evaluating Knowledge Integration and Generalization in Large Language Models
AI 导读
研究者提出医学知识整合评测基准 MedKIT,用临床证据更新搭配词汇变体、关系变换、组合推理与开放式应用等探针,检验模型能否真正使用新知识。基于 5 个通用与医学 LLM、12 种知识整合策略的大规模实验显示,多数方法在原始更新任务和词汇变体上提升明显,但关系泛化有限,组合与操作任务上无一方法取得有意义改进。
来源:arXiv:cs.CL(计算语言学,全量分类) · arxiv.org