CMU:Machine Learning Blog·· 15 小时前AI 评分48
医疗 LLM 基准为何在部署时失效:CMU 提出 BenchmarkCards 框架
Healthcare Benchmarks Are Only as Good as Their Assumptions
AI 导读
CMU 研究指出医疗 LLM 基准的评估与部署存在 61 个百分点差距,根源是评估协议中隐含的任务与结果两类假设在真实场景中不成立。研究将差距拆解为查询分布 12 点、交互类型 19 点、决策中介 30 点,并提出 BenchmarkCards 框架显式化这些假设,配合分阶段评估判断基准结果能否迁移到部署。
来源:CMU:Machine Learning Blog · blog.ml.cmu.edu