跳到正文
热点事件持续更新

LLM临床分诊基准:文本扰动下比医生更敏感

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

2026年10月1日,arXiv(cs.AI)发布一篇论文,构建了临床分诊基准,用于以执业医生为专家基准,评测大语言模型(LLM)临床分诊建议的敏感性。该基准包含6,000多个临床场景、7,000条医生标注和225,000条模型响应,对比LLM与执业医生在保持临床情境不变的文本扰动下的表现。报道称,结果显示LLM在文本扰动下比医生更敏感。目前该事件仅有这一篇报道,尚无后续进展。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月1日
  1. arXiv:cs.AI(全量分类)
    arXiv 论文:以医生专家为基准评测 LLM 临床分诊建议的敏感性

    arXiv 论文构建临床分诊基准,包含 6,000 多个临床场景、7,000 条医生标注和 225,000 条模型响应,对比 LLM 与执业医生在保持临床情境不变的文本扰动下的表现。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。