OpenAI 与 Penda Health 合作研究显示 AI 临床助手显著减少诊疗错误
Pioneering an AI clinical copilot with Penda Health
OpenAI 与肯尼亚内罗毕基层医疗机构 Penda Health 合作研究其 LLM 临床助手 AI Consult,覆盖 15 家诊所 39849 次就诊。
原文给出39849次就诊的对照数据和部署经验,读者可以了解LLM临床辅助如何在实际诊疗中降低错误。
开创 AI 临床副驾驶,携手 Penda Health
对 40,000 次患者就诊的研究发现,使用 AI 副驾驶的临床医生出错更少。
加载中…
分享
AI 系统有潜力改善全球人类健康——让可靠的健康信息普遍可及,帮助临床医生提供更好的护理,并让人们更好地了解自己的健康状况并为其发声。
大型语言模型(LLM)在健康领域的性能与安全性持续进步。OpenAI 模型在 HealthBench 上的表现从 GPT‑4o 到 o3 翻了一倍,前沿模型在诊断推理(在新窗口中打开)和临床摘要(在新窗口中打开)等任务上常常超越专家。然而,在解决现实世界中患者和临床医生挑战方面的采用仍然缓慢。要释放 LLM 在健康领域的潜力,生态系统需要弥合模型-实施差距——即模型能做什么与其在实践中如何使用之间的鸿沟。
为推进关于现实世界实施的研究,OpenAI 与 Penda Health(在新窗口中打开) 合作,这是一家自 2012 年起在肯尼亚内罗毕运营的初级保健服务提供者,对 Penda 由 LLM 驱动的临床医生副驾驶开展了一项新颖研究。Penda 构建了他们的副驾驶 **AI Consult,**在患者就诊的关键时刻为临床医生提供由 LLM 撰写的建议。AI Consult 充当实时安全网,仅在可能存在错误时激活,让临床医生始终完全掌控。
在一项涵盖 15 家诊所、39,849 次患者就诊的研究中,使用 AI Consult 的临床医生相比未使用者,诊断错误的相对减少为 16%,治疗错误减少 13%。
我们认为这一结果源于三个关键因素:
有能力的模型:Penda 的副驾驶自 2024 年 8 月起使用 GPT‑4o,此后模型迅速改进。模型性能不再是限制因素。
与临床对齐的实施:副驾驶与临床用户共同开发,以确保它真正支持——而非扰乱——护理流程。
**主动部署:**Penda 投入了大量精力帮助临床医生理解为何以及如何使用副驾驶,这对采用至关重要。
今天,我们发布研究结果,并更深入地审视 Penda 的成功实施,为生态系统提供一个安全有效使用 LLM 支持临床医生的早期模板。
我们为这项研究与当地利益相关方进行了广泛接触。这项质量改进研究项目获得了 AMREF Health Africa 伦理与科学审查委员会、肯尼亚卫生部、数字健康机构以及内罗毕郡卫生局的批准,并在肯尼亚国家科学技术与创新委员会的研究许可下开展。
初级保健、Penda Health 与 AI Consult
AI 系统在初级保健中可能尤其有用。初级保健临床医生每天要接诊涵盖各个年龄段、器官系统和疾病类型的患者,往往在同一天内,需要广博的知识。这种复杂性使医疗错误很常见:WHO 报告(在新窗口中打开)称,初级保健中的患者伤害既常见又可预防。
Penda Health 是一家社会企业,旨在提供高质量、可负担的医疗服务。Penda 拥有 16 家诊所,每家诊所均提供初级保健、紧急护理、实验室服务和药房。这些诊所全天候 24/7 开放,每年接待近五十万次患者就诊。Penda 对医疗质量有着独特的高度重视,设有积极的临床医生培训和质量项目,并已开发并测试了 此前多个版本的(在新窗口中打开) copilot 系统。

ChatGPT 发布后,Penda 的首席医疗官 Robert Korom 博士认识到,LLM 能够覆盖比以往更广泛的情况和潜在错误,从而实现更高质量的决策支持。为此,Penda 构建了最早的 LLM 临床 copilot 之一,使临床医生在需要时可以向 LLM 寻求第二意见。在一次内部审计中,Penda 审查了来自真实患者就诊的 100 份 LLM 输出,发现许多情况下 LLM 输出是有帮助的,且没有一例是有害的。然而,这个早期版本的 AI Consult 采用率有限,因为它要求临床医生主动请求帮助,并打断了患者互动的流程。

迭代走向临床对齐的实施
2025 年初,Penda 开发了新版本的 AI Consult,在临床医生的工作流程中充当实时安全网。该 copilot 集成到 Penda 临床医生每天使用的电子健康记录中,并在每次就诊期间在后台运行。当临床医生与患者互动并记录患者就诊时,不含患者标识符的文档会在关键节点发送至 OpenAI API。AI Consult 随后根据迄今为止的临床互动向临床医生提供任何所需的反馈。可以返回三种类型的响应:
绿色:表示无担忧;显示为绿色对勾。
黄色:表示中度担忧;显示为黄色响铃,临床医生可选择是否查看。
红色:表示安全关键问题;显示为弹出窗口,临床医生必须查看后才能继续。
Penda 设计 AI Consult 以确保患者安全。该 copilot 充当安全网,识别潜在错误供临床医生核实,而不是代表临床医生采取行动。重要的是,临床医生在每一步都主导工作流程:当 copilot 识别出潜在错误时,临床医生可以选择是否根据反馈修改自己的决定,最终决定权属于临床医生。AI Consult 针对 Penda 的具体情况进行了定制,提示中包括肯尼亚流行病学背景、当地临床指南指导以及 Penda 诊所的标准流程。
诊断 - 红色 治疗 - 红色(儿童胃肠炎)病史 - 黄色 诊断 - 绿色 检查 - 黄色 治疗 - 红色(成人上呼吸道感染)
AI Consult 标记出一个重要的遗漏诊断——缺铁性贫血,促使临床医生添加该诊断,以便进行适当治疗。
初始文档
病史和临床记录(20 行)
已进行的检查: 全血细胞计数(FHG):* WBC:12.38 * HGB:9.90 * HCT:30.70 * Plt:248.00 * RBC(全血细胞计数):5.26 * MCV:58.30 * MCH:18.80 * MCHC:32.20 链球菌 A 抗原检测:* 结果:阴性 诊断: 扁桃体炎,急性细菌性
为 AI Consult 响应做出贡献
AI Consult 响应:
推理: 临床文档显示存在小细胞性贫血,血红蛋白水平为 9.90 g/dL,MCV 为 58.30 fL,表明诊断中未处理的贫血。小细胞性贫血的存在应与当前的呕吐症状一起评估。建议: 考虑到小细胞性贫血这一重要发现未被处理,重新评估诊断。调查贫血的潜在原因,如缺铁或慢性疾病。考虑进行铁研究或进一步饮食调查的额外测试。确保贫血纳入管理计划,以处理这一关键发现。
AI Consult 关键发现
最终文档
病史和临床笔记(20 行)
进行的检查: 全血细胞计数(FHG):* WBC:12.38 * HGB:9.90 * HCT:30.70 * Plt:248.00 * RBC(全血细胞计数):5.26 * MCV:58.30 * MCH:18.80 * MCHC:32.20 链球菌 A 抗原测试:* 结果:阴性 诊断: 扁桃体炎,急性细菌性,呕吐,未指定,缺铁性贫血,A 组链球菌咽炎评分 <2
AI Consult 后所做的更改
有效部署以促进临床医生采用
Penda 将 AI Consult 部署给其随机选择的一半临床医生,作为其质量改进实践的一部分。此部署分两个阶段进行——诱导期(1 月 30 日至 2 月 28 日)和主要期(3 月 1 日至 4 月 17 日)。
在诱导期,Penda 利用临床医生的反馈来改进 copilot。这包括解决测试中无法识别的技术问题(例如,有时触发不一致)和临床医生工作流程(例如,在儿童就诊时因缺少血压而触发,尽管 Penda 不常规测量儿童的血压)。在此期间,Penda 还注意到临床医生在学习使用 AI Consult 方面还处于早期阶段——例如,他们经常忽略红色警报,因为他们不知道这些警报的重要性——这表明帮助临床医生良好使用 copilot 的重要性。
在主要期,Penda 采取了几个步骤来帮助临床医生更好地使用 AI Consult。这包括:
连接:同行冠军和分支经理解释了 copilot 的重要性,向同事介绍了其优势和局限性,并提供一对一辅导以支持采用。
测量:Penda 跟踪临床医生与 AI Consult 建议互动的频率,并通过个性化辅导进行跟进。
激励:Penda 质量领导表彰了良好使用 AI Consult 的临床医生和诊所。
Penda 与 OpenAI 合作分析了 copilot 部署的影响,比较了有和没有访问 AI Consult 的临床医生提供的护理。OpenAI 为研究提供了财务支持,并就 copilot 的进一步开发提供了咨询。
只有个别同意将数据纳入质量改进研究的患者才被纳入分析,他们能够按要求撤回数据。AMREF 伦理和科学审查委员会确定本研究不需要额外同意。
研究结果:AI Consult 大幅减少了诊断和治疗错误
该研究分析了39,849次患者就诊的数据:其中20,859次属于使用AI Consult的组(AI组),18,990次属于未使用的组(非AI组)。
对护理质量的影响
108名独立医生(其中29名来自肯尼亚)对随机抽取的5666次就诊的最终文档和决策进行了评分,以识别错误。他们从四个维度进行评分:病史的质量;所开具的检查是否恰当;诊断是否正确;以及治疗是否正确。
AI组在全部四个类别中的错误均显著低于非AI组。病史采集错误减少了32%,检查错误减少了10%,诊断错误减少了16%,治疗错误减少了13%。在AI Consult本应返回至少一个红色警报的病例中,这一效果更为显著:在这些就诊中,AI将诊断错误减少了31%,治疗错误减少了18%。
显著性水平用星号表示:★表示p ≤ 0.05,★★表示p ≤ 0.01,★★★表示p ≤ 0.001。
这些效应量与抗生素管理项目(在新窗口中打开)或鼓励为有需要的患者开具他汀类药物的警报(在新窗口中打开)相当,但却来自一个能够支持广泛临床决策的单一系统。从绝对数量来看,引入AI Consult仅在Penda一家,每年就可避免22,000次就诊中的诊断错误和29,000次就诊中的治疗错误。
我们还考察了AI Consult所减少的具体错误类型。我们发现,AI组更不容易遗漏病史中的关键细节、遗漏关键检查或弄错主要诊断。我们还发现,使用AI的临床医生更不容易开错药物或遗漏重要的患者教育。
显著性水平用星号表示:★表示p ≤ 0.05,★★表示p ≤ 0.01,★★★表示p ≤ 0.001。
主动部署的效果
Penda的主动部署工作效果惊人。Penda追踪的指标之一是红色警报遗留率:即在任何类别中出现红色警报(对于非AI组,则是本应出现红色警报)而临床医生未加以纠正的就诊百分比。
在导入期,AI组和非AI组的红色警报遗留率相近,为35-40%,这表明使用AI的临床医生只是有时会对红色警报采取行动。一旦Penda开始主动部署,AI组的红色警报遗留率降至20%,而非AI组的比率仍保持在40%左右,这凸显了主动部署对AI Consult的影响有多么重要。
我们调查了Penda的临床医生(匿名、经同意)对AI Consult对其护理质量影响的看法。AI组的所有受访者都表示AI Consult帮助他们提高了所能提供的护理质量,其中75%的人表示效果“显著”。
AI 组的临床医生不仅使用了 AI Consult——他们还与之共同成长。一位临床医生指出:“它多次帮助我做出正确的临床判断”,而其他人则称它为“房间里的顾问”,并称其为“Penda 发生的最好的创新之一”。他们还将其描述为一种“学习工具”,可以帮助他们拓宽医学知识并提升临床技能。研究数据与这种看法相符:随着时间推移,使用 AI 的临床医生触发的红色警报更少(从研究开始时的 45% 就诊量降至结束时的 35%),这意味着他们学会了避免常见陷阱,甚至是在 AI Consult 反馈之前。除了热情之外,临床医生也指出了改进空间,尤其是在本地化和速度方面。
对患者结局的影响
作为 Penda 标准实践的一部分,工作人员会在患者同意的情况下于就诊八天后致电询问他们是否感觉好转。在 AI 组中,3.8% 的患者感觉没有好转,而在非 AI 组中,4.3% 的患者感觉没有好转。这一差异在统计上不显著。患者在 Penda 之外寻求额外护理的比例——Penda 收集的另一个质量信号——在两组之间也相似。
Penda 的工作人员还可以在可能存在伤害的情况下提交患者安全报告。AI 组有 7 份报告,非 AI 组有 5 份,每份都由 Penda 团队进行了研究。没有任何一例中 AI Consult 的建议导致了伤害。在若干案例中,如果 AI Consult 的建议可用或被采纳,可能本可以预防伤害。
我们接下来的方向
我们与 Penda 的合作源于对扩大安全、高质量护理可及性的共同承诺。在世界各地,患者往往难以获得护理或遭受可预防的伤害。我们开展这项研究不仅是一项技术练习,也是为了理解 AI 如何切实且负责任地帮助临床医生照护人们。
与这篇博文相辅相成的是一份关于该研究、AI Consult 和 Penda 部署的完整研究论文(在新窗口中打开)。我们希望这项工作能为其他医疗保健组织提供启发和实用指导,以推进健康 AI 用例的前沿。
我们相信 AI Consult 代表了一种早期、有前景的临床副驾驶原型,而非最终形态。我们预计医疗保健生态系统将推动实施方面的进一步改进,例如,语音优先界面以减少文档负担,或由代理在临床医生确认后在健康记录中采取行动。需要后续研究来进一步研究这些副驾驶如何影响患者结局、验证这些实施,并将其提炼为可操作的模板,以实现成功、规模化的部署。Penda 目前正在与 PATH 开展一项随机对照试验,以进一步衡量对患者结局的影响。
随着 AI 模型的进步,前方的主要挑战不再是模型能力,而是现实世界的落地实施。弥合模型与实施之间的差距需要健康 AI 生态系统的协同努力,包括严格的评估和在临床环境中的迭代部署。我们相信,基于 AI 的 copilot 正开始进入负责任采用的 Overton 窗口。随着我们持续研究和扩展这些系统,我们希望 AI 能够成为标准诊疗中值得信赖的一部分——正如它在 Penda Health 已经做到的那样——从而在全球范围内带来更好的患者结局。
作者
Robert Korom、Sarah Kiptinness、Najib Adan、Kassim Said、Catherine Ithuli、Oliver Rotich、Boniface Kimani、Irene King'ori、Stellah Kamau、Elizabeth Atemba、Muna Aden、Preston Bowman、Michael Sharman、Rebecca Soskin Hicks、Rebecca Distler、Johannes Heidecke、Rahul K. Arora、Karan Singhal
致谢
Amelia Glaese、Benjamin Kinsella、Dorothy Cheboi、Lilian Weng、Magdalene Kaisa、Nino Jananashvili、Phoebe Thacker、Rachel Ndiema、Spruce Campbell、Stephanie Koczela、Wyatt Thompson
我们感谢以下审稿人慷慨提供反馈:Ethan Goh、Fred Mutisiya、Isaac Kohane、Nigam Shah 和 Steven Wanyee。任何错误均由我们自己承担。
我们还要感谢为本研究评定临床文档质量的医生审稿人。
来源:OpenAI:官网动态(RSS · 排除企业/客户案例) · openai.com