插图:tuput
中文
在彭达健康(Penda Health)的16家诊所里,病历系统内置GPT-4o助手的临床医生,其患者的治疗失败率为2.2%,没有助手的为2.0%。独立评审小组仍然认为,有助手一方的病历、诊断和治疗方案打分更高。
肯尼亚的一项随机试验发现,临床医生使用内置于患者病历的AI助手后,治疗失败并没有出现统计学上显著的下降。就诊后14天内,使用助手的临床医生所诊治的患者中有2.2%出现治疗失败,没有助手的是2.0%。论文于2026年6月26日发表在《自然·医学》(Nature Medicine)上,作者的结论是,这个工具是安全的,其益处可能不大。
同一项试验还发现,助手改善了另一件事:由一个医生小组评判的,临床医生写下的记录和作出的决定的质量。
测试了什么,怎么测的
这个工具叫AI Consult。它运行的是OpenAI的GPT-4o(2025年5月版本),嵌在彭达健康(Penda Health)使用的电子病历系统里,这是内罗毕和基安布两个郡的一家基层诊所网络。临床医生写就诊记录时,它会阅读记录,并用绿、黄或红色的提示标出问题。临床医生不必照办,患者也从来看不到它的屏幕。这种安排更接近由人来操控的手术机器人,而不是自主行医的医生:每一项决定仍由临床医生负责。
这是一项务实的整群随机试验:它在日常诊疗中进行,随机分组的单位是临床医生,不是患者。彭达的16个机构参加了试验。共有103名临床执业官(clinical officer,即直接接诊的临床医生)被分成两组,52人使用这个工具,51人使用同一套病历系统,但工具关闭。入组从2025年4月22日持续到7月16日。
试验已在泛非临床试验注册中心(Pan African Clinical Trials Registry)注册,编号PACTR202502499779176,试验方案的第2版(日期为2025年6月)公开在开放研究档案库Zenodo上。研究的发起方是全球卫生非营利组织PATH,它于2025年3月11日宣布了这项试验,并预期在2025年底前出结果。
主要结果
预先设定的主要结局是入组后14天内的治疗失败。这是一个综合指标,由六名家庭医生组成的小组评判,每个病例由两人审查,第三人裁决分歧。出现以下情况之一即算失败:患者带着未缓解的症状复诊,被计划外地转到更高级别或急诊治疗,或发生了安全事件,如漏诊、不当处方或死亡。随访通过电话进行,在第3天和第14天。
摘要说,从筛查的17626人中入组了9691名患者。排除包括254次未遵守方案的就诊和90名失访患者在内的病例之后,分析了9347人。助手组4693名患者中有102例失败(2.2%),对照组4654人中有94例(2.0%)。校正后的比值比为0.77,95%置信区间为0.55至1.08,P值为0.13。
原始计数和校正后的数字指向相反的方向。就原始数字看,有助手的一组失败略多,而低于1的比值比则是有利于助手组的。校正后的数字来自一个考虑了临床执业官和机构聚集效应的模型,论文没有调和这两者。加入患者的性别、年龄、就诊时段和星期几之后,比值比为0.72(95% CI 0.50至1.03,P = 0.07)。美国全国公共广播电台(NPR)把这一结果报道为治疗失败减少了23%,但在统计学上不显著。比值比与失败减少的百分比是两种不同的度量。
作者在讨论部分把这个区间换成了通俗的说法:每1000名患者中,治疗失败少13例到多1例之间。他们基于模型对风险差的估计是,助手组低0.5个百分点,95%可信区间从低1.3个百分点到高0.1个百分点。
AI做得更好的地方
一个评审小组检查了2000次就诊的记录质量。有助手的临床医生更有可能记录恰当的诊断(校正比值比1.74,95% CI 1.28至2.36)、写出完整的记录(1.68,1.24至2.27),并给出恰当的治疗方案(1.71,1.25至2.34)。三项的P值都低于0.001。
其他指标没有差别。在接受调查的826名患者中,两组的满意度没有差别,诊疗时间的中位数两组都是11分钟。一项事后的费用分析(作者标明它不是验证性的)发现,该工具每名患者的运行成本约为0.04美元,抗生素的平均花费助手组是3.71美元,对照组是3.85美元。
专家们还审查了助手发出的1000条红色提示。他们评定其中49.4%肯定安全,42.4%基本安全。约3.1%有些不安全或不恰当,1.1%不安全且不恰当。临床医生完全遵循红色提示的占19.5%,部分遵循的占57.3%,完全没有遵循的占23.2%。
为什么没有结果不一定意味着没有效果
这项试验的样本量,是按检测出治疗失败减半(从2%降到1%)来定的,约需9000次就诊。作者说,它的检验效能是针对比实际观察到的更大的效应设计的。他们在讨论部分写道,事后模拟显示,要检测出罕见结局的微小差异,需要超过10万名患者。共同作者、PATH的首席AI官比拉尔·马特恩(Bilal Mateen)博士对NPR说,这个数字约为13.9万。
彭达早些时候的一项研究于2025年7月作为质量改进研究贴到了arXiv上,考察了15家诊所的39849次就诊。独立医生对就诊中的临床错误进行评级,发现能使用AI Consult的临床医生,诊断错误少16%,治疗错误少13%。那项研究比较的是有工具和没有工具的临床医生的就诊。这项随机试验增加了对患者之后情况的随访,而没有出现明确差异的正是这一部分。AI在生物学上最有名的胜利,AlphaFold的诺贝尔奖,是因为在实验室里预测蛋白质结构,而不是治疗患者。
作者说这项研究没有证明什么
讨论部分自己列出了局限。试验的效能不足以检测罕见的严重伤害,没有发现差异,并不能证明两组同样安全。没有预先设定的安全框架。共发生33起严重不良事件,27次住院和6例死亡,独立审查认为没有一起与该工具存在因果关系。
结果来自内罗毕一个私营的城市网络,在农村或公立诊所里可能不成立。彭达的标准本来就很高,也许留给改进的空间更小。结果与GPT-4o的某一个版本绑定,作者把这一点称作时间基准,14天的随访对于下游影响可能也太短。临床医生无法设盲,而且因为他们共用机构,两组之间可能有非正式的想法交流。作者认为,这会使结果偏向没有差异。
讨论部分把更好的记录带来更好的患者结局看作一个假设。主要结局没有改善,所以试验没有检验这一步。
谁出的钱,谁有利害关系
盖茨基金会为这项试验出资,PATH是发起方。利益冲突声明说,两位作者R.K.和S.K.持有彭达健康的股票期权。OpenAI向彭达提供了云计算额度和技术指导,用于构建AI Consult。声明说,决定使用OpenAI的产品在这一提议之前,OpenAI没有参与设计、数据收集、分析、撰写或发表的决定。
试验之外的两种看法
NPR引用了两位没有参与研究的临床医生的话。斯坦福大学医学与生物医学数据科学副教授乔纳森·陈(Jonathan Chen)博士称这项研究很重要,因为它超越了对AI系统的模拟测试。他说,最大的收益可能来自及时而稳定的诊疗服务,比如帮助起草记录,让临床医生能多看患者。
肯雅塔国家医院的骨科医生、研究医疗AI的尼古拉斯·奥库穆(Nicholas Okumu)博士,给出的是谨慎的看法。他对NPR说,“即使是获得批准的AI也仍可能造成伤害,所以监督必须保持主动”。
印度的背景
印度医学研究理事会(ICMR)2023年发布了生物医学研究和医疗保健中人工智能的伦理指南,这是一份由DHR-ICMR人工智能小组编写的76页文件。2026年2月20日,ICMR和ICMR-NIRDH在巴拉特曼达帕姆(Bharat Mandapam)举办了一场会议,属于印度AI影响力峰会(IndiaAI Impact Summit)的一部分,主题是基于AI的医疗器械的监管路径,衔接训练、验证和临床评价。国家层面的项目见印度正在用自己的语言构建AI。
在ClinicalTrials.gov上登记有一项类似的印度试验,它衡量的是另一样东西。登记号为NCT07432893的一项试点,与肝脏基金会(Liver Foundation)在西孟加拉邦的比尔布姆和普鲁利亚两个县进行。736名患者中的每一位在一次就诊中接受两次问诊,顺序随机:一次由使用AI工具的护士问诊,一次由医生问诊。两名设盲的医生评分员当天按临床推理与处理的评分量表给每次问诊打分。登记记录显示,这项试点于2026年8月1日完成。它的主要结局是问诊的质量,而不是患者之后的健康状况,发起方是HEAL India的一名研究者,而不是ICMR或AIIMS。
马特恩牵头的一封2025年7月发表在《自然·医学》上的通信指出,非洲只开展过寥寥几项AI用于健康的随机试验,没有一项测试过生成式AI工具。
资料来源与延伸阅读
- Nature Medicine: Generative AI-enabled clinical decision support system in primary care, a pragmatic, cluster-randomized trial (Agweyu and others, published 26 June 2026)
- Zenodo: Protocol for the multi-facility pragmatic cluster randomized controlled trial in Nairobi, Kenya (Menon and others, June 2025)
- PATH: PATH launches clinical trial on the use of artificial intelligence in primary health care (11 March 2025)
- Nature Medicine: Trials for LLM-supported clinical decisions in African primary healthcare (Mateen and others, correspondence, 3 July 2025)
- arXiv: AI-based Clinical Decision Support for Primary Care, A Real-World Study (Korom and others, 22 July 2025)
- NPR: This AI tool promises a 'second pair of eyes' to clinicians. Did patients benefit? (Joseph Kim, 23 July 2026, as carried by WOSU)
- NPR: This AI tool promises a 'second sight of eyes' to clinicians. Did patients benefit? (KJZZ carriage of the same report)
- News-Medical: Clinical trial evaluates generative AI support tool in primary care (26 June 2026)
- Indian Council of Medical Research: Ethical guidelines for application of Artificial Intelligence in Biomedical Research and Healthcare (2023)
- Indian Council of Medical Research: IndiaAI Impact Summit session on the regulatory pathway for AI-based medical devices (20 February 2026)
- ClinicalTrials.gov: LLM-enabled nurse treatment planning in 2 Indian districts, a pilot study (NCT07432893)
本文在 AI 工具协助下研究与撰写,并经编辑核实。仅供一般参考与讨论,不构成专业建议。请参阅我们的编辑准则与免责声明。发现错误?告诉我们。
喜欢这篇吗?下一篇也别错过。
每次一篇好文章,直接送到你的邮箱。绝无垃圾邮件,随时可退订。