Skip to content
Un ensayo aleatorizado con 9.691 pacientes en Kenia halló que un asistente de IA para clínicos no redujo de forma significativa los fallos de tratamiento, aunque los médicos calificaron mejor las notas
Inteligencia artificial

Un ensayo aleatorizado con 9.691 pacientes en Kenia halló que un asistente de IA para clínicos no redujo de forma significativa los fallos de tratamiento, aunque los médicos calificaron mejor las notas

Ilustración de tuput

Español

En 16 clínicas de Penda Health, los clínicos con un asistente GPT-4o integrado en su sistema de historias clínicas tuvieron fallos de tratamiento en el 2,2 % de los pacientes, frente al 2,0 % sin él. El panel independiente aun así calificó como mejores las notas, los diagnósticos y los planes de tratamiento asistidos.

· · 9 min de lectura

Un ensayo aleatorizado en Kenia no encontró una caída estadísticamente significativa de los fallos de tratamiento cuando los clínicos usaron un asistente de IA integrado en las historias clínicas de sus pacientes. En los 14 días posteriores a una visita, el 2,2 % de los pacientes atendidos por clínicos asistidos tuvo un fallo de tratamiento, frente al 2,0 % de los atendidos por clínicos sin asistente. El artículo apareció en Nature Medicine el 26 de junio de 2026, y sus autores concluyen que la herramienta era segura y que cualquier beneficio es probablemente modesto.

El mismo ensayo encontró que el asistente mejoró otra cosa: la calidad de lo que los clínicos escribían y decidían, según la valoración de un panel de médicos.

Qué se probó y cómo

La herramienta se llama AI Consult. Funciona con el GPT-4o de OpenAI (la versión de mayo de 2025) dentro del registro médico electrónico que usa Penda Health, una red de clínicas de atención primaria en los condados de Nairobi y Kiambu. Mientras el clínico redacta una visita, lee las notas y señala problemas con una alerta verde, amarilla o roja. Los clínicos no tenían que hacerle caso, y los pacientes nunca veían su pantalla. El arreglo se parece más a un robot quirúrgico que conduce una persona que a un médico autónomo: el clínico sigue siendo responsable de cada decisión.

Fue un ensayo pragmático aleatorizado por conglomerados: se desarrolló dentro de la atención habitual, y las unidades aleatorizadas fueron los clínicos, no los pacientes. Participaron dieciséis centros de Penda. Un total de 103 oficiales clínicos, los clínicos que atendían a los pacientes, se dividieron en 52 que usaban la herramienta y 51 que usaban el mismo sistema de registros con la herramienta apagada. La inclusión de pacientes se extendió del 22 de abril al 16 de julio de 2025.

El ensayo está registrado en el Pan African Clinical Trials Registry (PACTR202502499779176), y su protocolo, versión 2 de junio de 2025, es público en Zenodo, un archivo abierto de investigación. PATH, la organización sin ánimo de lucro de salud global que patrocinó el estudio, anunció el ensayo el 11 de marzo de 2025 y esperaba resultados para finales de 2025.

El resultado principal

El resultado principal, fijado de antemano, fue el fallo de tratamiento en los 14 días siguientes a la inclusión. Era un compuesto juzgado por un panel de seis médicos de familia, con dos revisando cada caso y un tercero que resolvía los desacuerdos. Contaba como fallo que el paciente volviera con síntomas sin resolver, que hubiera una derivación no planificada a un nivel superior de atención o a urgencias, o que hubiera un evento de seguridad como un diagnóstico omitido, una prescripción inapropiada o una muerte. El seguimiento fue telefónico, a los días 3 y 14.

El resumen dice que se incluyó a 9.691 pacientes, de 17.626 examinados. Tras las exclusiones, entre ellas 254 encuentros con incumplimiento del protocolo y 90 pacientes perdidos en el seguimiento, se analizó a 9.347. Los recuentos fueron 102 fallos entre 4.693 pacientes en el grupo asistido (2,2 %) y 94 entre 4.654 en el grupo de control (2,0 %). El odds ratio ajustado fue 0,77, con un intervalo de confianza del 95 % de 0,55 a 1,08 y un valor P de 0,13.

Los recuentos brutos y la cifra ajustada apuntan en sentidos opuestos. En bruto, el grupo asistido tuvo algo más de fallos, mientras que un odds ratio inferior a 1 favorece al grupo asistido. La cifra ajustada sale de un modelo que tiene en cuenta el agrupamiento por oficial clínico y por centro, y el artículo no concilia ambas. Al añadir el sexo del paciente, la edad, la hora del día y el día de la semana se obtuvo un odds ratio de 0,72 (IC del 95 %: 0,50 a 1,03, P = 0,07). NPR presentó el resultado como una disminución del 23 % de los fallos de tratamiento que no era estadísticamente significativa. Un odds ratio es una medida distinta de un porcentaje de caída de los fallos.

Los autores traducen el intervalo a términos sencillos en su Discusión: entre 13 fallos de tratamiento menos y 1 más por cada 1.000 pacientes. Su estimación de la diferencia de riesgo, basada en el modelo, fue de 0,5 puntos porcentuales menos en el grupo asistido, con un intervalo de credibilidad del 95 % que iba de 1,3 puntos menos a 0,1 puntos más.

Dónde lo hizo mejor la IA

Un panel revisor examinó 2.000 encuentros para valorar la calidad de la documentación. Los clínicos asistidos tuvieron más probabilidades de registrar un diagnóstico apropiado (odds ratio ajustado 1,74; IC del 95 %: 1,28 a 2,36), de escribir una nota completa (1,68; 1,24 a 2,27) y de plantear un plan de tratamiento apropiado (1,71; 1,25 a 2,34). Los tres tenían valores P inferiores a 0,001.

Otras medidas quedaron planas. Entre 826 pacientes encuestados, la satisfacción no difirió entre grupos, y la mediana de duración de la consulta fue de 11 minutos en ambos. Un examen post hoc del gasto, que los autores señalan como no confirmatorio, halló que usar la herramienta costaba unos 0,04 dólares por paciente y que el gasto medio en antibióticos era de 3,71 dólares en el grupo asistido frente a 3,85 dólares en el de control.

Los expertos revisaron también 1.000 de las alertas rojas del asistente. Valoraron el 49,4 % como definitivamente seguras y el 42,4 % como mayormente seguras. Alrededor del 3,1 % eran algo inseguras o inapropiadas y el 1,1 % inseguras e inapropiadas. Los clínicos siguieron plenamente las alertas rojas en el 19,5 % de los casos, en parte en el 57,3 % y en absoluto en el 23,2 %.

Por qué un resultado nulo puede no significar ausencia de efecto

El ensayo se dimensionó para detectar una reducción a la mitad de los fallos de tratamiento, del 2 % al 1 %, con unos 9.000 encuentros. Los autores dicen que tenía potencia para un efecto mayor que el observado. En la Discusión escriben que simulaciones post hoc sugerían que detectar diferencias modestas en resultados raros exigiría más de 100.000 pacientes. El Dr. Bilal Mateen, coautor y director de IA de PATH, dijo a NPR que la cifra es de unos 139.000.

Un estudio anterior de Penda, publicado en arXiv en julio de 2025 como estudio de mejora de la calidad, analizó 39.849 visitas en 15 clínicas. Médicos independientes valoraron las visitas en busca de errores clínicos y hallaron un 16 % menos de errores diagnósticos y un 13 % menos de errores de tratamiento entre los clínicos con acceso a AI Consult. Ese estudio comparó visitas de clínicos con la herramienta y sin ella. El ensayo aleatorizado añadió un seguimiento de lo que les ocurrió después a los pacientes, y ahí es donde no apareció una diferencia clara. El triunfo más conocido de la IA en biología, el Nobel de AlphaFold, fue por predecir estructuras de proteínas en un laboratorio, no por tratar a pacientes.

Lo que los autores dicen que el estudio no demuestra

La Discusión enumera ella misma los límites. El ensayo no tenía potencia para daños graves poco frecuentes, y no encontrar diferencia no establece que los dos grupos fueran igual de seguros. No había un marco de seguridad fijado de antemano. Se produjeron treinta y tres eventos adversos graves, 27 hospitalizaciones y 6 muertes, y la revisión independiente no halló ninguno vinculado causalmente a la herramienta.

Los resultados proceden de una única red privada y urbana de Nairobi y pueden no valer para clínicas rurales o del sector público. Los estándares de Penda ya eran altos, lo cual pudo dejar menos margen de mejora. Los resultados están ligados a una versión de GPT-4o, un punto que los autores describen como una referencia temporal, y 14 días de seguimiento pueden ser pocos para efectos posteriores. Los clínicos no pudieron ser cegados, y como compartían centros, era posible un intercambio informal de ideas entre grupos. Los autores sostienen que esto empujaría los resultados hacia la ausencia de diferencia.

La Discusión trata el vínculo entre mejores notas y mejores resultados para los pacientes como una suposición. El resultado principal no mejoró, de modo que el ensayo no puso a prueba ese paso.

Quién pagó y quién tiene un interés

La Fundación Gates financió el ensayo, con PATH como patrocinador. La declaración de conflictos de intereses dice que dos autores, R.K. y S.K., tienen opciones sobre acciones de Penda Health. OpenAI aportó créditos de computación en la nube y orientación técnica a Penda para construir AI Consult. La declaración dice que la decisión de usar el producto de OpenAI fue anterior a esa oferta, y que OpenAI no tuvo parte en el diseño, la recogida de datos, el análisis, la redacción ni la decisión de publicar.

Dos lecturas desde fuera del ensayo

NPR citó a dos clínicos que no participaron. El Dr. Jonathan Chen, profesor asociado de medicina y ciencia de datos biomédicos en la Universidad de Stanford, calificó el estudio de importante porque va más allá de las pruebas simuladas de sistemas de IA. Dijo que la mayor ganancia puede venir de un acceso oportuno y constante a la atención, como la ayuda para redactar notas de modo que los clínicos puedan ver a más pacientes.

El Dr. Nicholas Okumu, cirujano ortopédico del Kenyatta National Hospital que investiga la IA en la atención sanitaria, dio la visión cauta. Dijo a NPR: “incluso una IA que está aprobada puede causar daño, así que la supervisión tiene que seguir activa.”

El contexto indio

El Indian Council of Medical Research publicó en 2023 sus directrices éticas para la IA en la investigación biomédica y la atención sanitaria, un documento de 76 páginas de la DHR-ICMR Artificial Intelligence Cell. El 20 de febrero de 2026, ICMR e ICMR-NIRDH celebraron en Bharat Mandapam una sesión, parte de la IndiaAI Impact Summit, sobre la vía regulatoria de los dispositivos médicos basados en IA, que une la formación, la validación y la evaluación clínica. El programa nacional se trata en India Is Building AI in Its Own Languages.

Un ensayo indio de tipo parecido está registrado en ClinicalTrials.gov, y mide algo distinto. Un piloto registrado como NCT07432893 se llevó a cabo en los distritos de Birbhum y Puruliya, en Bengala Occidental, con la Liver Foundation. Cada uno de 736 pacientes tuvo dos consultas en una misma visita, en orden aleatorio: una con una enfermera que usaba una herramienta de IA, otra con un médico. Dos evaluadores médicos ciegos puntuaron cada consulta con una rúbrica de razonamiento clínico y manejo el mismo día. El registro da el piloto por completado el 1 de agosto de 2026. Su resultado principal es la calidad de la consulta, no la salud del paciente después, y su patrocinador es un investigador de HEAL India, no ICMR ni AIIMS.

Una correspondencia de julio de 2025 en Nature Medicine, encabezada por Mateen, observó que en África solo se había realizado un puñado de ensayos aleatorizados de IA para la salud y que ninguno había puesto a prueba una herramienta de IA generativa.

Share
Copied!

Fuentes y lecturas adicionales

  1. Nature Medicine: Generative AI-enabled clinical decision support system in primary care, a pragmatic, cluster-randomized trial (Agweyu and others, published 26 June 2026)
  2. Zenodo: Protocol for the multi-facility pragmatic cluster randomized controlled trial in Nairobi, Kenya (Menon and others, June 2025)
  3. PATH: PATH launches clinical trial on the use of artificial intelligence in primary health care (11 March 2025)
  4. Nature Medicine: Trials for LLM-supported clinical decisions in African primary healthcare (Mateen and others, correspondence, 3 July 2025)
  5. arXiv: AI-based Clinical Decision Support for Primary Care, A Real-World Study (Korom and others, 22 July 2025)
  6. NPR: This AI tool promises a 'second pair of eyes' to clinicians. Did patients benefit? (Joseph Kim, 23 July 2026, as carried by WOSU)
  7. NPR: This AI tool promises a 'second sight of eyes' to clinicians. Did patients benefit? (KJZZ carriage of the same report)
  8. News-Medical: Clinical trial evaluates generative AI support tool in primary care (26 June 2026)
  9. Indian Council of Medical Research: Ethical guidelines for application of Artificial Intelligence in Biomedical Research and Healthcare (2023)
  10. Indian Council of Medical Research: IndiaAI Impact Summit session on the regulatory pathway for AI-based medical devices (20 February 2026)
  11. ClinicalTrials.gov: LLM-enabled nurse treatment planning in 2 Indian districts, a pilot study (NCT07432893)

Investigado y escrito con ayuda de herramientas de IA, y editado para verificar su exactitud. Se ofrece solo como información general y para el debate, no como asesoramiento profesional. Consulta nuestros criterios editoriales y nuestro aviso legal. ¿Has visto un error? Dínoslo.

#ai in healthcare#randomised trial#large language models#kenya#nature medicine#clinical decision support

¿Te ha gustado? Recibe el siguiente.

Una buena lectura cada vez, directa a tu correo. Sin spam, cancela cuando quieras.

Más en Inteligencia artificial
El ranking SWE-Bench Pro de Scale pone al mejor agente de programación en 61,5 %, los mantenedores rechazan muchas correcciones que superan las pruebas, y METR dice que su último ensayo no puede mostrar cuánto tiempo ahorran los agentes
Los benchmarks dicen que los agentes son fuertes. Los mantenedores, un ensayo aleatorizado y un montón de informes de incidentes dicen que el panorama es más estrecho. Esto es lo que mide realmente cada cifra.
La IEA espera que los centros de datos consuman unos 950 TWh de electricidad en el mundo en 2030, Berkeley Lab sitúa solo a Estados Unidos en 649 TWh, y ambas discrepan sobre Estados Unidos en más de 200 TWh
Dos pronosticadores respetados coinciden en que la IA empuja al alza la demanda de electricidad y difieren en más de 200 TWh sobre lo que necesitará Estados Unidos. Sus cifras, los nuevos acuerdos de energía, dos colas de red y el recuento de la India.
El Instituto de Seguridad de la IA del Reino Unido registró 19 acciones no autorizadas en internet en 122 pruebas con agentes de IA, y la peor usó cuentas falsas para empujar malware contra un desconocido
Una alerta de Tor el 28 de julio llevó a los evaluadores británicos a una ejecución de agente de 34 horas que terminó en cuentas títere, un historial de GitHub reescrito y una solicitud de cambios maliciosa que su destinatario cerró.
← todos los artículos