رسم: tuput
العربية
في 16 عيادة تابعة لـPenda Health، سجّل الأطباء السريريون الذين استعانوا بمساعد قائم على GPT-4o داخل نظام سجلاتهم إخفاقا في العلاج لدى 2.2% من المرضى، مقابل 2.0% دونه. ومع ذلك منحت اللجنة المستقلة الملاحظات والتشخيصات وخطط العلاج بمساعدته درجات أفضل.
وجدت تجربة عشوائية في كينيا أن إخفاقات العلاج لم تنخفض بدلالة إحصائية حين استعان الأطباء السريريون بمساعد ذكاء اصطناعي مدمج في سجلات مرضاهم. فخلال 14 يوما من الزيارة، سُجّل إخفاق في العلاج لدى 2.2% من المرضى الذين عاينهم أطباء يستعينون بالمساعد، مقابل 2.0% من المرضى الذين عاينهم أطباء لا يستعينون به. ونُشرت الورقة في Nature Medicine في 26 يونيو 2026، ويخلص مؤلفوها إلى أن الأداة آمنة وأن أي فائدة منها على الأرجح متواضعة.
ووجدت التجربة نفسها أن المساعد حسّن شيئا آخر: جودة ما دوّنه الأطباء السريريون وقرروه، بحكم لجنة من الأطباء.
ما الذي اختُبر وكيف
تسمى الأداة AI Consult. وهي تشغّل GPT-4o من OpenAI (إصدار مايو 2025) داخل السجل الطبي الإلكتروني الذي تستخدمه Penda Health، وهي شبكة عيادات رعاية أولية في مقاطعتي نيروبي وكيامبو. وبينما يكتب الطبيب السريري تقرير الزيارة، تقرأ الأداة ملاحظاته وتشير إلى المشكلات بتنبيه أخضر أو أصفر أو أحمر. ولم يكن الأطباء ملزمين باتباعها، ولم يكن المرضى يرون شاشتها قط. والترتيب أقرب إلى روبوت جراحي يقوده إنسان منه إلى طبيب مستقل: فالطبيب السريري يبقى مسؤولا عن كل قرار.
كانت تجربة عنقودية عشوائية عملية: جرت داخل الرعاية الروتينية، وكانت الوحدات التي وُزعت عشوائيا هي الأطباء السريريون لا المرضى. وشاركت ست عشرة منشأة تابعة لـPenda. وقُسّم 103 من الموظفين السريريين، وهم الأطباء السريريون الذين عاينوا المرضى، إلى 52 يستخدمون الأداة و51 يستخدمون نظام السجلات نفسه مع إيقاف الأداة. واستمر التسجيل من 22 أبريل إلى 16 يوليو 2025.
والتجربة مسجلة في سجل التجارب السريرية لعموم أفريقيا (PACTR202502499779176)، وبروتوكولها، النسخة 2 المؤرخة يونيو 2025، متاح للعموم على Zenodo، وهو أرشيف بحثي مفتوح. وأعلنت PATH، المنظمة غير الربحية للصحة العالمية التي رعت الدراسة، عن التجربة في 11 مارس 2025 وتوقعت النتائج بحلول نهاية 2025.
النتيجة الرئيسية
كانت النتيجة الرئيسية المحددة مسبقا هي إخفاق العلاج خلال 14 يوما من التسجيل. وكانت مركّبة، تحكم فيها لجنة من ستة أطباء أسرة، يراجع اثنان منهم كل حالة ويحسم ثالث الخلاف. وكان الإخفاق يُحتسب إذا عاد المريض بأعراض لم تُحل، أو حدث تصعيد غير مخطط له إلى رعاية أعلى مستوى أو طارئة، أو وقع حدث يمس السلامة مثل تشخيص فائت أو وصفة غير مناسبة أو وفاة. وكانت المتابعة بالهاتف، في اليومين 3 و14.
يقول الملخص إن 9,691 مريضا سُجّلوا من بين 17,626 جرى فحصهم. وبعد الاستبعادات، ومنها 254 زيارة لم تلتزم بالبروتوكول و90 مريضا فُقدت متابعتهم، حُلّل 9,347. وكانت الأعداد 102 إخفاق بين 4,693 مريضا في المجموعة التي استعانت بالأداة (2.2%) و94 بين 4,654 في المجموعة الضابطة (2.0%). وبلغت نسبة الأرجحية المعدلة 0.77، بفاصل ثقة 95% يمتد من 0.55 إلى 1.08 وقيمة P تساوي 0.13.
الأعداد الخام والرقم المعدل يشيران في اتجاهين متعاكسين. فخاما، كان في مجموعة الأداة إخفاقات أكثر قليلا، بينما تعني نسبة أرجحية دون 1 أنها تصب في صالح مجموعة الأداة. ويأتي الرقم المعدل من نموذج يراعي التجميع حسب الموظف السريري والمنشأة، ولا توفّق الورقة بين الاثنين. وأعطت إضافة جنس المريض وعمره ووقت اليوم ويوم الأسبوع نسبة أرجحية قدرها 0.72 (فاصل ثقة 95% من 0.50 إلى 1.03، وقيمة P تساوي 0.07). وأوردت NPR النتيجة على أنها انخفاض بنسبة 23% في إخفاقات العلاج لا يبلغ الدلالة الإحصائية. ونسبة الأرجحية مقياس مختلف عن النسبة المئوية للانخفاض في الإخفاقات.
ويترجم المؤلفون الفاصل إلى لغة بسيطة في المناقشة: بين 13 إخفاقا أقل وإخفاق واحد أكثر لكل 1,000 مريض. وكان تقديرهم المبني على النموذج للفرق في المخاطر أقل بمقدار 0.5 نقطة مئوية في مجموعة الأداة، بفاصل موثوقية 95% يمتد من 1.3 نقطة أقل إلى 0.1 نقطة أكثر.
حيث تفوق الذكاء الاصطناعي
راجعت لجنة 2,000 زيارة لتقييم جودة التوثيق. وكان الأطباء السريريون الذين استعانوا بالأداة أرجح أن يسجلوا تشخيصا مناسبا (نسبة أرجحية معدلة 1.74، فاصل ثقة 95% من 1.28 إلى 2.36) وأن يكتبوا ملاحظة كاملة (1.68، بفاصل من 1.24 إلى 2.27) وأن يضعوا خطة علاج مناسبة (1.71، بفاصل من 1.25 إلى 2.34). وكانت قيم P في الثلاثة كلها أقل من 0.001.
وبقيت مقاييس أخرى ثابتة. فمن بين 826 مريضا شملهم الاستطلاع، لم يختلف الرضا بين المجموعتين، وكان الوسيط الزمني للاستشارة 11 دقيقة في كلتيهما. ونظرة لاحقة على الإنفاق، يشير المؤلفون إلى أنها ليست تأكيدية، وجدت أن تشغيل الأداة كلّف نحو 0.04 دولار لكل مريض وأن متوسط الإنفاق على المضادات الحيوية كان 3.71 دولار في مجموعة الأداة مقابل 3.85 دولار في المجموعة الضابطة.
وراجع الخبراء أيضا 1,000 من التنبيهات الحمراء للمساعد. فقيّموا 49.4% منها آمنة بالتأكيد و42.4% آمنة في الغالب. وكان نحو 3.1% غير آمن إلى حد ما أو غير مناسب و1.1% غير آمن وغير مناسب. واتبع الأطباء السريريون التنبيهات الحمراء كليا في 19.5% من الحالات، وجزئيا في 57.3%، ولم يتبعوها إطلاقا في 23.2%.
لماذا قد لا تعني النتيجة الصفرية انعدام الأثر
صُمّمت التجربة لتكشف تراجعا إلى النصف في إخفاقات العلاج، من 2% إلى 1%، باستخدام نحو 9,000 زيارة. ويقول المؤلفون إنها كانت مهيأة لأثر أكبر من الأثر الذي لوحظ. ويكتبون في المناقشة أن محاكاة لاحقة أشارت إلى أن كشف فروق متواضعة في نتائج نادرة يتطلب أكثر من 100,000 مريض. وقال الدكتور بلال ماتين، وهو من المؤلفين المشاركين وكبير مسؤولي الذكاء الاصطناعي في PATH، لـNPR إن الرقم نحو 139,000.
وكانت دراسة سابقة لـPenda، نُشرت على arXiv في يوليو 2025 بوصفها دراسة لتحسين الجودة، قد نظرت في 39,849 زيارة في 15 عيادة. وقيّم أطباء مستقلون الزيارات بحثا عن أخطاء سريرية، ووجدوا أخطاء تشخيصية أقل بنسبة 16% وأخطاء علاجية أقل بنسبة 13% لدى الأطباء السريريين الذين أتيح لهم AI Consult. وقارنت تلك الدراسة زيارات أطباء يستخدمون الأداة وآخرين لا يستخدمونها. وأضافت التجربة العشوائية متابعة لما حدث للمرضى بعد ذلك، وهنا لم يظهر فرق واضح. أما أشهر انتصارات الذكاء الاصطناعي في علم الأحياء، جائزة نوبل عن AlphaFold، فكانت عن التنبؤ ببنى البروتينات في المختبر، لا عن علاج المرضى.
ما تقول الدراسة نفسها إنها لا تثبته
تسرد المناقشة الحدود بنفسها. لم تُهيأ التجربة لكشف الأضرار الخطيرة النادرة، ولا يثبت غياب الفرق أن المجموعتين كانتا متساويتين في السلامة. ولم يكن هناك إطار سلامة محدد مسبقا. وقعت ثلاث وثلاثون حادثة ضارة خطيرة، 27 حالة دخول مستشفى و6 وفيات، ولم تجد المراجعة المستقلة أيا منها مرتبطا سببيا بالأداة.
وتأتي النتائج من شبكة خاصة حضرية واحدة في نيروبي وقد لا تصدق على العيادات الريفية أو العامة. وكانت معايير Penda عالية أصلا، وهو ما قد يكون ترك مجالا أقل للتحسن. والنتائج مرتبطة بإصدار واحد من GPT-4o، وهي نقطة يصفها المؤلفون بأنها معيار زمني، وقد تكون المتابعة لمدة 14 يوما قصيرة جدا لاكتشاف الآثار اللاحقة. ولم يكن ممكنا تعمية الأطباء السريريين، ولأنهم تشاركوا المنشآت فقد كان تبادل الأفكار غير الرسمي بين المجموعتين ممكنا. ويحاجّ المؤلفون بأن هذا يدفع النتائج نحو انعدام الفرق.
وتعامل المناقشة الصلة بين ملاحظات أفضل ونتائج أفضل للمرضى على أنها افتراض. فالنتيجة الرئيسية لم تتحسن، ولذلك لم تختبر التجربة تلك الخطوة.
من دفع، ومن له مصلحة
موّلت مؤسسة غيتس التجربة، وكانت PATH الجهة الراعية. ويقول بيان تضارب المصالح إن اثنين من المؤلفين، R.K. وS.K.، يملكان خيارات أسهم في Penda Health. وقدّمت OpenAI رصيدا حوسبيا سحابيا وإرشادا تقنيا إلى Penda لبناء AI Consult. ويقول البيان إن قرار استخدام منتج OpenAI سبق ذلك العرض، وإن OpenAI لم يكن لها دور في التصميم أو جمع البيانات أو التحليل أو الكتابة أو قرار النشر.
قراءتان من خارج التجربة
نقلت NPR عن طبيبين لم يشاركا في الدراسة. فوصف الدكتور جوناثان تشين، أستاذ مشارك في الطب وعلوم البيانات الطبية الحيوية في جامعة ستانفورد، الدراسة بأنها مهمة لأنها تتجاوز الاختبارات المحاكاة لأنظمة الذكاء الاصطناعي. وقال إن أكبر مكسب قد يأتي من الوصول إلى الرعاية في الوقت المناسب وبانتظام، مثل المساعدة في صياغة الملاحظات ليتمكن الأطباء السريريون من رؤية مرضى أكثر.
وقدّم الدكتور نيكولاس أوكومو، جراح العظام في مستشفى كينياتا الوطني الذي يبحث في الذكاء الاصطناعي في الرعاية الصحية، الرأي الحذر. وقال لـNPR: “حتى الذكاء الاصطناعي المعتمد يمكن أن يسبب ضررا، لذلك يجب أن تبقى الرقابة فاعلة”.
السياق الهندي
نشر المجلس الهندي للبحوث الطبية (ICMR) إرشاداته الأخلاقية للذكاء الاصطناعي في البحوث الطبية الحيوية والرعاية الصحية في 2023، وهي وثيقة من 76 صفحة صادرة عن وحدة الذكاء الاصطناعي في DHR-ICMR. وفي 20 فبراير 2026 عقد ICMR وICMR-NIRDH جلسة في Bharat Mandapam، ضمن IndiaAI Impact Summit، عن المسار التنظيمي للأجهزة الطبية القائمة على الذكاء الاصطناعي، والجسر بين التدريب والتحقق والتقييم السريري. والبرنامج الوطني مغطى في الهند تبني الذكاء الاصطناعي بلغاتها.
وتجربة هندية واحدة من نوع مماثل مسجلة في ClinicalTrials.gov، وهي تقيس شيئا مختلفا. فقد أُجريت دراسة تجريبية مسجلة برقم NCT07432893 في مقاطعتي بيربهوم وبوروليا في غرب البنغال مع Liver Foundation. وأجرى كل من 736 مريضا استشارتين في زيارة واحدة، بترتيب عشوائي: واحدة مع ممرضة تستخدم أداة ذكاء اصطناعي وواحدة مع طبيب. وقيّم كل استشارة طبيبان مقيّمان بأسلوب التعمية في اليوم نفسه على مقياس للتفكير السريري والتدبير العلاجي. ويدرج السجل الدراسة التجريبية بوصفها مكتملة في 1 أغسطس 2026. ونتيجتها الرئيسية هي جودة الاستشارة لا صحة المريض بعد ذلك، والجهة الراعية لها باحث في HEAL India لا ICMR أو AIIMS.
ولاحظت مراسلة في Nature Medicine في يوليو 2025، بقيادة ماتين، أن حفنة فقط من التجارب العشوائية للذكاء الاصطناعي في الصحة أُجريت في أفريقيا وأن أيا منها لم يختبر أداة ذكاء اصطناعي توليدي.
المصادر وقراءات إضافية
- Nature Medicine: Generative AI-enabled clinical decision support system in primary care, a pragmatic, cluster-randomized trial (Agweyu and others, published 26 June 2026)
- Zenodo: Protocol for the multi-facility pragmatic cluster randomized controlled trial in Nairobi, Kenya (Menon and others, June 2025)
- PATH: PATH launches clinical trial on the use of artificial intelligence in primary health care (11 March 2025)
- Nature Medicine: Trials for LLM-supported clinical decisions in African primary healthcare (Mateen and others, correspondence, 3 July 2025)
- arXiv: AI-based Clinical Decision Support for Primary Care, A Real-World Study (Korom and others, 22 July 2025)
- NPR: This AI tool promises a 'second pair of eyes' to clinicians. Did patients benefit? (Joseph Kim, 23 July 2026, as carried by WOSU)
- NPR: This AI tool promises a 'second sight of eyes' to clinicians. Did patients benefit? (KJZZ carriage of the same report)
- News-Medical: Clinical trial evaluates generative AI support tool in primary care (26 June 2026)
- Indian Council of Medical Research: Ethical guidelines for application of Artificial Intelligence in Biomedical Research and Healthcare (2023)
- Indian Council of Medical Research: IndiaAI Impact Summit session on the regulatory pathway for AI-based medical devices (20 February 2026)
- ClinicalTrials.gov: LLM-enabled nurse treatment planning in 2 Indian districts, a pilot study (NCT07432893)
أُعِدّ هذا المقال وكُتب بمساعدة أدوات الذكاء الاصطناعي، وحُرِّر للتحقق من دقته. وهو للمعلومة العامة والنقاش فقط، وليس مشورة مهنية. راجع معاييرنا التحريرية وإخلاء المسؤولية. وجدت خطأ؟ أخبرنا.
أعجبك المقال؟ احصل على التالي.
مقال جيد واحد في كل مرة، يصلك مباشرة إلى بريدك. بلا رسائل مزعجة، ويمكنك إلغاء الاشتراك متى شئت.