चित्रण: tuput
हिन्दी
16 पेंडा हेल्थ क्लिनिकों में, अपने रिकॉर्ड सिस्टम में GPT-4o सहायक वाले चिकित्सकों के 2.2% मरीज़ों में इलाज विफल रहा, जबकि उसके बिना 2.0% में। स्वतंत्र पैनल ने फिर भी सहायता वाले नोट्स, निदान और इलाज की योजनाओं को बेहतर आँका।
केन्या में हुए एक यादृच्छिक परीक्षण में, जब चिकित्सकों ने अपने मरीज़ रिकॉर्ड में बने AI सहायक का इस्तेमाल किया, तो इलाज की विफलताओं में सांख्यिकीय रूप से सार्थक गिरावट नहीं मिली। विज़िट के 14 दिन के भीतर सहायता वाले चिकित्सकों द्वारा देखे गए 2.2% मरीज़ों में इलाज विफल रहा, जबकि बिना सहायता वालों के 2.0% में। यह शोधपत्र 26 जून 2026 को नेचर मेडिसिन में छपा, और इसके लेखक निष्कर्ष निकालते हैं कि उपकरण सुरक्षित था और कोई भी फ़ायदा संभवतः मामूली है।
उसी परीक्षण में यह भी मिला कि सहायक ने एक और चीज़ सुधारी: चिकित्सकों के लिखे और तय किए की गुणवत्ता, जैसा डॉक्टरों के एक पैनल ने आँका।
क्या परखा गया और कैसे
उपकरण का नाम AI कंसल्ट है। यह पेंडा हेल्थ के इलेक्ट्रॉनिक मेडिकल रिकॉर्ड के भीतर OpenAI का GPT-4o (मई 2025 का संस्करण) चलाता है। पेंडा हेल्थ नैरोबी और कियाम्बू काउंटियों में प्राथमिक चिकित्सा क्लिनिकों का एक नेटवर्क है। जब चिकित्सक विज़िट के नोट्स लिखता है, तो यह उन्हें पढ़कर हरे, पीले या लाल अलर्ट से समस्याओं की ओर इशारा करता है। चिकित्सकों के लिए इसकी बात मानना ज़रूरी नहीं था, और मरीज़ों ने इसकी स्क्रीन कभी नहीं देखी। यह व्यवस्था स्वायत्त डॉक्टर से ज़्यादा एक सर्जिकल रोबोट जैसी है जिसे इंसान चलाता है: हर फ़ैसले की ज़िम्मेदारी चिकित्सक की ही रहती है।
यह एक व्यावहारिक क्लस्टर-यादृच्छिक परीक्षण था: यह रोज़मर्रा की देखभाल के भीतर चला, और यादृच्छिक रूप से बाँटी गई इकाइयाँ चिकित्सक थे, मरीज़ नहीं। पेंडा की सोलह सुविधाओं ने हिस्सा लिया। कुल 103 क्लिनिकल ऑफ़िसर, यानी मरीज़ों को देखने वाले चिकित्सक, बाँटे गए: 52 उपकरण के साथ और 51 उसी रिकॉर्ड सिस्टम के साथ, उपकरण बंद करके। नामांकन 22 अप्रैल से 16 जुलाई 2025 तक चला।
परीक्षण पैन अफ़्रीकन क्लिनिकल ट्रायल्स रजिस्ट्री (PACTR202502499779176) में पंजीकृत है, और उसका प्रोटोकॉल, जून 2025 का संस्करण 2, एक खुले शोध संग्रह ज़ेनोडो पर सार्वजनिक है। PATH, वह वैश्विक स्वास्थ्य गैर-लाभकारी संस्था जिसने अध्ययन को प्रायोजित किया, ने 11 मार्च 2025 को परीक्षण की घोषणा की थी और 2025 के अंत तक नतीजों की उम्मीद जताई थी।
प्राथमिक नतीजा
पहले से तय मुख्य परिणाम नामांकन के 14 दिन के भीतर इलाज की विफलता था। यह छह पारिवारिक चिकित्सकों के पैनल द्वारा आँका गया एक मिश्रित पैमाना था, जिसमें हर मामले को दो देखते थे और असहमति तीसरा निपटाता था। विफलता तब गिनी गई जब मरीज़ अनसुलझे लक्षणों के साथ लौटा, उच्च स्तर की या आपातकालीन देखभाल में अनियोजित रूप से भेजा गया, या कोई सुरक्षा घटना हुई जैसे छूटा हुआ निदान, अनुचित नुस्ख़ा या मृत्यु। फ़ॉलो-अप फ़ोन से हुआ, तीसरे और 14वें दिन।
सार (एब्स्ट्रैक्ट) के अनुसार जाँचे गए 17,626 में से 9,691 मरीज़ नामांकित हुए। बहिष्करणों के बाद, जिनमें प्रोटोकॉल के पालन न होने के 254 मामले और 90 मरीज़ शामिल थे जिनसे संपर्क टूट गया, 9,347 का विश्लेषण हुआ। गिनतियाँ थीं: सहायता वाले समूह में 4,693 मरीज़ों में 102 विफलताएँ (2.2%) और नियंत्रण समूह में 4,654 में 94 (2.0%)। समायोजित ऑड्स रेशियो 0.77 था, 95% विश्वास अंतराल 0.55 से 1.08 और P मान 0.13।
कच्ची गिनतियाँ और समायोजित आँकड़ा उलटी दिशाओं में इशारा करते हैं। कच्चे रूप में सहायता वाले समूह में विफलताएँ थोड़ी ज़्यादा थीं, जबकि 1 से नीचे का ऑड्स रेशियो सहायता वाले समूह के पक्ष में होता है। समायोजित आँकड़ा एक ऐसे मॉडल से आता है जो क्लिनिकल ऑफ़िसर और सुविधा के हिसाब से क्लस्टरिंग का ध्यान रखता है, और शोधपत्र दोनों में मेल नहीं बिठाता। मरीज़ का लिंग, उम्र, दिन का समय और सप्ताह का दिन जोड़ने पर ऑड्स रेशियो 0.72 आया (95% विश्वास अंतराल 0.50 से 1.03, P = 0.07)। NPR ने नतीजे को इलाज की विफलताओं में 23% की गिरावट बताया जो सांख्यिकीय रूप से सार्थक नहीं थी। ऑड्स रेशियो विफलताओं में प्रतिशत गिरावट से अलग माप है।
लेखक अपनी चर्चा में अंतराल को सीधे शब्दों में रखते हैं: प्रति 1,000 मरीज़ों पर इलाज की 13 विफलताएँ कम से लेकर 1 ज़्यादा तक। जोखिम-अंतर का उनका मॉडल-आधारित अनुमान सहायता वाले समूह में 0.5 प्रतिशत अंक कम था, 95% विश्वसनीय अंतराल 1.3 अंक कम से 0.1 अंक ज़्यादा तक।
जहाँ AI बेहतर रहा
एक समीक्षा पैनल ने दस्तावेज़ीकरण की गुणवत्ता के लिए 2,000 मुलाक़ातें जाँचीं। सहायता वाले चिकित्सकों के उपयुक्त निदान दर्ज करने की संभावना ज़्यादा थी (समायोजित ऑड्स रेशियो 1.74, 95% विश्वास अंतराल 1.28 से 2.36), पूरा नोट लिखने की (1.68, 1.24 से 2.27) और उपयुक्त इलाज की योजना रखने की (1.71, 1.25 से 2.34)। तीनों के P मान 0.001 से नीचे थे।
दूसरे माप सपाट रहे। सर्वे किए गए 826 मरीज़ों में संतुष्टि दोनों समूहों में अलग नहीं थी, और परामर्श का औसत समय दोनों में 11 मिनट था। ख़र्च पर एक पश्च-विश्लेषण (पोस्ट हॉक) में, जिसे लेखक पुष्टिकारक नहीं बताते, पाया गया कि उपकरण चलाने की लागत लगभग $0.04 प्रति मरीज़ थी और एंटीबायोटिक पर औसत ख़र्च सहायता वाले समूह में $3.71 बनाम नियंत्रण समूह में $3.85 था।
विशेषज्ञों ने सहायक के 1,000 लाल अलर्ट की भी समीक्षा की। उन्होंने 49.4% को निश्चित रूप से सुरक्षित और 42.4% को ज़्यादातर सुरक्षित आँका। लगभग 3.1% कुछ हद तक असुरक्षित या अनुचित थे और 1.1% असुरक्षित और अनुचित। चिकित्सकों ने 19.5% मामलों में लाल अलर्ट का पूरा पालन किया, 57.3% में आंशिक और 23.2% में बिल्कुल नहीं।
शून्य नतीजे का मतलब असर का न होना क्यों नहीं भी हो सकता
परीक्षण का आकार इलाज की विफलताओं के आधा हो जाने, यानी 2% से 1% पर आने, का पता लगाने के लिए तय किया गया था, लगभग 9,000 मुलाक़ातों के साथ। लेखक कहते हैं कि इसकी शक्ति देखे गए असर से बड़े असर के लिए थी। चर्चा में वे लिखते हैं कि पश्च-विश्लेषण सिमुलेशनों से संकेत मिला कि दुर्लभ परिणामों में मामूली अंतर का पता लगाने के लिए 100,000 से ज़्यादा मरीज़ चाहिए होंगे। सह-लेखक और PATH के मुख्य AI अधिकारी डॉ. बिलाल मातीन ने NPR को बताया कि यह आँकड़ा लगभग 139,000 है।
जुलाई 2025 में arXiv पर गुणवत्ता-सुधार अध्ययन के रूप में डाले गए पेंडा के एक पुराने अध्ययन ने 15 क्लिनिकों की 39,849 विज़िटों को देखा। स्वतंत्र चिकित्सकों ने विज़िटों को क्लिनिकल त्रुटियों के लिए आँका और AI कंसल्ट तक पहुँच वाले चिकित्सकों में निदान की त्रुटियाँ 16% और इलाज की त्रुटियाँ 13% कम पाईं। उस अध्ययन ने उपकरण वाले और उपकरण के बिना चिकित्सकों की विज़िटों की तुलना की थी। यादृच्छिक परीक्षण ने यह जोड़ा कि मरीज़ों के साथ बाद में क्या हुआ, और वहीं कोई साफ़ अंतर नहीं दिखा। जीव-विज्ञान में AI की सबसे मशहूर जीत, AlphaFold का नोबेल, प्रयोगशाला में प्रोटीन की संरचना का अनुमान लगाने के लिए थी, मरीज़ों का इलाज करने के लिए नहीं।
लेखक क्या कहते हैं कि अध्ययन नहीं दिखाता
चर्चा ख़ुद सीमाएँ गिनाती है। परीक्षण दुर्लभ गंभीर नुक़सानों के लिए सक्षम नहीं था, और अंतर न मिलने से यह साबित नहीं होता कि दोनों समूह बराबर सुरक्षित थे। कोई पहले से तय सुरक्षा ढाँचा नहीं था। तैंतीस गंभीर प्रतिकूल घटनाएँ हुईं, 27 अस्पताल में भर्ती और 6 मौतें, और स्वतंत्र समीक्षा ने किसी को उपकरण से कारण-रूप में जुड़ा नहीं पाया।
नतीजे नैरोबी के एक अकेले निजी, शहरी नेटवर्क से आए हैं और ग्रामीण या सरकारी क्लिनिकों में शायद लागू न हों। पेंडा के मानक पहले से ऊँचे थे, जिससे सुधार की गुंजाइश कम रही हो सकती है। नतीजे GPT-4o के एक संस्करण से बँधे हैं, जिसे लेखक कालिक बेंचमार्क कहते हैं, और 14 दिन का फ़ॉलो-अप आगे के असर के लिए छोटा हो सकता है। चिकित्सकों से यह छिपाया नहीं जा सकता था कि वे किस समूह में हैं, और चूँकि वे सुविधाएँ साझा करते थे, इसलिए समूहों के बीच विचारों का अनौपचारिक आदान-प्रदान संभव था। लेखकों का तर्क है कि इससे नतीजे अंतर न होने की ओर खिसकेंगे।
चर्चा बेहतर नोट्स से बेहतर मरीज़ नतीजों तक के संबंध को एक धारणा मानती है। प्राथमिक परिणाम नहीं सुधरा, इसलिए परीक्षण ने उस कड़ी को परखा ही नहीं।
किसने पैसा दिया, और किसका हित है
गेट्स फ़ाउंडेशन ने परीक्षण को पैसा दिया, PATH प्रायोजक रहा। हितों के टकराव का बयान कहता है कि दो लेखकों, R.K. और S.K., के पास पेंडा हेल्थ के स्टॉक ऑप्शन हैं। OpenAI ने पेंडा को AI कंसल्ट बनाने के लिए क्लाउड कंप्यूट क्रेडिट और तकनीकी मार्गदर्शन दिया। बयान कहता है कि OpenAI के उत्पाद को इस्तेमाल करने का फ़ैसला उस पेशकश से पहले का था, और OpenAI की डिज़ाइन, डेटा संग्रह, विश्लेषण, लेखन या प्रकाशन के फ़ैसले में कोई भूमिका नहीं थी।
परीक्षण के बाहर से दो राय
NPR ने दो ऐसे चिकित्सकों को उद्धृत किया जो इसमें शामिल नहीं थे। स्टैनफ़र्ड विश्वविद्यालय में चिकित्सा और बायोमेडिकल डेटा विज्ञान के एसोसिएट प्रोफ़ेसर डॉ. जोनाथन चेन ने अध्ययन को महत्वपूर्ण कहा क्योंकि यह AI प्रणालियों के सिम्युलेटेड परीक्षणों से आगे जाता है। उन्होंने कहा कि सबसे बड़ा फ़ायदा देखभाल तक समय पर और एकसार पहुँच से आ सकता है, जैसे नोट्स का मसौदा बनाने में मदद, ताकि चिकित्सक ज़्यादा मरीज़ देख सकें।
केन्याटा नेशनल हॉस्पिटल के अस्थि-शल्य चिकित्सक और स्वास्थ्य-सेवा AI पर शोध करने वाले डॉ. निकोलस ओकुमु ने सतर्क राय दी। उन्होंने NPR से कहा, “जो AI मंज़ूर हो चुका है, वह भी नुक़सान कर सकता है, इसलिए निगरानी सक्रिय रहनी चाहिए।”
भारत का संदर्भ
भारतीय आयुर्विज्ञान अनुसंधान परिषद (ICMR) ने जैव-चिकित्सा अनुसंधान और स्वास्थ्य सेवा में AI के लिए अपने नैतिक दिशानिर्देश 2023 में प्रकाशित किए, DHR-ICMR आर्टिफ़िशियल इंटेलिजेंस सेल का 76 पृष्ठों का दस्तावेज़। 20 फ़रवरी 2026 को ICMR और ICMR-NIRDH ने भारत मंडपम में, इंडिया AI इम्पैक्ट समिट के हिस्से के रूप में, AI-आधारित चिकित्सा उपकरणों के नियामक रास्ते, यानी प्रशिक्षण, सत्यापन और क्लिनिकल मूल्यांकन को जोड़ने, पर एक सत्र किया। राष्ट्रीय कार्यक्रम भारत अपनी भाषाओं में AI बना रहा है में है।
इसी तरह का एक भारतीय परीक्षण ClinicalTrials.gov पर पंजीकृत है, और वह कुछ अलग मापता है। NCT07432893 के रूप में पंजीकृत एक पायलट पश्चिम बंगाल के बीरभूम और पुरुलिया ज़िलों में लिवर फ़ाउंडेशन के साथ चला। 736 मरीज़ों में से हर एक के एक ही विज़िट में दो परामर्श हुए, यादृच्छिक क्रम में: एक AI उपकरण इस्तेमाल करती नर्स के साथ, एक चिकित्सक के साथ। दो अंधे (ब्लाइंडेड) चिकित्सक ग्रेडरों ने उसी दिन हर परामर्श को क्लिनिकल तर्क और प्रबंधन की रूब्रिक पर अंक दिए। रिकॉर्ड पायलट को 1 अगस्त 2026 को पूर्ण दर्ज करता है। इसका प्राथमिक परिणाम परामर्श की गुणवत्ता है, बाद में मरीज़ की सेहत नहीं, और इसका प्रायोजक ICMR या AIIMS नहीं, बल्कि HEAL इंडिया का एक शोधकर्ता है।
जुलाई 2025 में नेचर मेडिसिन में मातीन की अगुवाई वाले एक पत्राचार ने ध्यान दिलाया कि अफ़्रीका में स्वास्थ्य के लिए AI के केवल मुट्ठी भर यादृच्छिक परीक्षण हुए थे और किसी ने भी जनरेटिव AI उपकरण को नहीं परखा था।
स्रोत और आगे पढ़ने के लिए
- Nature Medicine: Generative AI-enabled clinical decision support system in primary care, a pragmatic, cluster-randomized trial (Agweyu and others, published 26 June 2026)
- Zenodo: Protocol for the multi-facility pragmatic cluster randomized controlled trial in Nairobi, Kenya (Menon and others, June 2025)
- PATH: PATH launches clinical trial on the use of artificial intelligence in primary health care (11 March 2025)
- Nature Medicine: Trials for LLM-supported clinical decisions in African primary healthcare (Mateen and others, correspondence, 3 July 2025)
- arXiv: AI-based Clinical Decision Support for Primary Care, A Real-World Study (Korom and others, 22 July 2025)
- NPR: This AI tool promises a 'second pair of eyes' to clinicians. Did patients benefit? (Joseph Kim, 23 July 2026, as carried by WOSU)
- NPR: This AI tool promises a 'second sight of eyes' to clinicians. Did patients benefit? (KJZZ carriage of the same report)
- News-Medical: Clinical trial evaluates generative AI support tool in primary care (26 June 2026)
- Indian Council of Medical Research: Ethical guidelines for application of Artificial Intelligence in Biomedical Research and Healthcare (2023)
- Indian Council of Medical Research: IndiaAI Impact Summit session on the regulatory pathway for AI-based medical devices (20 February 2026)
- ClinicalTrials.gov: LLM-enabled nurse treatment planning in 2 Indian districts, a pilot study (NCT07432893)
यह लेख AI उपकरणों की सहायता से शोधित और लिखा गया है, और सटीकता के लिए संपादित किया गया है। यह केवल सामान्य जानकारी और चर्चा के लिए है, पेशेवर सलाह नहीं। हमारे संपादकीय मानक और अस्वीकरण देखें। कोई त्रुटि मिली? हमें बताएँ।
अच्छा लगा? अगला लेख पाएँ।
एक बार में एक अच्छा लेख, सीधे आपके इनबॉक्स में। कोई स्पैम नहीं, जब चाहें अनसब्सक्राइब करें।