चित्रण: tuput
हिन्दी
जैव-प्रौद्योगिकी विभाग ने 9 जनवरी 2025 को जीनोमइंडिया का डेटा शोधकर्ताओं के लिए खोल दिया। 24 मार्च 2026 को डाला गया एक प्रीप्रिंट गुणवत्ता-जाँच पास करने वाले 9,768 जीनोम का विश्लेषण करता है और 129.93 मिलियन (यानी 12.993 करोड़) वेरिएंट गिनता है, जिनमें से 44.03 मिलियन वैश्विक डेटाबेसों में दर्ज नहीं हैं। डाले जाते समय उसकी सहकर्मी-समीक्षा नहीं हुई थी।
जीनोमइंडिया परियोजना ने 83 आबादी समूहों के 10,074 स्वस्थ वयस्कों का पूरा जीनोम सीक्वेंस किया, और 9 जनवरी 2025 को जैव-प्रौद्योगिकी विभाग (डीबीटी) ने फ़रीदाबाद के इंडियन बायोलॉजिकल डेटा सेंटर (आईबीडीसी) के ज़रिए यह डेटा शोधकर्ताओं के लिए खोल दिया। अमेरिका का नेशनल ह्यूमन जीनोम रिसर्च इंस्टीट्यूट जीनोम को कोशिका में डीएनए के अक्षरों का पूरा सेट बताता है, दोनों विरासत में मिली प्रतियों को गिनें तो क़रीब 6 अरब, और वेरिएंट को वह जगह जहाँ ये अक्षर लोगों के बीच अलग होते हैं।
अब तक का सबसे पूरा विश्लेषण एक प्रीप्रिंट है, यानी सहकर्मी-समीक्षा से पहले डाला गया शोध-पत्र। 24 मार्च 2026 की तारीख़ वाला यह पत्र गुणवत्ता-जाँच पास करने वाले 9,768 लोगों में 129.93 मिलियन (एक मिलियन यानी दस लाख) वेरिएंट बताता है, और कहता है कि इनमें से 44.03 मिलियन वैश्विक डेटाबेसों में पहले दर्ज नहीं थे। इससे पहले की पत्रिका-सामग्री, अप्रैल 2025 की नेचर जेनेटिक्स की एक टिप्पणी, में शुरुआती गिनतियाँ दी गई थीं।
9 जनवरी 2025 को क्या जारी हुआ
नई दिल्ली के विज्ञान भवन में जीनोमिक्स डेटा कॉन्क्लेव में केंद्रीय मंत्री जितेंद्र सिंह ने डेटा के आदान-प्रदान के ढाँचे (फीड, FeED) के प्रोटोकॉल और आईबीडीसी पोर्टल शुरू किए। प्रेस इन्फ़ॉर्मेशन ब्यूरो की विज्ञप्ति के मुताबिक़ इससे 10,000 पूरे जीनोम के नमूने भारत और विदेश के शोधकर्ताओं की पहुँच में आ गए। सिंह ने कहा कि यह संग्रह “अब न सिर्फ़ भारत के भीतर, बल्कि दुनिया भर में शोध के लिए उपलब्ध कराया गया है।”
प्रधानमंत्री नरेंद्र मोदी ने वीडियो संदेश भेजा। उन्होंने कहा कि परियोजना को पाँच साल पहले मंज़ूरी मिली थी और इसमें 20 से ज़्यादा संस्थान शामिल हैं, जिनमें आईआईएससी, आईआईटी, सीएसआईआर और बीआरआईसी हैं। डेटा किस बात का हल निकाल सकता है, इसके लिए उनका उदाहरण आदिवासी समुदायों में सिकल सेल एनीमिया था: एक इलाक़े की समस्या दूसरे से अलग हो सकती है, उन्होंने कहा, और यह सिर्फ़ पूरा आनुवंशिक अध्ययन ही बता सकता है।
परियोजना के एफ़एक्यू के मुताबिक़ इसकी कल्पना 2017 के आख़िर में हुई और यह जनवरी 2020 में शुरू हुई, जिसमें आईआईएससी बेंगलुरु का सेंटर फ़ॉर ब्रेन रिसर्च समन्वयक है।
संख्या 99 नहीं, 83 क्यों है
दो आँकड़े घूम रहे हैं। पीआईबी द्वारा 19 मार्च 2025 को जारी लोकसभा उत्तर के मुताबिक़ डीबीटी ने “99 अलग-अलग जगहों की 83 विविध आबादियों” के 10,074 स्वस्थ व्यक्तियों का संसाधन तैयार किया। 83 समूहों को गिनता है और 99 उन जगहों को जहाँ से नमूने लिए गए।
टिप्पणी में बनावट की व्याख्या है। 83 समूहों में 30 आदिवासी हैं और 53 ग़ैर-आदिवासी। भारत में भाषा आनुवंशिक विविधता की एक मोटी पहचान है, इसलिए टीम ने पक्का किया कि चारों बड़े भाषा-परिवार (भारोपीय, द्रविड़, ऑस्ट्रो-एशियाटिक और तिब्बती-बर्मी) शामिल हों, और हर क्षेत्र के भीतर अलग-अलग जैव-भौगोलिक इलाक़ों के समूह चुने। उसने हर ग़ैर-आदिवासी समूह से औसतन (मीडियन) 159 आपस में असंबंधित लोगों को और हर आदिवासी समूह से 75 को सीक्वेंस किया, साथ में हर समूह से माता-पिता और बच्चे की कुछ तिकड़ियाँ।
प्रतिभागी स्वघोषित स्वस्थ वयस्क थे, जिन्हें कोई पहचाना हुआ एकल-जीन रोग या गुणसूत्र की विकृति नहीं थी। टिप्पणी 20,459 सहमति देने वाले स्वयंसेवकों की बात करती है, जबकि प्रीप्रिंट और एफ़एक्यू 20,195 कहते हैं। 13,242 नमूनों पर चली एक जीनोटाइपिंग ऐरे ने ऐसे लोग चुनने में मदद की जो एक-दूसरे से पहले चचेरे रिश्ते से आगे असंबंधित हों, और 10,074 को सीक्वेंस किया गया, मुख्यतः चार केंद्रों पर। गुणवत्ता-नियंत्रण के बाद टिप्पणी 9,772 जीनोम गिनती है और प्रीप्रिंट 9,768। लोकसभा उत्तर नमूने का मिश्रण इस तरह देता है: 36.7 प्रतिशत ग्रामीण, 32.2 प्रतिशत शहरी और 31.1 प्रतिशत आदिवासी।
129.93 मिलियन वेरिएंट का मतलब
प्रीप्रिंट के मुताबिक़ सीक्वेंसिंग क़रीब 30 गुना कवरेज पर हुई, यानी हर स्थिति को लगभग 30 बार पढ़ा गया। उसे 129,938,889 उच्च-भरोसे वाले वेरिएंट मिलते हैं, जिनमें क़रीब 121 मिलियन एक अक्षर वाले बदलाव हैं और 8 मिलियन छोटे जोड़ या हटाव। क़रीब 59 मिलियन सिंगलटन हैं, यानी पूरे समूह में सिर्फ़ एक बार दिखे। एक से ज़्यादा बार दिखने वाले 70.74 मिलियन वेरिएंटों में से 11.94 मिलियन (9.19 प्रतिशत) वैश्विक डेटाबेसों में दर्ज नहीं हैं।
यानी 44.03 मिलियन की सुर्ख़ी में एक ही व्यक्ति में मिले वेरिएंट भी शामिल हैं। 4 मई 2026 को रिपोर्ट करते हुए नेचर इंडिया कहता है कि क़रीब 44 मिलियन जीनोमएडी (gnomAD, वेरिएंटों का एक बड़ा सार्वजनिक डेटाबेस), 1000 जीनोम प्रोजेक्ट और जीनोमएशिया में नहीं हैं। टिप्पणी के पहले के आँकड़े छँटाई से पहले क़रीब 180 मिलियन कच्चे वेरिएंट थे, और उसके बाद ऑटोसोम (सेक्स क्रोमोसोम को छोड़कर बाक़ी गुणसूत्र) पर क़रीब 130 मिलियन।
आदिवासी समूह, संस्थापक प्रभाव और नीलगिरि
प्रीप्रिंट के प्रिंसिपल कंपोनेंट विश्लेषण में, जो लोगों को समग्र आनुवंशिक समानता के हिसाब से छाँटता है, आदिवासी ऑस्ट्रो-एशियाटिक, द्रविड़ और तिब्बती-बर्मी समूह सघन, अलग-अलग गुच्छे बनाते हैं। ग़ैर-आदिवासी भारोपीय और द्रविड़ समूह उत्तर से दक्षिण तक एक मोटे ढलान पर एक-दूसरे पर चढ़ते हैं। अकेली देशांतर रेखा पहले घटक का अनुमान 0.43 के समायोजित R-वर्ग के साथ लगाती है और अक्षांश दूसरे का 0.30 के साथ। भाषा और जैव-भूगोल जोड़ने पर मॉडल क्रमशः 84 प्रतिशत और 78 प्रतिशत पर पहुँच जाता है। विश्लेषण में वंश के चार मोटे घटक मिलते हैं और एक पाँचवाँ नीलगिरि की पहाड़ियों के दो अलग-थलग द्रविड़ आदिवासी समूहों के लिए।
अंतर्विवाह, यानी अपने ही समुदाय के भीतर विवाह, होमोज़ाइगोसिटी के विस्तारों (runs of homozygosity) में निशान छोड़ता है, यानी डीएनए की वे लंबी पट्टियाँ जहाँ साझा हाल के पूर्वजों के कारण दोनों विरासत में मिली प्रतियाँ एक जैसी होती हैं। प्रीप्रिंट के मुताबिक़ 83 में से 59 आबादियों में इन विस्तारों की औसत लंबाई 1.5 सेंटीमॉर्गन की अंतर्विवाह-सीमा (सेंटीमॉर्गन आनुवंशिक दूरी की एक इकाई है) से उल्लेखनीय रूप से ऊपर रही। नीलगिरि के दो समूहों के लिए लेखक कहते हैं कि विस्तारों की संख्या दुनिया में सबसे ऊँची में गिनी जाती है और अश्केनाज़ी यहूदी और फ़िनिश स्तर से पाँच गुना से ज़्यादा है। लेखक लिखते हैं कि उनके निष्कर्ष “हाल के अंतर्विवाह को एक प्रमुख ताक़त के रूप में दिखाते हैं।”
संस्थापक प्रभाव का मतलब है कि एक छोटे पूर्वज-समूह से बहुत सारे वंशज निकले, इसलिए जो वेरिएंट कहीं और दुर्लभ है वह यहाँ आम हो सकता है। प्रीप्रिंट को एचजीडी (HGD) जीन में एक स्प्लाइस-साइट वेरिएंट मिलता है, जो जीनोमएडी, 1000 जीनोम प्रोजेक्ट और जीनोमएशिया में नहीं है, और दक्षिण की एक आदिवासी आबादी में 12.5 प्रतिशत पर है। नेचर इंडिया एचजीडी को एल्कैप्टोन्यूरिया से जोड़ता है, जो एक दुर्लभ चयापचय विकार है। प्रीप्रिंट जिन रोगकारक वेरिएंटों को गिनता है उन्हें ढोने वाले व्यक्तियों का हिस्सा आदिवासी आबादियों में 17.5 प्रतिशत और ग़ैर-आदिवासी में 5.5 प्रतिशत बताता है। सिकल-सेल वेरिएंट rs334 कई आदिवासी आबादियों में 5 प्रतिशत से ऊपर रहा।
एफ़एक्यू कहता है कि परियोजना व्यक्तियों के बजाय आबादियों का विश्लेषण करके कलंक से बचती है, और नतीजे समुदायों के बीच सीधे जैविक बँटवारों का समर्थन नहीं करते, क्योंकि ज़्यादातर समूह अतीत के मेल-जोल से वंश साझा करते हैं।
डेटा से क्या बनाना है
पीआईबी की विज्ञप्ति के मुताबिक़ डेटा से भारतीय आबादियों के अनुरूप जीनोटाइपिंग चिप बनाई जा सकेंगी। सिंह ने एमआरएनए टीके, प्रोटीन निर्माण और आनुवंशिक रोगों के इलाज को ऐसे क्षेत्र गिनाए जहाँ यह डेटा काम आ सकता है, उस दवा-निर्माण आधार के साथ जिसकी चर्चा भारत दुनिया की फ़ार्मेसी कैसे बना में है।
प्रीप्रिंट का ठोस उत्पाद एक इंप्यूटेशन पैनल है, यानी पूरी तरह सीक्वेंस किए गए जीनोमों का एक संदर्भ, जिससे उन लोगों के बिना जाँचे अक्षर भरे जाते हैं जिन्हें सिर्फ़ सस्ती ऐरे पर चलाया गया था। 9,768 फ़ेज़्ड जीनोमों से बना और यूके बायोबैंक के 7,628 दक्षिण एशियाई वंश के प्रतिभागियों के ऐरे डेटा पर परखा गया यह पैनल औसत इंप्यूटेशन गुणवत्ता को जीनोमएशिया पैनल से 45 प्रतिशत, हैप्लोटाइप रेफ़रेंस कंसॉर्टियम पैनल से 20 प्रतिशत और टॉपएमईडी से 9 प्रतिशत बेहतर करता है।
वह पॉलीजेनिक स्कोर भी परखता है, जो कई छोटे आनुवंशिक असरों को जोड़कर एक जोखिम-अनुमान बनाते हैं। यूरोपीय वंश के अध्ययनों से बने स्कोर ने जीनोमइंडिया में क़द की 14.8 प्रतिशत भिन्नता समझाई, जबकि यूके बायोबैंक के भारतीयों में 11.2 प्रतिशत, पर बीएमआई की भिन्नता का सिर्फ़ 0.7 प्रतिशत, जबकि वहाँ 9.7 प्रतिशत। लेखक बीएमआई के इस अंतर को आनुवंशिक दूरी और पर्यावरण के फ़र्क़ से जोड़ते हैं। भारत में मधुमेह के जोखिम के अपने पर्यावरणीय और शुरुआती-जीवन के सूत्र हैं, जिन्हें पुणे के उस शोध में देखा गया है जो मधुमेह के पीढ़ी-दर-पीढ़ी पहुँचने की बात करता है।
दवा के असर के मामले में प्रीप्रिंट समूह-स्तर की ऐलील आवृत्तियाँ बताता है, जैसे ऑस्ट्रो-एशियाटिक समूहों में एनयूडीटी15 (NUDT15) के जोखिम वाले ऐलील 20.8 प्रतिशत तक। वह किसी व्यक्ति के इलाज को नहीं परखता। निमहांस की मीरा पुरुषोत्तम ने नेचर इंडिया से कहा कि ऐसे पैनलों का दवा चुनने और खुराक तय करने पर असर साफ़ नहीं है और इन्हें अपनाने में सावधानी बरतनी चाहिए।
डेटा किसे मिल सकता है, और किस रूप में
प्रीप्रिंट के मुताबिक़ ऐलील आवृत्ति के सारांश आँकड़े आईबीडीसी के ज़रिए सार्वजनिक हैं। कच्चा सीक्वेंसिंग डेटा प्रतिभागियों की सहमति से जुड़े निजता-क़ानूनों के कारण नियंत्रित पहुँच में है, और असली शोधकर्ताओं को डेटा मैनेजमेंट ग्रुप को प्रस्तावित शोध बताने वाला अनुरोध भेजना होता है, और मंज़ूरी ज़रूरी है।
पीआईबी की 30 अप्रैल 2025 की विज्ञप्ति, जो अख़बारी रिपोर्टों के जवाब में लिखी गई, बताती है कि आईबीडीसी के पास क्या है: 9,772 नमूनों की एफ़एएसटीक्यू (FASTQ) फ़ाइलें (कच्चे रीड) क़रीब 700 टीबी की, 9,772 नमूनों की जीवीसीएफ़ (gVCF) फ़ाइलें (हर व्यक्ति के वेरिएंट-कॉल) क़रीब 35 टीबी की, क़रीब 3.5 टीबी की जॉइंट कॉल फ़ाइलें, और 9,330 नमूनों का फ़ीनोटाइप डेटा। विज्ञप्ति के मुताबिक़ डीबीटी के आह्वान के तहत एफ़एएसटीक्यू फ़ाइलें फ़िलहाल डाउनलोड के लिए नहीं हैं, उनके आकार के कारण, और इसलिए भी कि कच्ची फ़ाइलों के विश्लेषण में दो से तीन गुना कंप्यूटिंग लगती है। फ़ीनोटाइप डेटा में 27 रक्त-मापदंड हैं, जैसे हीमोग्लोबिन और कोलेस्ट्रॉल, साथ में उम्र, लिंग, क़द, वज़न और शरीर की चर्बी। 442 नमूनों के लिए डेटा इस्तेमाल लायक़ नहीं था। पहुँच डीबीटी के ट्रांसलेशनल शोध वाले आह्वान तक सीमित नहीं है, और बायोटेक-प्राइड दिशानिर्देश (2021) और फीड प्रोटोकॉल के तहत स्वतंत्र अनुरोध भी स्वीकार होते हैं।
स्रोत पूरी तरह एकमत नहीं हैं। बाद का प्रीप्रिंट कच्चे सीक्वेंसिंग डेटा को नियंत्रित पहुँच में उपलब्ध बताता है, इसलिए कच्चे रीड के नियम आईबीडीसी से पक्के कर लेना ठीक रहेगा। एफ़एक्यू आईबीडीसी में 9,648 नमूनों का सीक्वेंसिंग डेटा गिनाता है, जहाँ पीआईबी 9,772 बताता है।
डेटासेट क्या नहीं दिखा सकता
प्रीप्रिंट कहता है कि उसके 9,768 लोग भारत को पूरी तरह नहीं समेटते और बड़ी ग़ैर-आदिवासी आबादियों के और नमूने लेने की माँग करता है। टिप्पणी भारत में 4,600 से ज़्यादा अंतर्विवाही समूह गिनती है, जिनमें से जीनोमइंडिया 83 को कवर करता है।
प्रतिभागी स्वस्थ थे, इसलिए नेचर इंडिया ध्यान दिलाता है कि बीमारी से जुड़ाव अनुमान से निकाले जाते हैं, और कई लॉस-ऑफ़-फ़ंक्शन वेरिएंट शायद हानिरहित हों। नॉर्थईस्टर्न यूनिवर्सिटी के सुधाकरन प्रभाकरन ने उसे बताया कि विश्लेषण प्रोटीन-कोडिंग जीनों को कवर करता है, जो जीनोम का क़रीब 2 प्रतिशत हैं। टिप्पणी ने कहा था कि विश्लेषण जारी है और एक विस्तृत पांडुलिपि तैयार की जा रही है। 8 अक्टूबर 2026 तक tuput को एटलस का कोई पत्रिका-संस्करण नहीं मिला।
पत्राचार के लिए ज़िम्मेदार लेखकों में से एक अनलभ बसु ने नेचर इंडिया से इस काम को एक शुरुआती बिंदु बताया और कहा कि इसे क्लिनिकल प्रैक्टिस में उतारने के लिए और काम चाहिए।
स्रोत और आगे पढ़ने के लिए
- PIB (Ministry of Science and Technology), 9 January 2025: India Takes a Giant Leap in Genomics, Launch of Indian Genomic Data Set and IBDC Portals
- PIB (Prime Minister's Office), 9 January 2025: English rendering of PM's remarks at the start of GenomeIndia Project
- PIB, 19 March 2025: Parliament question on the Indian Biological Data Centre (Lok Sabha reply)
- PIB, 30 April 2025: GenomeIndia, access to the national genetic resource
- Bhattacharyya C et al., Mapping genetic diversity with the GenomeIndia project, Nature Genetics 57, 767 to 773 (2025), a Comment by the GenomeIndia Consortium
- NCBS repository record for the Nature Genetics comment (volume, issue, pages, PubMed ID 40200122)
- Subramanian K, Bhattacharyya C et al., An Atlas of Indian Genetic Diversity, medRxiv preprint, posted 24 March 2026 (not certified by peer review)
- GenomeIndia project: Frequently asked questions
- Nature India (Sahana Ghosh), 4 May 2026: India's DNA map uncovers millions of missing genetic variants
- US National Human Genome Research Institute: Genomic data science fact sheet
यह लेख AI उपकरणों की सहायता से शोधित और लिखा गया है, और सटीकता के लिए संपादित किया गया है। यह केवल सामान्य जानकारी और चर्चा के लिए है, पेशेवर सलाह नहीं। हमारे संपादकीय मानक और अस्वीकरण देखें। कोई त्रुटि मिली? हमें बताएँ।
अच्छा लगा? अगला लेख पाएँ।
एक बार में एक अच्छा लेख, सीधे आपके इनबॉक्स में। कोई स्पैम नहीं, जब चाहें अनसब्सक्राइब करें।