చిత్రణ: tuput
తెలుగు
బయోటెక్నాలజీ విభాగం 2025 జనవరి 9న జీనోమ్ఇండియా డేటాను పరిశోధకులకు తెరిచింది. 2026 మార్చి 24న పోస్ట్ చేసిన ఒక ప్రీప్రింట్, నాణ్యత పరీక్షల్లో నెగ్గిన 9,768 జీనోమ్లను విశ్లేషించి 12.993 కోట్ల వేరియంట్లను నివేదించింది, వాటిలో 4.403 కోట్లు ప్రపంచ డేటాబేస్లలో లేవు. పోస్ట్ చేసిన సమయంలో దానికి పీర్ సమీక్ష జరగలేదు.
జీనోమ్ఇండియా ప్రాజెక్టు 83 జనాభా సమూహాలకు చెందిన 10,074 ఆరోగ్యవంతులైన పెద్దల పూర్తి జీనోమ్లను సీక్వెన్స్ చేసింది, 2025 జనవరి 9న బయోటెక్నాలజీ విభాగం (DBT) ఫరీదాబాద్లోని ఇండియన్ బయోలాజికల్ డేటా సెంటర్ (IBDC) ద్వారా ఆ డేటాను పరిశోధకులకు తెరిచింది. జీనోమ్ అంటే ఒక కణంలోని DNA అక్షరాల పూర్తి సమితి అని, వారసత్వంగా వచ్చిన రెండు ప్రతులనూ కలిపితే సుమారు 600 కోట్లు అని, వేరియంట్ అంటే ఆ అక్షరాలు మనుషుల మధ్య తేడాగా ఉండే చోటని అమెరికాలోని నేషనల్ హ్యూమన్ జీనోమ్ రీసెర్చ్ ఇన్స్టిట్యూట్ వివరిస్తోంది.
ఇప్పటి వరకు అత్యంత సమగ్ర విశ్లేషణ ఒక ప్రీప్రింట్, అంటే పీర్ సమీక్షకు ముందే పోస్ట్ చేసిన పత్రం. 2026 మార్చి 24 తేదీ ఉన్న ఈ పత్రం, నాణ్యత పరీక్షల్లో నెగ్గిన 9,768 మందిలో 12.993 కోట్ల వేరియంట్లను నివేదిస్తోంది, వాటిలో 4.403 కోట్లు ప్రపంచ డేటాబేస్లలో ఇంతకుముందు నివేదించనివని చెబుతోంది. అంతకుముందటి జర్నల్ రచన, 2025 ఏప్రిల్లోని నేచర్ జెనెటిక్స్ వ్యాఖ్యానం, ప్రాథమిక లెక్కలను ఇచ్చింది.
2025 జనవరి 9న ఏమి విడుదలైంది
న్యూఢిల్లీలోని విజ్ఞాన్ భవన్లో జరిగిన జీనోమిక్స్ డేటా కాన్క్లేవ్లో కేంద్ర మంత్రి జితేంద్ర సింగ్ ఫ్రేమ్వర్క్ ఫర్ ఎక్స్ఛేంజ్ ఆఫ్ డేటా (FeED) ప్రోటోకాల్స్ను, IBDC పోర్టల్స్ను ప్రారంభించారు. దీనితో 10,000 పూర్తి జీనోమ్ నమూనాలు భారత్లో, విదేశాల్లో పరిశోధకులకు అందుబాటులోకి వచ్చాయని ప్రెస్ ఇన్ఫర్మేషన్ బ్యూరో ప్రకటన చెబుతోంది. ఈ సేకరణ “ఇప్పుడు భారత్లోనే కాక ప్రపంచవ్యాప్తంగా పరిశోధన ప్రయోజనాల కోసం అందుబాటులో ఉంచబడింది” అని సింగ్ అన్నారు.
ప్రధాన మంత్రి నరేంద్ర మోదీ వీడియో సందేశం పంపారు. ఈ ప్రాజెక్టు ఐదేళ్ల క్రితం ఆమోదం పొందిందని, IISc, IITలు, CSIR, BRICతో సహా 20కి పైగా సంస్థలు పాల్గొన్నాయని ఆయన అన్నారు. ఈ డేటా తేల్చగలదని ఆయన ఇచ్చిన ఉదాహరణ గిరిజన సముదాయాల్లో సికిల్ సెల్ రక్తహీనత: ఒక ప్రాంతంలోని సమస్య మరో ప్రాంతానికి భిన్నంగా ఉండవచ్చని, ఎలాగో పూర్తి జన్యు అధ్యయనం మాత్రమే చూపుతుందని ఆయన అన్నారు.
ప్రాజెక్టు ఆలోచన 2017 చివరిలో పుట్టిందని, 2020 జనవరిలో ప్రారంభమైందని, బెంగళూరు IIScలోని సెంటర్ ఫర్ బ్రెయిన్ రీసెర్చ్ సమన్వయకర్త అని ప్రాజెక్టు FAQ చెబుతోంది.
సంఖ్య 99 కాదు 83 ఎందుకు
రెండు సంఖ్యలు తిరుగుతున్నాయి. 2025 మార్చి 19న PIB విడుదల చేసిన లోక్సభ సమాధానం, DBT “99 వేర్వేరు ప్రదేశాల్లోని 83 భిన్న జనాభాల” నుండి 10,074 ఆరోగ్యవంతుల వనరును నిర్మించిందని చెబుతోంది. 83 సమూహాలను లెక్కిస్తుంది, 99 నమూనాలు తీసిన ప్రదేశాలను లెక్కిస్తుంది.
వ్యాఖ్యానం రూపకల్పనను వివరిస్తుంది. 83 సమూహాల్లో 30 గిరిజన, 53 గిరిజనేతర. భారత్లో జన్యు వైవిధ్యానికి భాష ఒక ప్రతినిధి సూచిక, కాబట్టి నాలుగు పెద్ద భాషా కుటుంబాలకు (ఇండో-యూరోపియన్, ద్రావిడ, ఆస్ట్రో-ఏషియాటిక్, టిబెటో-బర్మన్) ప్రాతినిధ్యం ఉండేలా బృందం చూసుకుంది, ప్రతి ప్రాంతంలో భిన్న జీవభౌగోళిక ప్రాంతాల నుండి సమూహాలను నమూనాగా తీసుకుంది. ప్రతి గిరిజనేతర సమూహం నుండి మధ్యస్థంగా 159 మంది బంధుత్వం లేని వ్యక్తులను, ప్రతి గిరిజన సమూహం నుండి 75 మందిని, అలాగే ప్రతి సమూహంలో కొన్ని తల్లిదండ్రులు-బిడ్డ త్రయాలను సీక్వెన్స్ చేసింది.
పాల్గొన్నవారు స్వయంగా ఆరోగ్యవంతులమని ప్రకటించుకున్న పెద్దలు, ఒకే జన్యువు వ్యాధి గాని క్రోమోజోమ్ అసాధారణత గాని నిర్ధారణ కానివారు. వ్యాఖ్యానం 20,459 మంది అంగీకరించిన వాలంటీర్లను నివేదిస్తుండగా, ప్రీప్రింట్, FAQ 20,195 అంటున్నాయి. 13,242 నమూనాలపై నడిపిన జెనోటైపింగ్ అరే, తొలి బంధువులకు మించి ఒకరికొకరు సంబంధం లేనివారిని ఎంచుకోవడానికి సహాయపడింది, 10,074 మందిని ప్రధానంగా నాలుగు కేంద్రాల్లో సీక్వెన్స్ చేశారు. నాణ్యత నియంత్రణ తర్వాత వ్యాఖ్యానం 9,772 జీనోమ్లు అంటుంది, ప్రీప్రింట్ 9,768. నమూనా మిశ్రమం 36.7 శాతం గ్రామీణ, 32.2 శాతం పట్టణ, 31.1 శాతం గిరిజన అని లోక్సభ సమాధానం ఇస్తోంది.
12.993 కోట్ల వేరియంట్లు అంటే ఏమిటి
ప్రీప్రింట్ సుమారు 30 రెట్ల కవరేజీతో సీక్వెన్సింగ్ చేసినట్లు నివేదిస్తుంది, అంటే ప్రతి స్థానాన్ని సుమారు 30 సార్లు చదివారు. అది 129,938,889 అధిక విశ్వసనీయత వేరియంట్లను కనుగొంది, వాటిలో సుమారు 12.1 కోట్లు ఒక్క అక్షరం మార్పులు, 80 లక్షలు చిన్న చేర్పులు లేదా తొలగింపులు. సుమారు 5.9 కోట్లు సింగిల్టన్లు, అంటే మొత్తం సమూహంలో ఒక్కసారే కనిపించినవి. ఒకటి కంటే ఎక్కువసార్లు కనిపించిన 7.074 కోట్ల వేరియంట్లలో 1.194 కోట్లు (9.19 శాతం) ప్రపంచ డేటాబేస్లలో నివేదించనివి.
కాబట్టి ప్రధాన సంఖ్య 4.403 కోట్లలో ఒక్క వ్యక్తిలో కనిపించిన వేరియంట్లు కూడా ఉన్నాయి. నేచర్ ఇండియా 2026 మే 4న నివేదిస్తూ, సుమారు 4.4 కోట్లు gnomAD (పెద్ద పబ్లిక్ వేరియంట్ డేటాబేస్), 1000 జీనోమ్స్ ప్రాజెక్టు, జీనోమ్ఏషియాలో లేవని చెబుతోంది. వ్యాఖ్యానంలోని ముందటి గణాంకాలు వడపోతకు ముందు సుమారు 18 కోట్ల ముడి వేరియంట్లు, ఆ తర్వాత ఆటోసోమ్లపై (లింగ క్రోమోజోమ్లు కాని వాటిపై) సుమారు 13 కోట్లు.
గిరిజన సమూహాలు, వ్యవస్థాపక ప్రభావాలు, నీలగిరులు
ప్రీప్రింట్ ప్రిన్సిపల్ కాంపోనెంట్ విశ్లేషణలో, ఇది ప్రజలను మొత్తం జన్యు సారూప్యత ప్రకారం వర్గీకరిస్తుంది, గిరిజన ఆస్ట్రో-ఏషియాటిక్, ద్రావిడ, టిబెటో-బర్మన్ సమూహాలు గట్టి, వేర్వేరు గుత్తులుగా ఏర్పడతాయి. గిరిజనేతర ఇండో-యూరోపియన్, ద్రావిడ సమూహాలు ఉత్తరం నుండి దక్షిణానికి మోస్తరు వాలులో పరస్పరం కలుస్తాయి. రేఖాంశం ఒక్కటే మొదటి కాంపోనెంట్ను 0.43 సర్దుబాటు R-స్క్వేర్డ్తో, అక్షాంశం రెండవదాన్ని 0.30తో అంచనా వేస్తాయి. భాషను, జీవభౌగోళికతను జోడిస్తే నమూనా 84 శాతం, 78 శాతానికి చేరుతుంది. విశ్లేషణ నాలుగు విస్తృత పూర్వీకుల కాంపోనెంట్లను, నీలగిరి కొండల్లోని రెండు ఒంటరి ద్రావిడ గిరిజన సమూహాలకు ఐదవదాన్ని కనుగొంటుంది.
ఎండోగమీ, అంటే ఒక సముదాయంలోనే వివాహాలు, రన్స్ ఆఫ్ హోమోజైగోసిటీలో గుర్తులు వదులుతుంది, ఇవి ఇటీవలి ఉమ్మడి పూర్వీకుల వల్ల వారసత్వంగా వచ్చిన రెండు DNA ప్రతులూ ఒకేలా ఉండే పొడవైన భాగాలు. ఈ రన్స్ మధ్యస్థ పొడవు 83 జనాభాల్లో 59లో 1.5 సెంటీమోర్గాన్ ఎండోగమీ పరిమితిని (సెంటీమోర్గాన్ అనేది జన్యు దూరం కొలత) గణనీయంగా మించిందని ప్రీప్రింట్ చెబుతోంది. రెండు నీలగిరి సమూహాల్లో రన్స్ సంఖ్య ప్రపంచంలోనే అత్యధికమైన వాటిలో ఉందని, అష్కెనాజీ యూదులు, ఫిన్నిష్ స్థాయిల కంటే ఐదు రెట్లకు పైగా ఉందని రచయితలు అంటున్నారు. తమ కనుగొన్నవి “ఇటీవలి ఎండోగమీ ఒక ప్రధాన శక్తి అని నిరూపిస్తున్నాయి” అని రచయితలు రాశారు.
వ్యవస్థాపక ప్రభావం అంటే ఒక చిన్న పూర్వీకుల సమూహం అనేక వారసులను ఇచ్చింది, కాబట్టి మరెక్కడా అరుదైన వేరియంట్ సాధారణం కావచ్చు. gnomAD, 1000 జీనోమ్స్ ప్రాజెక్టు, జీనోమ్ఏషియాలో లేని HGD జన్యువులోని ఒక స్ప్లైస్-సైట్ వేరియంట్ను, దక్షిణాదిలోని ఒక గిరిజన జనాభాలో 12.5 శాతంగా ప్రీప్రింట్ కనుగొంది. HGDని అల్కాప్టోనూరియాతో, అరుదైన జీవక్రియ రుగ్మతతో, నేచర్ ఇండియా ముడిపెడుతోంది. అది లెక్కించిన హానికర వేరియంట్లను మోసేవారి వాటా గిరిజన జనాభాల్లో 17.5 శాతం, గిరిజనేతరుల్లో 5.5 శాతమని ప్రీప్రింట్ చెబుతోంది. సికిల్-సెల్ వేరియంట్ rs334 అనేక గిరిజన జనాభాల్లో 5 శాతం దాటింది.
ప్రాజెక్టు వ్యక్తులను కాక జనాభాలను విశ్లేషించడం ద్వారా కళంకాన్ని నివారిస్తుందని, చాలా సమూహాలు గతంలో కలిసిపోయిన వల్ల పూర్వీకులను పంచుకుంటాయి కాబట్టి ఫలితాలు సముదాయాల మధ్య సరళమైన జీవశాస్త్ర విభజనలను సమర్థించవని FAQ చెబుతోంది.
ఈ డేటాతో ఏమి నిర్మించాలనుకుంటున్నారు
ఈ డేటా భారతీయ జనాభాలకు తగిన జెనోటైపింగ్ చిప్లను సాధ్యం చేయాలని PIB ప్రకటన చెబుతోంది. mRNA టీకాలు, ప్రోటీన్ తయారీ, జన్యు రుగ్మతల చికిత్సలను ఈ డేటా తోడ్పడగల రంగాలుగా సింగ్ పేర్కొన్నారు, భారత్ ప్రపంచ ఫార్మసీ ఎలా అయిందిలో వర్ణించిన ఔషధ తయారీ పునాదితో పాటు.
ప్రీప్రింట్ ఇచ్చే ఖచ్చితమైన ఉత్పత్తి ఇంప్యూటేషన్ ప్యానెల్, అంటే చౌకైన అరేపై మాత్రమే పరీక్షించిన వారిలో పరీక్షించని అక్షరాలను నింపడానికి వాడే పూర్తిగా సీక్వెన్స్ చేసిన జీనోమ్ల రిఫరెన్స్. 9,768 ఫేజ్డ్ జీనోమ్లతో నిర్మించి, UK బయోబ్యాంక్లోని 7,628 మంది దక్షిణాసియా పూర్వీకుల పాల్గొనేవారి అరే డేటాపై పరీక్షించగా, ఇది సగటు ఇంప్యూటేషన్ నాణ్యతను జీనోమ్ఏషియా ప్యానెల్ కంటే 45 శాతం, హాప్లోటైప్ రిఫరెన్స్ కన్సార్షియం ప్యానెల్ కంటే 20 శాతం, TOPMed కంటే 9 శాతం మెరుగుపరిచింది.
ఇది పాలిజెనిక్ స్కోర్లను కూడా పరీక్షిస్తుంది, ఇవి అనేక చిన్న జన్యు ప్రభావాలను కలిపి ఒకే ప్రమాద అంచనాగా చేస్తాయి. యూరోపియన్ పూర్వీకుల అధ్యయనాల నుండి నిర్మించిన స్కోర్లు జీనోమ్ఇండియాలో ఎత్తు వ్యత్యాసంలో 14.8 శాతాన్ని వివరించాయి, UK బయోబ్యాంక్ భారతీయుల్లో అది 11.2 శాతం, కానీ BMI వ్యత్యాసంలో 0.7 శాతం మాత్రమే, అక్కడ 9.7 శాతం. BMI అంతరాన్ని జన్యు దూరంతో, పర్యావరణ తేడాలతో రచయితలు ముడిపెడుతున్నారు. భారత్లో మధుమేహం ప్రమాదానికి పర్యావరణ, బాల్యకాలపు అంశాలు వేరే ఉన్నాయి, వాటిని తరాల మధ్య మధుమేహం సాగడంపై పుణె పరిశోధన వివరిస్తుంది.
ఔషధాల నిర్వహణ కోసం, సమూహ స్థాయి ఆలీల్ ఫ్రీక్వెన్సీలను ప్రీప్రింట్ నివేదిస్తుంది, ఉదాహరణకు ఆస్ట్రో-ఏషియాటిక్ సమూహాల్లో NUDT15 ప్రమాద ఆలీల్లు 20.8 శాతం వరకు. ఇది ఏ వ్యక్తి చికిత్సనూ పరీక్షించదు. ఇలాంటి ప్యానెల్లు ఔషధ ఎంపికపై, మోతాదుపై చూపే ప్రభావం స్పష్టంగా లేదని, స్వీకరణ జాగ్రత్తగా జరగాలని NIMHANSకు చెందిన మీరా పురుషోత్తమ్ నేచర్ ఇండియాతో అన్నారు.
డేటా ఎవరికి దొరుకుతుంది, ఏ రూపంలో
ఆలీల్ ఫ్రీక్వెన్సీ సారాంశ గణాంకాలు IBDC ద్వారా పబ్లిక్గా ఉన్నాయని ప్రీప్రింట్ చెబుతోంది. పాల్గొనేవారి సమ్మతితో ముడిపడిన గోప్యతా చట్టాల కారణంగా ముడి సీక్వెన్సింగ్ డేటా నియంత్రిత ప్రవేశం కింద ఉంది, నిజమైన పరిశోధకులు ప్రతిపాదిత పరిశోధనను వివరిస్తూ డేటా మేనేజ్మెంట్ గ్రూప్కు అభ్యర్థన పంపాలి, ఆమోదం అవసరం.
PIB 2025 ఏప్రిల్ 30 ప్రకటన, వార్తాపత్రికల కథనాలకు సమాధానంగా రాసినది, IBDC దగ్గర ఉన్నవాటిని జాబితా చేస్తుంది: 9,772 నమూనాలకు సుమారు 700 TB ఉన్న FASTQ ఫైళ్లు (రా రీడ్లు), 9,772 నమూనాలకు సుమారు 35 TB ఉన్న gVCF ఫైళ్లు (ఒక్కొక్కరి వేరియంట్ కాల్స్), సుమారు 3.5 TB ఉమ్మడి కాల్ ఫైళ్లు, 9,330 నమూనాలకు ఫినోటైప్ డేటా. DBT పిలుపు ప్రకారం FASTQ ఫైళ్లు ప్రస్తుతం డౌన్లోడ్ చేసుకోలేరు, వాటి పరిమాణం వల్ల, ముడి ఫైళ్ల విశ్లేషణకు రెండు నుండి మూడు రెట్లు ఎక్కువ కంప్యూటింగ్ కావాలి కాబట్టి అని ప్రకటన చెబుతోంది. ఫినోటైప్ డేటాలో హిమోగ్లోబిన్, కొలెస్ట్రాల్ వంటి 27 రక్త కొలతలు, అలాగే వయసు, లింగం, ఎత్తు, బరువు, శరీర కొవ్వు ఉన్నాయి. 442 నమూనాలకు డేటా ఉపయోగించలేనిది. ప్రవేశం ట్రాన్స్లేషనల్ పరిశోధనపై DBT పిలుపు ప్రతిపాదనలకే పరిమితం కాదు, బయోటెక్-ప్రైడ్ మార్గదర్శకాలు (2021), FeED ప్రోటోకాల్స్ కింద స్వతంత్ర అభ్యర్థనలు కూడా అంగీకరిస్తారు.
మూలాలు పూర్తిగా ఏకీభవించవు. తర్వాత వచ్చిన ప్రీప్రింట్ ముడి సీక్వెన్సింగ్ డేటాను నియంత్రిత ప్రవేశం కింద అందుబాటులో ఉన్నట్లు వర్ణిస్తోంది, కాబట్టి రా రీడ్ల నియమాలను IBDCతో నిర్ధారించుకోవడం మంచిది. PIB 9,772 అని జాబితా చేసిన చోట FAQ IBDC వద్ద 9,648 నమూనాల సీక్వెన్సింగ్ డేటాను జాబితా చేస్తోంది.
ఈ డేటాసెట్ చూపలేనివి
తన 9,768 మంది భారత్ను పూర్తిగా కవర్ చేయరని, పెద్ద గిరిజనేతర జనాభాల నుండి మరింత నమూనా తీసుకోవాలని ప్రీప్రింట్ అంటోంది. భారత్లో 4,600కు పైగా ఎండోగామస్ సమూహాలు ఉన్నాయని, వాటిలో జీనోమ్ఇండియా 83ని కవర్ చేస్తుందని వ్యాఖ్యానం చెబుతోంది.
పాల్గొన్నవారు ఆరోగ్యవంతులు, కాబట్టి వ్యాధితో సంబంధాలు అనుమితి మాత్రమేనని, చాలా లాస్-ఆఫ్-ఫంక్షన్ వేరియంట్లు హానికరం కాకపోవచ్చని నేచర్ ఇండియా గమనిస్తోంది. విశ్లేషణ ప్రోటీన్-కోడింగ్ జన్యువులను, అంటే జీనోమ్లో సుమారు 2 శాతాన్ని, కవర్ చేస్తుందని నార్త్ఈస్టర్న్ యూనివర్సిటీకి చెందిన సుధాకరన్ ప్రభాకరన్ దానికి చెప్పారు. విశ్లేషణ కొనసాగుతోందని, వివరమైన మాన్యుస్క్రిప్ట్ సిద్ధమవుతోందని వ్యాఖ్యానం చెప్పింది. 2026 అక్టోబర్ 8 నాటికి అట్లాస్ జర్నల్ వెర్షన్ tuputకు కనిపించలేదు.
ఈ పనిని ఒక ఆరంభ బిందువుగా వర్ణించి, దీన్ని వైద్య ఆచరణలోకి తేవడానికి మరింత అవసరమని సంబంధిత రచయిత అనలాభ బసు నేచర్ ఇండియాతో చెప్పారు.
మూలాలు మరియు మరింత చదవడానికి
- PIB (Ministry of Science and Technology), 9 January 2025: India Takes a Giant Leap in Genomics, Launch of Indian Genomic Data Set and IBDC Portals
- PIB (Prime Minister's Office), 9 January 2025: English rendering of PM's remarks at the start of GenomeIndia Project
- PIB, 19 March 2025: Parliament question on the Indian Biological Data Centre (Lok Sabha reply)
- PIB, 30 April 2025: GenomeIndia, access to the national genetic resource
- Bhattacharyya C et al., Mapping genetic diversity with the GenomeIndia project, Nature Genetics 57, 767 to 773 (2025), a Comment by the GenomeIndia Consortium
- NCBS repository record for the Nature Genetics comment (volume, issue, pages, PubMed ID 40200122)
- Subramanian K, Bhattacharyya C et al., An Atlas of Indian Genetic Diversity, medRxiv preprint, posted 24 March 2026 (not certified by peer review)
- GenomeIndia project: Frequently asked questions
- Nature India (Sahana Ghosh), 4 May 2026: India's DNA map uncovers millions of missing genetic variants
- US National Human Genome Research Institute: Genomic data science fact sheet
ఈ వ్యాసం AI సాధనాల సహాయంతో పరిశోధించి రాయబడింది మరియు కచ్చితత్వం కోసం సవరించబడింది. ఇది సాధారణ సమాచారం మరియు చర్చ కోసం మాత్రమే, వృత్తిపరమైన సలహా కాదు. మా సంపాదకీయ ప్రమాణాలు మరియు నిరాకరణ చూడండి. తప్పు కనిపించిందా? మాకు తెలియజేయండి.
నచ్చిందా? తదుపరిది పొందండి.
ఒకసారి ఒక మంచి వ్యాసం, నేరుగా మీ ఇన్బాక్స్కు. స్పామ్ లేదు, ఎప్పుడైనా ఆపవచ్చు.