Skip to content
GenomeIndia secuenció a 10.074 personas de 83 grupos de población, y un preprint cuenta 44 millones de variantes ausentes de las bases de datos mundiales
Noticias

GenomeIndia secuenció a 10.074 personas de 83 grupos de población, y un preprint cuenta 44 millones de variantes ausentes de las bases de datos mundiales

Ilustración de tuput

Español

El Departamento de Biotecnología abrió los datos de GenomeIndia a los investigadores el 9 de enero de 2025. Un preprint publicado el 24 de marzo de 2026 analiza los 9.768 genomas que pasaron los controles de calidad y reporta 129,93 millones de variantes, 44,03 millones de ellas ausentes de las bases de datos mundiales. No había sido revisado por pares cuando se publicó.

· · 10 min de lectura

El proyecto GenomeIndia secuenció los genomas completos de 10.074 adultos sanos de 83 grupos de población, y el 9 de enero de 2025 el Departamento de Biotecnología (DBT) abrió los datos a los investigadores a través del Indian Biological Data Centre (IBDC) en Faridabad. El National Human Genome Research Institute de Estados Unidos describe un genoma como el conjunto completo de letras de ADN de una célula, unas 6.000 millones si se cuentan las dos copias heredadas, y una variante como un lugar donde esas letras difieren entre personas.

El análisis más completo hasta ahora es un preprint, un artículo publicado antes de la revisión por pares. Fechado el 24 de marzo de 2026, reporta 129,93 millones de variantes en las 9.768 personas que pasaron los controles de calidad, y dice que 44,03 millones de ellas no figuraban antes en las bases de datos mundiales. El texto anterior en una revista, un comentario de Nature Genetics de abril de 2025, daba cifras preliminares.

Qué se publicó el 9 de enero de 2025

En el Genomics Data Conclave celebrado en Vigyan Bhavan, Nueva Delhi, el ministro de la Unión Jitendra Singh puso en marcha los protocolos del Framework for Exchange of Data (FeED) y los portales del IBDC. El comunicado de la Press Information Bureau dice que así quedaron accesibles 10.000 muestras de genoma completo para investigadores de la India y del extranjero. Singh dijo que la colección “se pone ahora a disposición para la investigación no solo dentro de la India sino a escala global.”

El primer ministro Narendra Modi envió un mensaje en vídeo. Dijo que el proyecto se aprobó cinco años antes e involucró a más de 20 instituciones, entre ellas el IISc, los IIT, el CSIR y el BRIC. Su ejemplo de lo que los datos podrían aclarar fue la anemia falciforme en comunidades tribales: el problema en una región puede diferir del de otra, dijo, y solo un estudio genético completo mostraría cómo.

Las preguntas frecuentes del proyecto dicen que se concibió a fines de 2017 y se lanzó en enero de 2020, con el Centre for Brain Research del IISc de Bengaluru como coordinador.

Por qué la cifra es 83 y no 99

Circulan dos cifras. Una respuesta en la Lok Sabha difundida por la PIB el 19 de marzo de 2025 dice que el DBT construyó un recurso de 10.074 personas sanas “de 83 poblaciones heterogéneas en 99 sitios distintos”. El 83 cuenta grupos y el 99 cuenta los lugares donde se tomaron las muestras.

El comentario explica el diseño. De los 83 grupos, 30 son tribales y 53 no tribales. El idioma es un indicador de la diversidad genética en la India, así que el equipo se aseguró de que estuvieran representadas las cuatro grandes familias lingüísticas (indoeuropea, drávida, austroasiática y tibeto-birmana) y, dentro de cada región, muestreó grupos de biogeografías distintas. Secuenció una mediana de 159 personas sin parentesco de cada grupo no tribal y 75 de cada grupo tribal, además de unos pocos tríos de padres e hijo por grupo.

Los participantes eran adultos sanos por autodeclaración, sin enfermedad monogénica ni anomalía cromosómica diagnosticadas. El comentario reporta 20.459 voluntarios que dieron su consentimiento, mientras que el preprint y las preguntas frecuentes dicen 20.195. Una matriz de genotipado aplicada a 13.242 muestras ayudó a elegir personas sin parentesco entre sí más allá de primos hermanos, y se secuenciaron 10.074, sobre todo en cuatro centros. Tras el control de calidad el comentario cuenta 9.772 genomas y el preprint 9.768. La respuesta de la Lok Sabha da la composición del muestreo como 36,7 por ciento rural, 32,2 por ciento urbano y 31,1 por ciento tribal.

Qué significan 129,93 millones de variantes

El preprint reporta una secuenciación con una cobertura de unas 30 veces, es decir, cada posición se leyó unas 30 veces. Halla 129.938.889 variantes de alta confianza, unos 121 millones de cambios de una sola letra y 8 millones de inserciones o deleciones cortas. Unos 59 millones son singletons, vistos una sola vez en toda la cohorte. De los 70,74 millones de variantes vistas más de una vez, 11,94 millones (9,19 por ciento) no figuran en las bases de datos mundiales.

Así que la cifra destacada de 44,03 millones incluye variantes halladas en una sola persona. Nature India, que informó el 4 de mayo de 2026, dice que unos 44 millones están ausentes de gnomAD (una gran base pública de variantes), del Proyecto 1000 Genomas y de GenomeAsia. Las cifras anteriores del comentario eran unos 180 millones de variantes en bruto antes de filtrar y alrededor de 130 millones en los autosomas (los cromosomas no sexuales) después.

Grupos tribales, efectos fundadores y los Nilgiris

En el análisis de componentes principales del preprint, que ordena a las personas por su similitud genética global, los grupos tribales austroasiáticos, drávidas y tibeto-birmanos forman agrupaciones compactas y separadas. Los grupos no tribales indoeuropeos y drávidas se solapan a lo largo de un gradiente aproximado de norte a sur. La longitud por sí sola predice el primer componente con una R cuadrada ajustada de 0,43 y la latitud predice el segundo con 0,30. Al añadir el idioma y la biogeografía, el modelo llega a 84 por ciento y 78 por ciento. El análisis halla cuatro componentes amplios de ascendencia y un quinto para dos grupos tribales drávidas aislados de las colinas de Nilgiri.

La endogamia, el matrimonio dentro de una comunidad, deja huella en las rachas de homocigosidad, tramos largos donde las dos copias heredadas de ADN son idénticas por antepasados recientes comunes. El preprint dice que la longitud mediana de estas rachas superó de forma significativa un umbral de endogamia de 1,5 centimorgan (un centimorgan es una unidad de distancia genética) en 59 de las 83 poblaciones. Para los dos grupos de los Nilgiris los autores dicen que el número de rachas figura entre los más altos del mundo y es más de cinco veces el de los niveles judío asquenazí y finlandés. Los autores escriben que sus hallazgos “demuestran que la endogamia reciente es una fuerza dominante.”

Un efecto fundador significa que un pequeño grupo ancestral dio origen a muchos descendientes, de modo que una variante rara en otros lugares puede volverse común. El preprint halla una variante de sitio de empalme en el gen HGD, ausente de gnomAD, del Proyecto 1000 Genomas y de GenomeAsia, en 12,5 por ciento en una población tribal del sur. Nature India vincula HGD con la alcaptonuria, un trastorno metabólico raro. El preprint fija la proporción de individuos portadores de las variantes patogénicas que cuenta en 17,5 por ciento en poblaciones tribales frente a 5,5 por ciento en las no tribales. La variante de células falciformes rs334 superó el 5 por ciento en varias poblaciones tribales.

Las preguntas frecuentes dicen que el proyecto evita el estigma analizando poblaciones y no individuos, y que los resultados no respaldan divisiones biológicas simples entre comunidades, puesto que la mayoría de los grupos comparten ascendencia por mezclas pasadas.

Qué deben construir los datos

El comunicado de la PIB dice que los datos deberían permitir chips de genotipado adaptados a las poblaciones indias. Singh enumeró las vacunas de ARNm, la fabricación de proteínas y los tratamientos de trastornos genéticos como áreas a las que los datos podrían alimentar, junto con la base de fabricación de fármacos descrita en cómo la India se convirtió en la farmacia del mundo.

El producto concreto del preprint es un panel de imputación, una referencia de genomas secuenciados por completo que sirve para rellenar las letras no analizadas en personas a quienes solo se les pasó una matriz más barata. Construido con 9.768 genomas fasados y probado con datos de matriz de 7.628 participantes de ascendencia sudasiática del UK Biobank, mejoró la calidad media de imputación en 45 por ciento respecto del panel de GenomeAsia, 20 por ciento respecto del panel del Haplotype Reference Consortium y 9 por ciento respecto de TOPMed.

También prueba puntuaciones poligénicas, que suman muchos efectos genéticos pequeños en una sola estimación de riesgo. Las puntuaciones construidas a partir de estudios de ascendencia europea explicaron el 14,8 por ciento de la variación de la estatura en GenomeIndia frente al 11,2 por ciento en indios del UK Biobank, pero solo el 0,7 por ciento de la variación del IMC frente al 9,7 por ciento. Los autores atribuyen la brecha del IMC a la distancia genética y a diferencias ambientales. El riesgo de diabetes en la India tiene hilos propios, ambientales y de los primeros años de vida, que se tratan en la investigación de Pune sobre la diabetes que se transmite entre generaciones.

Sobre el manejo de fármacos, el preprint reporta frecuencias alélicas por grupo, por ejemplo alelos de riesgo de NUDT15 de hasta 20,8 por ciento en grupos austroasiáticos. No prueba el tratamiento de ningún individuo. Meera Purushottam, del NIMHANS, dijo a Nature India que el efecto de tales paneles en la elección y la dosificación de fármacos no está claro y que su adopción debe ser cautelosa.

Quién puede obtener los datos y en qué forma

El preprint dice que las estadísticas resumidas de frecuencias alélicas son públicas a través del IBDC. Los datos de secuenciación en bruto están bajo acceso controlado por leyes de privacidad ligadas al consentimiento de los participantes, y los investigadores de buena fe deben enviar al Data Management Group una solicitud que describa la investigación propuesta, y se requiere aprobación.

El comunicado de la PIB del 30 de abril de 2025, redactado en respuesta a informes de prensa, enumera lo que guarda el IBDC: archivos FASTQ (lecturas en bruto) de 9.772 muestras, unos 700 TB; archivos gVCF (llamadas de variantes por persona) de 9.772 muestras, unos 35 TB; archivos de llamada conjunta de unos 3,5 TB; y datos fenotípicos de 9.330 muestras. Según la convocatoria del DBT, los archivos FASTQ no se pueden descargar por ahora, dice el comunicado, por su tamaño y porque analizar los archivos en bruto requiere de dos a tres veces más cómputo. Los datos fenotípicos abarcan 27 mediciones sanguíneas, como hemoglobina y colesterol, además de edad, sexo, estatura, peso y grasa corporal. En 442 muestras los datos resultaron inutilizables. El acceso no se limita a la convocatoria del DBT para investigación traslacional, y se aceptan solicitudes independientes bajo las Biotech-PRIDE Guidelines (2021) y los protocolos FeED.

Las fuentes no coinciden del todo. El preprint posterior describe los datos de secuenciación en bruto como disponibles bajo acceso controlado, así que conviene confirmar con el IBDC las reglas para las lecturas en bruto. Las preguntas frecuentes enumeran datos de secuenciación de 9.648 muestras en el IBDC donde la PIB enumera 9.772.

Lo que el conjunto de datos no puede mostrar

El preprint dice que sus 9.768 personas no cubren del todo la India y pide muestrear más a las grandes poblaciones no tribales. El comentario calcula que la India tiene más de 4.600 grupos endógamos, de los cuales GenomeIndia cubre 83.

Los participantes estaban sanos, así que Nature India señala que los vínculos con enfermedades son inferidos y que muchas variantes de pérdida de función pueden ser inofensivas. Sudhakaran Prabakaran, de la Northeastern University, le dijo que el análisis abarca los genes que codifican proteínas, alrededor del 2 por ciento del genoma. El comentario decía que el análisis seguía en curso y que se preparaba un manuscrito detallado. Al 8 de octubre de 2026, tuput no halló una versión del atlas en una revista.

Analabha Basu, uno de los autores de correspondencia, describió el trabajo a Nature India como un punto de partida y dijo que hace falta más para traducirlo a la práctica clínica.

Share
Copied!

Fuentes y lecturas adicionales

  1. PIB (Ministry of Science and Technology), 9 January 2025: India Takes a Giant Leap in Genomics, Launch of Indian Genomic Data Set and IBDC Portals
  2. PIB (Prime Minister's Office), 9 January 2025: English rendering of PM's remarks at the start of GenomeIndia Project
  3. PIB, 19 March 2025: Parliament question on the Indian Biological Data Centre (Lok Sabha reply)
  4. PIB, 30 April 2025: GenomeIndia, access to the national genetic resource
  5. Bhattacharyya C et al., Mapping genetic diversity with the GenomeIndia project, Nature Genetics 57, 767 to 773 (2025), a Comment by the GenomeIndia Consortium
  6. NCBS repository record for the Nature Genetics comment (volume, issue, pages, PubMed ID 40200122)
  7. Subramanian K, Bhattacharyya C et al., An Atlas of Indian Genetic Diversity, medRxiv preprint, posted 24 March 2026 (not certified by peer review)
  8. GenomeIndia project: Frequently asked questions
  9. Nature India (Sahana Ghosh), 4 May 2026: India's DNA map uncovers millions of missing genetic variants
  10. US National Human Genome Research Institute: Genomic data science fact sheet

Investigado y escrito con ayuda de herramientas de IA, y editado para verificar su exactitud. Se ofrece solo como información general y para el debate, no como asesoramiento profesional. Consulta nuestros criterios editoriales y nuestro aviso legal. ¿Has visto un error? Dínoslo.

#genomeindia#genomics#department of biotechnology#indian biological data centre#endogamy#founder effect#population genetics#precision medicine

¿Te ha gustado? Recibe el siguiente.

Una buena lectura cada vez, directa a tu correo. Sin spam, cancela cuando quieras.

Más en Noticias
Seis empresas chinas de IA fueron sorprendidas copiando los mejores modelos de Estados Unidos. La solucion de Washington: hacer que sus respuestas empeoren en silencio.
Una alerta de seguridad de Estados Unidos acusa a seis empresas chinas de IA de copiar modelos estadounidenses y recomienda darles respuestas peores en silencio. Ademas, el atlas de DeepMind de cada mutacion posible del ADN humano, el lanzamiento del iPhone centrado en IA de Apple, y la mayor expansion ferroviaria de la India hasta la fecha.
Aryabhata, el primer satélite de la India, se construyó en cobertizos de Bengaluru por unos 30 millones de rupias (Rs 3 crore) y se lanzó en un cohete soviético el 19 de abril de 1975
Un satélite de 26 caras ensamblado en cobertizos industriales, lanzado en el cohete de otro país y callado en sus experimentos a los pocos días. Lo que dicen los registros sobre cómo se hizo Aryabhata, y en qué discrepan.
La primera misión india a la Luna costó 386 crore de rupias y llevó el instrumento de la NASA que halló agua en la superficie lunar
Once instrumentos, seis de ellos del extranjero, viajaron a la Luna en un solo cohete indio. Once meses después del lanzamiento, un espectrómetro de la NASA entre ellos detectó agua e hidroxilo en la superficie, en una búsqueda que el artículo del hallazgo llama de 40 años.
← todos los artículos