Skip to content
GenomeIndia对来自83个人群的10074人做了基因组测序,一份预印本统计出全球数据库中缺少的4403万个变异
新闻

GenomeIndia对来自83个人群的10074人做了基因组测序,一份预印本统计出全球数据库中缺少的4403万个变异

插图:tuput

中文

生物技术部于2025年1月9日向研究人员开放了GenomeIndia的数据。2026年3月24日发布的一份预印本分析了通过质量检验的9768个基因组,报告了1.2993亿个变异,其中4403万个在全球数据库中没有记录。该文发布时尚未经过同行评审。

· · 1 分钟阅读

GenomeIndia项目对来自83个人群的10074名健康成年人做了全基因组测序,2025年1月9日,生物技术部(DBT)通过法里达巴德的印度生物数据中心(IBDC)向研究人员开放了这些数据。美国国家人类基因组研究所把基因组描述为一个细胞中全套的DNA字母,把两份遗传来的拷贝都算上,约有60亿个;把变异描述为人与人之间这些字母出现差异的位置。

目前最完整的分析是一份预印本,也就是未经同行评审就先行发布的论文。它的日期是2026年3月24日,报告在通过质量检验的9768人中发现了1.2993亿个变异,并说其中4403万个此前没有在全球数据库中报告过。此前的期刊文章是2025年4月《自然·遗传学》上的一篇短评,给出的是初步的计数。

2025年1月9日发布了什么

在新德里科学馆(Vigyan Bhavan)举行的基因组数据大会上,联邦部长吉滕德拉·辛格启动了数据交换框架(FeED)协议和IBDC门户网站。新闻信息局的新闻稿说,这使印度国内外的研究人员可以使用1万份全基因组样本。辛格说,这批数据“现已开放,不仅供印度国内,也供全球用于研究目的”。

总理纳伦德拉·莫迪发来了视频致辞。他说这个项目是五年前批准的,涉及20多个机构,其中有印度科学研究所(IISc)、印度理工学院(IIT)、CSIR和BRIC。他举的数据能够解决的例子是部落社区的镰状细胞贫血:他说,一个地区的问题可能与另一个地区不同,只有完整的遗传研究才能说明究竟如何不同。

项目常见问题页面说,它构想于2017年末,2020年1月启动,由班加罗尔印度科学研究所的脑研究中心担任协调方。

为什么是83,而不是99

有两个数字在流传。新闻信息局于2025年3月19日发布的一份人民院答复说,DBT建立了一个资源库,包含“来自99个不同地点、83个异质人群”的10074名健康个体。83数的是群体,99数的是采集样本的地点。

短评解释了设计思路。在83个群体中,30个是部落群体,53个是非部落群体。语言是印度遗传多样性的一个替代指标,所以研究团队确保四大语系(印欧语系、达罗毗荼语系、南亚语系和藏缅语系)都有代表,并且在每个地区内,从不同的生物地理环境中抽取群体。它对每个非部落群体测序的无亲缘关系者人数中位数为159人,每个部落群体为75人,另外每个群体还有几组父母与子女的三人组。

参与者是自述健康的成年人,没有确诊的单基因疾病或染色体异常。短评报告同意参加的志愿者有20459人,而预印本和常见问题页面说是20195人。对13242份样本做的基因分型芯片检测,帮助挑出了彼此之间亲缘关系远于一代堂表亲的人,其中10074人接受了测序,主要在四个中心完成。质量控制之后,短评计为9772个基因组,预印本计为9768个。人民院的答复给出的采样构成是:农村36.7%,城市32.2%,部落31.1%。

1.2993亿个变异意味着什么

预印本报告的测序覆盖度约为30倍,意思是每个位置大约被读取了30次。它发现了129,938,889个高置信度变异,其中约1.21亿个是单字母变化,约800万个是短的插入或缺失。约5900万个是单例变异,在整个队列中只出现过一次。在出现不止一次的7074万个变异中,有1194万个(9.19%)在全球数据库中没有记录。

所以,4403万这个标题数字包括了只在一个人身上发现的变异。《自然·印度》(Nature India)在2026年5月4日报道称,约4400万个变异不见于gnomAD(一个大型公共变异数据库)、千人基因组计划和GenomeAsia。短评较早给出的数字是:过滤之前原始变异约1.8亿个,过滤之后常染色体(非性染色体)上约1.3亿个。

部落群体、奠基者效应与尼尔吉里山

在预印本的主成分分析(按整体遗传相似性对人进行分类)中,部落的南亚语系、达罗毗荼语系和藏缅语系群体形成紧密而各自分开的聚类。非部落的印欧语系和达罗毗荼语系群体沿着一条大致由北向南的梯度相互重叠。仅凭经度就能预测第一主成分,调整后的R平方为0.43,纬度预测第二主成分为0.30。加入语言和生物地理因素后,模型分别达到84%和78%。分析发现了四个主要的祖源成分,另有第五个成分,属于尼尔吉里山区两个孤立的达罗毗荼部落群体。

内婚,即在社区内部通婚,会在纯合片段中留下痕迹,这是DNA中很长的一段区域,因为共同的近代祖先,两份遗传来的拷贝在这里完全相同。预印本说,在83个人群中的59个里,这些片段长度的中位数明显超过了1.5厘摩的内婚阈值(厘摩是遗传距离的单位)。对于尼尔吉里的那两个群体,作者说片段的数量位居世界最高之列,是德系犹太人和芬兰人水平的五倍以上。作者写道,他们的发现“表明近期的内婚是一种主导力量”。

奠基者效应指的是一个很小的祖先群体繁衍出许多后代,因此在别处罕见的变异可以变得常见。预印本发现,HGD基因中有一个剪接位点变异,不见于gnomAD、千人基因组计划和GenomeAsia,在南方的一个部落人群中占12.5%。《自然·印度》把HGD与尿黑酸尿症联系起来,这是一种罕见的代谢病。预印本给出,携带它所统计的致病变异的个体比例,在部落人群中为17.5%,在非部落人群中为5.5%。镰状细胞变异rs334在几个部落人群中超过了5%。

常见问题页面说,项目通过分析人群而不是个人来避免污名化,而且结果并不支持把社区之间做简单的生物学划分,因为大多数群体通过过去的混合共享着祖源。

这些数据要用来建成什么

新闻信息局的新闻稿说,这些数据应当能够造出适合印度人群的基因分型芯片。辛格列举了mRNA疫苗、蛋白质生产和遗传病治疗这些数据可以支撑的领域,同时还有印度如何成为世界药房中所述的制药基础。

预印本拿出的具体成果是一个填补(imputation)参考面板,这是一套完整测序的基因组参考,用来给只用较便宜芯片检测的人填补未检测的字母。它由9768个已定相的基因组构建,并在英国生物样本库7628名南亚血统参与者的芯片数据上做了检验,平均填补质量比GenomeAsia面板提高了45%,比单倍型参考联盟面板提高了20%,比TOPMed提高了9%。

它还检验了多基因评分,也就是把许多微小的遗传效应加总成一个风险估计。基于欧洲血统研究构建的评分,在GenomeIndia中解释了14.8%的身高变异,英国生物样本库的印度人中是11.2%,但对BMI变异只解释了0.7%,英国生物样本库的印度人中是9.7%。作者把BMI上的差距归因于遗传距离和环境差异。印度的糖尿病风险有自己的环境和生命早期因素,见浦那关于糖尿病代际传递的研究。

在药物代谢方面,预印本报告了群体层面的等位基因频率,例如NUDT15风险等位基因在南亚语系群体中高达20.8%。它没有检验任何个人的治疗。国家心理健康与神经科学研究所(NIMHANS)的米拉·普鲁肖塔姆对《自然·印度》说,这类面板对药物选择和剂量的影响尚不明确,采用时应当谨慎。

谁能拿到数据,以什么形式

预印本说,等位基因频率的汇总统计数据通过IBDC公开。原始测序数据因与参与者同意相关的隐私法律而受控访问,真正的研究人员必须向数据管理小组提交一份说明拟议研究的申请,并须获得批准。

新闻信息局2025年4月30日的新闻稿是针对报纸报道而写的,列出了IBDC所存的内容:9772份样本的FASTQ文件(原始读段)约700 TB,9772份样本的gVCF文件(个人变异调用)约35 TB,联合调用文件约3.5 TB,以及9330份样本的表型数据。新闻稿说,按照DBT的决定,FASTQ文件目前不可下载,原因是体量太大,而且分析原始文件需要两到三倍的计算资源。表型数据涵盖27项血液指标,如血红蛋白和胆固醇,另有年龄、性别、身高、体重和体脂。有442份样本的数据无法使用。访问不限于DBT关于转化研究的征集项目,根据《生物技术PRIDE指南》(2021年)和FeED协议提出的独立申请也予受理。

这些来源并不完全一致。后来的预印本把原始测序数据描述为可在受控访问下获取,所以原始读段的规则值得向IBDC确认。常见问题页面列出IBDC上有9648份样本的测序数据,而新闻信息局列的是9772份。

这个数据集不能说明什么

预印本说,它的9768人并不能完整覆盖印度,并呼吁对大型非部落人群做更多采样。短评认为印度有4600多个内婚群体,GenomeIndia覆盖了其中的83个。

参与者都是健康的,所以《自然·印度》指出,与疾病的联系是推断出来的,许多功能缺失变异可能是无害的。东北大学的苏达卡兰·普拉巴卡兰对该刊说,这项分析涵盖的是蛋白质编码基因,约占基因组的2%。短评说分析仍在进行,一份详细的稿件正在准备。截至2026年10月8日,tuput没有找到该图谱的期刊版本。

通讯作者之一阿纳拉巴·巴苏对《自然·印度》说,这项工作只是一个起点,要把它转化为临床实践还需要做更多工作。

Share
Copied!

资料来源与延伸阅读

  1. PIB (Ministry of Science and Technology), 9 January 2025: India Takes a Giant Leap in Genomics, Launch of Indian Genomic Data Set and IBDC Portals
  2. PIB (Prime Minister's Office), 9 January 2025: English rendering of PM's remarks at the start of GenomeIndia Project
  3. PIB, 19 March 2025: Parliament question on the Indian Biological Data Centre (Lok Sabha reply)
  4. PIB, 30 April 2025: GenomeIndia, access to the national genetic resource
  5. Bhattacharyya C et al., Mapping genetic diversity with the GenomeIndia project, Nature Genetics 57, 767 to 773 (2025), a Comment by the GenomeIndia Consortium
  6. NCBS repository record for the Nature Genetics comment (volume, issue, pages, PubMed ID 40200122)
  7. Subramanian K, Bhattacharyya C et al., An Atlas of Indian Genetic Diversity, medRxiv preprint, posted 24 March 2026 (not certified by peer review)
  8. GenomeIndia project: Frequently asked questions
  9. Nature India (Sahana Ghosh), 4 May 2026: India's DNA map uncovers millions of missing genetic variants
  10. US National Human Genome Research Institute: Genomic data science fact sheet

本文在 AI 工具协助下研究与撰写,并经编辑核实。仅供一般参考与讨论,不构成专业建议。请参阅我们的编辑准则与免责声明。发现错误?告诉我们。

#genomeindia#genomics#department of biotechnology#indian biological data centre#endogamy#founder effect#population genetics#precision medicine

喜欢这篇吗?下一篇也别错过。

每次一篇好文章,直接送到你的邮箱。绝无垃圾邮件,随时可退订。

同类更多: 新闻
六家中国AI公司被指抄袭美国顶尖模型,美国的对策是悄悄让它们的回答变差
一份美国安全预警指控六家中国AI公司抄袭美国模型,并建议悄悄给它们提供质量更差的回答。此外还有DeepMind绘制的人类DNA所有可能突变图谱、苹果以AI为核心的iPhone发布会,以及印度史上规模最大的铁路扩建。
印度第一颗卫星阿耶波多,在班加罗尔的厂棚里造成,花费约3000万卢比,1975年4月19日由苏联火箭发射升空
一颗26个面的卫星,在工业厂棚里装配,搭乘别国的火箭升空,几天之内实验就没了声息。记录怎么说阿耶波多是怎样成的,以及这些记录在哪里互相不一致。
印度的首次月球任务耗资 38.6 亿卢比(386 crore),并搭载了在月球表面发现水的那台 NASA 仪器
十一台仪器,其中六台来自国外,由一枚印度火箭送上了月球。发射十一个月后,其中一台 NASA 光谱仪在月表探测到了水和羟基,发现这一结果的论文把这次搜寻称为一场持续 40 年的探索。
← 全部文章