Skip to content
Sarvam称其模型在22种印度语言上的词错误率约为19%,Meta覆盖1600种语言,但已发表的语音得分大多出自开发者自己
人工智能

Sarvam称其模型在22种印度语言上的词错误率约为19%,Meta覆盖1600种语言,但已发表的语音得分大多出自开发者自己

插图:tuput

中文

2026年2月,Sarvam的Saaras V3在IndicVoices测试中的词错误率约为19%,Meta的开源模型给出的印地语字符错误率为3.6。唯一一个以印度电话通话为基础的基准测试,把测试集保密;谷歌和OpenAI关于各自最新语音产品的页面,给出了语言数量,却没有印度语言的错误率。

· · 1 分钟阅读

据Sarvam AI 2026年2月11日自己发布的文章,其Saaras V3语音模型在IndicVoices基准测试中的词错误率约为19%。Meta的开源Omnilingual ASR模型于2025年11月10日发布,其结果表中印地语的字符错误率为3.6。这两个数字测的是不同的东西,用的是不同的音频,其他已发表的得分大多也同样难以对齐。

词错误率(WER)是系统相对于人工转写稿答错的词所占的比例。字符错误率(CER)数的则是错误的字符。印度语言还有另一重麻烦。AI4Bharat,也就是印度理工学院马德拉斯分校的语言技术实验室,其研究人员在2026年3月1日的一份预印本中写道,灵活的拼写,以及词的可拆可合,使得单纯的WER给系统打出的分数,比用户的实际感受更差。

Sarvam的22种语言模型

Saaras V3用一个模型处理22种印度官方语言加英语。Sarvam的文章给出,全部语言在IndicVoices上的WER约为19%,使用人数最多的十种语言为19.31%。文章说,此前覆盖11种语言的Saaras V2.5,在同一个测试集上约为22%。

IndicVoices是AI4Bharat的一个数据集。它2024年的论文描述了来自22种语言、145个县、16,237名说话人的7348小时语音,其中当时已转写的有1639小时。Sarvam的文章点名GPT-4o Transcribe、Gemini 3 Pro、Deepgram Nova3和ElevenLabs Scribe v2是它胜过的对手,却没有印出它们的得分。文章也没有提到任何外部评估方。

Saaras V4于2026年9月25日推出。Sarvam报告它在IndicContextEval上的WER为16.03%,这是AI4Bharat的一项测试,由用户提供关键术语;语种识别错误率在全部22种语言上为5.22%,在前十种语言上为2.9%。V4的大多数准确率结果只以图表形式出现。同步API接受30秒以内的音频,批处理任务接受最长两小时的文件。

2026年2月3日宣布的Sarvam Audio是一个单独的模型,是Sarvam的30亿参数语言模型的音频扩展。文章把它与GPT-4o Transcribe和Gemini 3 Flash在IndicVoices上做了比较,但没有给出数字,并说它尚未全面开放。

2026年3月的AI4Bharat预印本,作者中有一名Sarvam研究人员,且未经同行评审,它衡量了拼写变体对得分的扭曲程度。其“正字法感知”WER(OIWER)接受一个词的任何一种列出的拼写。对其中一个模型,它平均低了6.3个点,泰米尔语的平均差距是14.4个点,马拉雅拉姆语是13.9个点,马拉地语和古吉拉特语约为5.3个点。

Meta的1600种语言

Omnilingual ASR覆盖1600多种语言,Meta说其中500多种以前从未被AI转写过。模型规模从3亿到70亿参数不等。代码和模型采用Apache 2.0许可,论文中的解码器借鉴了大语言模型。Meta自己的头条数字是:用它70亿参数的模型,78%的语言CER低于10。

该项目在GitHub上的结果表给出了印度的情形。印地语在236.7小时训练音频之后CER为3.6,泰米尔语在379.3小时之后为5.2,孟加拉语为2.8,奥里亚语在51.8小时之后为5.8。博杰普尔语只有5.5小时训练时长,CER为16.5。桑塔利语在0.4小时上是4.9。这张表没有列出标明测试音频的一栏。

有两条限制有案可查。Meta说,用少量样例教模型一门新语言,准确度不如完整训练。另外,GitHub页面说大多数检查点会拒绝40秒或更长的片段,不过2025年12月的一次更新为较长的音频增加了“Unlimited”变体。

在翻译方面,Meta 2026年3月17日的Omnilingual MT论文,描述了作者所称的第一个支持1600多种语言的系统。作者说,它10亿至80亿参数的模型与一个700亿参数的基线持平或更胜一筹。他们还报告说,基线模型往往能听懂一门低资源语言,却生成得很差。tuput在摘要和打开的页面中没有找到印度语言各自的得分。

唯一一个以印度电话通话为基础的测试

Voice of India由Josh Talks与AI4Bharat共同运行,已被Interspeech 2026接收,使用来自36,691名说话人、15种语言的536小时无脚本电话语音。它用OI-WER来评分,这是一个由有效拼写构成的格(lattice)。核心测试集不公开,所以外人无法复现结果,计划公开的只是一小部分样本。

Josh Talks 2026年4月的文章在其表中给15个系统打了分。以下是OI-WER百分比,越低越好。

模型印地语孟加拉语泰米尔语
Sarvam Audio5.06.014.2
Gemini 3 Pro6.08.515.7
ElevenLabs Scribe v27.710.020.4
IndicConformer (AI4Bharat)8.210.719.9
OmniASR LLM 7B (Meta)13.722.843.1
GPT-4o Transcribe34.044.864.2

Sarvam的产品Sarvam Audio在三项上都排第一。GPT-4o Transcribe是OpenAI 2025年3月的模型。TechCrunch在其发布时报道,引用OpenAI的内部基准测试,泰米尔语、泰卢固语、马拉雅拉姆语和卡纳达语的词错误率接近30%。这是和Voice of India不同的另一项测试。

这篇文章列出了它自身的局限。评分格背后的假设文本,来自一个内部的识别模型集成。命名实体、领域术语和数字尚未测试。男性说话人相对于女性说话人,错误率的相对惩罚约为19%至21%。

Bodhan的九月发布,以及对不上的数字

2026年9月,Bodhan AI发布了Indic-Transcribe,一组开源的语音识别模型。Bodhan AI是印度理工学院马德拉斯分校孵化的团队,与AI4Bharat和英伟达合作。Core模型的说明卡报告,在Voice of India上的平均OIWER为8.7,对比Saaras V3的10.7、IndicConformer的17.8和Gemini 3 Pro的21.1。它覆盖25种语言:英语、22种列入附表的语言、博杰普尔语和比利语。说明卡没有说明评估由谁来做。

说明卡列出了它的局限。它用最长30秒的片段训练,只输出本地文字,并假定只有一位说话人。自动语种识别并不均衡,博杰普尔语、迈蒂利语和乌尔都语常被并入印地语。

Bodhan的说明卡和Josh Talks的页面,对同样的模型也说法不一。说明卡给Gemini 3 Pro的印地语得分是9.3,给OmniASR LLM 7B是9.6,而Josh Talks的表里是6.0和13.7。两个页面都没有解释差异,所以两边的得分不能合并计算。

谷歌和OpenAI公布的是语言数量

谷歌的Chirp 3文档于2026年10月7日更新,列出印地语和印度英语已正式可用。另有十种印度语言在预览中,分别是阿萨姆语、孟加拉语、古吉拉特语、卡纳达语、马拉雅拉姆语、马拉地语、奥里亚语、旁遮普语、泰米尔语和泰卢固语。乌尔都语没有出现。该页面没有给出错误率。

谷歌2026年6月9日宣布的Gemini 3.5 Live Translate,可以翻译70种或更多语言的语音,并力求保持说话人的节奏和音高。Google Meet的语音翻译从五种语言增加到70种或更多,从只有英语的语言对,扩展到一场会议中2000多种语言组合。文章说,译文会落后说话人几秒,没有印出基准测试数字,也没有写出印度语言的名称。

2026年5月报道的OpenAI的gpt-realtime-translate,接受70多种语言的语音,其手册列表中包括印地语、孟加拉语、古吉拉特语、马拉雅拉姆语、旁遮普语和泰卢固语。语音输出有13种语言,印度语言只有印地语一种。OpenAI的手册警告说,该模型可能替换错误的名字或实体,并且没有给出延迟数字。

Bhashini是政府平台,在印度推动用自己的语言做AI中有介绍,它也提供语音服务。tuput没有找到它的模型公布的错误率,所以这里没有给它打分。最高法院自己使用AI做转写和翻译的情况,见印度法院中的AI。

Josh Talks的文章把命名实体、特定领域和数字方面的评估列为今后的工作,因此上面没有任何一个得分涵盖人名、行话或数字。

Share
Copied!

资料来源与延伸阅读

  1. Meta AI: Omnilingual ASR, advancing automatic speech recognition (10 November 2025)
  2. arXiv: Omnilingual ASR, Open-Source Multilingual Speech Recognition for 1600+ Languages (12 November 2025)
  3. GitHub: facebookresearch/omnilingual-asr, code, model list and 7B per-language results table
  4. arXiv: Omnilingual MT, Machine Translation for 1,600 Languages (17 March 2026)
  5. Sarvam AI: Saaras V3 speech recognition (11 February 2026)
  6. Sarvam AI: Introducing Saaras V4 (25 September 2026)
  7. Sarvam AI: Sarvam Audio (3 February 2026)
  8. arXiv: IndicVoices, Towards building an Inclusive Multilingual Speech Dataset for Indian Languages (4 March 2024)
  9. arXiv: Towards Orthographically-Informed Evaluation of Speech Recognition Systems for Indian Languages (1 March 2026)
  10. arXiv: Voice of India, A Large-Scale Benchmark for Real-World Speech Recognition in India (21 April 2026)
  11. Josh Talks AI: Voice of India, Building India's National ASR Benchmark (April 2026)
  12. Hugging Face: Bodhan AI Indic-Transcribe-core model card (September 2026)
  13. DT Next: IIT-M-incubated Bodhan AI unveils open models for Indian languages (12 September 2026)
  14. Google Cloud: Chirp 3 transcription model documentation (last updated 7 October 2026)
  15. Google: Fluid, natural voice translation with Gemini 3.5 Live Translate (9 June 2026)
  16. OpenAI Cookbook: Build Live Translation Apps with gpt-realtime-translate
  17. Quantum Zeitgeist: OpenAI's New Model Translates 70+ Languages in Realtime (11 May 2026)
  18. TechCrunch: OpenAI upgrades its transcription and voice-generating AI models (20 March 2025)

本文在 AI 工具协助下研究与撰写,并经编辑核实。仅供一般参考与讨论,不构成专业建议。请参阅我们的编辑准则与免责声明。发现错误?告诉我们。

#speech recognition#machine translation#indic languages#sarvam ai#omnilingual asr#voice of india#ai4bharat#live translation

喜欢这篇吗?下一篇也别错过。

每次一篇好文章,直接送到你的邮箱。绝无垃圾邮件,随时可退订。

同类更多: 人工智能
印度AI使命拥有三万八千多块GPU,每小时租价65卢比,并资助了12家模型研发机构,但其2025至26财年的预算已从200亿卢比下调到80亿卢比
算力便宜,首批模型已经发布,预算科目却很小。政府自己的文件对使命的每一根支柱怎么说,以及卡内基印度、塔克沙希拉学会和一位与印度科学研究院有关联的研发负责人在哪里提出反驳。
全世界先用英语打造了AI。印度刚花12.5亿美元,为自己的语言打造一个
一项政府计划正以远低于市场价的价格,向印度初创公司出租近6万块GPU,一个翻译平台每天处理数以千万计的请求,涉及的语言连ChatGPT都常常应付不来。但并非每一个赌注都已经成功。
Scale的SWE-Bench Pro榜单上最好的编程智能体为61.5%,维护者拒绝了许多通过测试的修复,METR称其最新试验无法说明智能体能节省多少时间
基准测试说智能体很强。维护者、一项随机对照试验和一堆事故报告说,实际情形要窄得多。这里说明每个数字究竟测的是什么。
← 全部文章