చిత్రణ: tuput
తెలుగు
2026 ఫిబ్రవరిలో సర్వమ్ Saaras V3 IndicVoices పరీక్షలో సుమారు 19% పద దోషం సాధించింది, మెటా ఓపెన్ మోడల్ హిందీకి 3.6 అక్షర దోష రేటును చూపుతోంది. భారతీయ ఫోన్ కాల్స్పై నిర్మించిన ఏకైక బెంచ్మార్క్ తన పరీక్ష సెట్ను రహస్యంగా ఉంచుతోంది, గూగుల్, ఓపెన్ఏఐల సొంత పేజీలు తమ తాజా స్పీచ్ ఉత్పత్తులకు భాషల సంఖ్యను ఇస్తున్నాయి కానీ భారతీయ భాషల దోష రేట్లను ఇవ్వడం లేదు.
సర్వమ్ AI స్పీచ్ మోడల్ Saaras V3, IndicVoices బెంచ్మార్క్పై సుమారు 19% పద దోషం సాధించిందని 2026 ఫిబ్రవరి 11న సర్వమ్ సొంత పోస్ట్ చెబుతోంది. 2025 నవంబర్ 10న విడుదలైన మెటా ఓపెన్ Omnilingual ASR మోడల్, తన ఫలితాల పట్టికలో హిందీకి 3.6 అక్షర దోష రేటును చూపుతోంది. ఆ రెండు సంఖ్యలు వేర్వేరు ఆడియోపై వేర్వేరు విషయాలను కొలుస్తాయి, ప్రచురితమైన మిగతా స్కోర్లలో చాలావాటిని పక్కపక్కన పెట్టడం కూడా అంతే కష్టం.
పద దోష రేటు (WER) అంటే మనిషి రాసిన ట్రాన్స్క్రిప్ట్తో పోలిస్తే సిస్టమ్ తప్పుగా పట్టిన పదాల వాటా. అక్షర దోష రేటు (CER) బదులుగా తప్పు అక్షరాలను లెక్కిస్తుంది. భారతీయ భాషలు మరో సమస్యను జోడిస్తాయి. అనువైన స్పెల్లింగ్, పదాలను విడగొట్టడం లేదా కలపడం ఐచ్ఛికం కావడం వల్ల సాదా WER వినియోగదారులు భావించే దానికంటే సిస్టమ్లను తక్కువగా రేట్ చేస్తుందని ఐఐటీ మద్రాస్లోని భాషా సాంకేతిక ప్రయోగశాల AI4Bharat పరిశోధకులు 2026 మార్చి 1 ప్రీప్రింట్లో రాశారు.
సర్వమ్ 22 భాషల మోడల్స్
Saaras V3 ఒకే మోడల్లో 22 అధికారిక భారతీయ భాషలను, ఇంగ్లిష్ను నిర్వహిస్తుంది. సర్వమ్ పోస్ట్ అన్ని భాషలకు IndicVoicesపై సుమారు 19% WERను, అత్యధికంగా మాట్లాడే పది భాషలకు 19.31%ను ఇస్తుంది. 11 భాషలను కవర్ చేసిన ముందటి Saaras V2.5 అదే సెట్పై సుమారు 22% స్కోర్ చేసిందని అది చెబుతోంది.
IndicVoices AI4Bharat డేటాసెట్. దాని 2024 పత్రం 22 భాషల్లో 145 జిల్లాల్లోని 16,237 మంది వక్తల 7,348 గంటల ప్రసంగాన్ని వర్ణిస్తుంది, అందులో అప్పటికి 1,639 గంటలను ట్రాన్స్క్రైబ్ చేశారు. తాను ఓడిస్తున్న ప్రత్యర్థులుగా GPT-4o Transcribe, Gemini 3 Pro, Deepgram Nova3, ElevenLabs Scribe v2లను సర్వమ్ పోస్ట్ పేర్కొంటుంది, కానీ వాటికి స్కోర్లు ఇవ్వదు. ఆ పోస్ట్ బయటి మూల్యాంకనకర్త పేరు చెప్పదు.
Saaras V4 2026 సెప్టెంబర్ 25న వచ్చింది. వినియోగదారు కీలక పదాలను అందించే AI4Bharat పరీక్ష IndicContextEvalపై 16.03% WERను, మొత్తం 22 భాషలకు 5.22%, అగ్ర పది భాషలకు 2.9% భాషా గుర్తింపు దోషాన్ని సర్వమ్ నివేదిస్తోంది. V4 ఖచ్చితత్వ ఫలితాల్లో చాలావరకు చార్టులుగానే కనిపిస్తాయి. సింక్రోనస్ API 30 సెకన్ల లోపు ఆడియోను తీసుకుంటుంది, బ్యాచ్ జాబ్లు రెండు గంటల వరకు ఫైళ్లను తీసుకుంటాయి.
2026 ఫిబ్రవరి 3న ప్రకటించిన Sarvam Audio ప్రత్యేక మోడల్, సర్వమ్ 300 కోట్ల పారామీటర్ల లాంగ్వేజ్ మోడల్కు ఆడియో పొడిగింపు. ఆ పోస్ట్ దాన్ని IndicVoicesపై GPT-4o Transcribe, Gemini 3 Flashతో సంఖ్యలు ఇవ్వకుండా పోలుస్తుంది, ఇంకా సాధారణంగా అందుబాటులో లేదని చెబుతోంది.
సర్వమ్ పరిశోధకుడు రచయితల్లో ఒకరైన, పీర్ సమీక్ష జరగని 2026 మార్చి AI4Bharat ప్రీప్రింట్, స్పెల్లింగ్ రూపాంతరాలు స్కోర్లను ఎంత వక్రీకరిస్తాయో కొలిచింది. దాని ఆర్థోగ్రాఫికల్లీ ఇన్ఫర్మ్డ్ WER (OIWER) ఒక పదానికి జాబితా చేసిన ఏ స్పెల్లింగ్నైనా అంగీకరిస్తుంది. ఒక మోడల్కు అది సగటున 6.3 పాయింట్లు తక్కువగా వచ్చింది, తమిళానికి సగటు అంతరం 14.4 పాయింట్లు, మలయాళానికి 13.9, మరాఠీ, గుజరాతీలకు సుమారు 5.3.
మెటా 1,600 భాషలు
Omnilingual ASR 1,600కు పైగా భాషలను కవర్ చేస్తుంది, వాటిలో 500కు పైగా భాషలను ఇంతకుముందు AI ఎన్నడూ ట్రాన్స్క్రైబ్ చేయలేదని మెటా అంటోంది. మోడల్స్ 30 కోట్ల నుండి 700 కోట్ల పారామీటర్ల వరకు ఉన్నాయి. కోడ్, మోడల్స్ Apache 2.0 లైసెన్స్ కింద ఉన్నాయి, పత్రంలోని డీకోడర్ లార్జ్ లాంగ్వేజ్ మోడల్స్ నుండి అరువు తీసుకుంటుంది. 700 కోట్ల పారామీటర్ల మోడల్తో 78% భాషలకు CER 10 కంటే తక్కువ ఉండడమే మెటా సొంత ప్రధాన ప్రకటన.
GitHubలోని ప్రాజెక్టు ఫలితాల పట్టిక భారతీయ చిత్రాన్ని ఇస్తుంది. హిందీ 236.7 గంటల శిక్షణ ఆడియో తర్వాత 3.6 CER స్కోర్ చేస్తుంది, తమిళం 379.3 గంటల తర్వాత 5.2, బెంగాలీ 2.8, ఒడియా 51.8 గంటల తర్వాత 5.8. భోజ్పురికి 5.5 శిక్షణ గంటలు, 16.5 CER ఉన్నాయి. సంతాలీ 0.4 గంటలపై 4.9 వద్ద ఉంది. పట్టికలో పరీక్ష ఆడియోకు పేరు పెట్టే కాలమ్ లేదు.
రెండు పరిమితులు నమోదై ఉన్నాయి. కొన్ని ఉదాహరణలతో మోడల్కు కొత్త భాష నేర్పడం పూర్తి శిక్షణ కంటే తక్కువ ఖచ్చితమైనదని మెటా అంటోంది. మరి GitHub పేజీ ప్రకారం చాలా చెక్పాయింట్లు 40 సెకన్లు లేదా అంతకంటే ఎక్కువ నిడివి ఉన్న క్లిప్లను తిరస్కరిస్తాయి, అయితే 2025 డిసెంబర్ అప్డేట్ పొడవైన ఆడియోకు “Unlimited” వేరియంట్లను జోడించింది.
అనువాదం కోసం, మెటా Omnilingual MT పత్రం (2026 మార్చి 17) రచయితలు 1,600కు పైగా భాషలకు తోడ్పడే మొదటి సిస్టమ్ అని పిలిచేదాన్ని వర్ణిస్తుంది. దాని 100 కోట్ల నుండి 800 కోట్ల పారామీటర్ల మోడల్స్ 7,000 కోట్ల పారామీటర్ల బేస్లైన్కు సరిపోతాయి లేదా దాన్ని మించుతాయని రచయితలు అంటున్నారు. తక్కువ వనరుల భాషను బేస్లైన్ మోడల్స్ తరచూ అర్థం చేసుకుంటాయి కానీ దాన్ని బాగా ఉత్పత్తి చేయలేవని కూడా వారు నివేదిస్తున్నారు. సారాంశంలో, తాము తెరిచిన పేజీల్లో భాషల వారీ భారతీయ స్కోర్లను tuput కనుగొనలేదు.
భారతీయ ఫోన్ కాల్స్పై నిర్మించిన ఏకైక పరీక్ష
AI4Bharatతో కలిసి Josh Talks నడుపుతున్న, Interspeech 2026కు అంగీకరించిన Voice of India, 15 భాషల్లో 36,691 మంది వక్తల 536 గంటల స్క్రిప్ట్ లేని టెలిఫోన్ ప్రసంగాన్ని వాడుతుంది. ఇది OI-WERతో స్కోర్ చేస్తుంది, ఇది చెల్లుబాటు అయ్యే స్పెల్లింగ్ల లాటిస్. ప్రధాన పరీక్ష సెట్ రహస్యం, కాబట్టి బయటివారు ఫలితాలను పునరుత్పత్తి చేయలేరు, చిన్న పబ్లిక్ నమూనా మాత్రమే ప్రణాళికలో ఉంది.
Josh Talks 2026 ఏప్రిల్ రచన తన పట్టికలో 15 సిస్టమ్లను స్కోర్ చేస్తుంది. ఇవి OI-WER శాతాలు, తక్కువ ఉంటే మంచిది.
| మోడల్ | హిందీ | బెంగాలీ | తమిళం |
|---|---|---|---|
| Sarvam Audio | 5.0 | 6.0 | 14.2 |
| Gemini 3 Pro | 6.0 | 8.5 | 15.7 |
| ElevenLabs Scribe v2 | 7.7 | 10.0 | 20.4 |
| IndicConformer (AI4Bharat) | 8.2 | 10.7 | 19.9 |
| OmniASR LLM 7B (Meta) | 13.7 | 22.8 | 43.1 |
| GPT-4o Transcribe | 34.0 | 44.8 | 64.2 |
సర్వమ్ ఉత్పత్తి అయిన Sarvam Audio మూడింటిలోనూ మొదటి స్థానంలో ఉంది. GPT-4o Transcribe 2025 మార్చి నాటి ఓపెన్ఏఐ మోడల్. దాని విడుదల సమయంలో, ఓపెన్ఏఐ అంతర్గత బెంచ్మార్క్ను ఉటంకిస్తూ, తమిళం, తెలుగు, మలయాళం, కన్నడకు 30%కి చేరువలో పద దోష రేటును టెక్క్రంచ్ నివేదించింది. అది Voice of India కంటే వేరే పరీక్ష.
ఆ రచన తన పరిమితులను జాబితా చేస్తుంది. స్కోరింగ్ లాటిస్ల వెనుక ఉన్న ఊహాత్మక పాఠాలు గుర్తింపు మోడల్స్ అంతర్గత సమూహం నుండి వస్తాయి. పేర్లు, రంగాల పదాలు, సంఖ్యలను ఇంకా పరీక్షించలేదు. పురుష వక్తల్లో స్త్రీ వక్తలతో పోలిస్తే సుమారు 19 నుండి 21% సాపేక్ష దోష జరిమానా కనిపిస్తుంది.
Bodhan సెప్టెంబర్ విడుదల, సరిపోలని సంఖ్యలు
2026 సెప్టెంబర్లో AI4Bharat, NVIDIAతో కలిసి పనిచేస్తున్న ఐఐటీ మద్రాస్ ఇంక్యుబేటెడ్ బృందం Bodhan AI, స్పీచ్ రికగ్నిషన్ కోసం ఓపెన్ మోడల్స్ Indic-Transcribeను విడుదల చేసింది. Core మోడల్ కార్డ్ Voice of Indiaపై సగటు OIWER 8.7 అని నివేదిస్తోంది, Saaras V3కి 10.7, IndicConformerకు 17.8, Gemini 3 Proకు 21.1. ఇది 25 భాషలను కవర్ చేస్తుంది: ఇంగ్లిష్, 22 షెడ్యూల్డ్ భాషలు, భోజ్పురి, భిలి. మూల్యాంకనాన్ని ఎవరు నడిపారో కార్డ్ చెప్పదు.
కార్డ్ తన పరిమితులను జాబితా చేస్తుంది. ఇది 30 సెకన్ల వరకు క్లిప్లపై శిక్షణ పొందింది, స్థానిక లిపిని మాత్రమే అవుట్పుట్ చేస్తుంది, ఒకే వక్త ఉంటారని ఊహిస్తుంది. ఆటోమేటిక్ భాషా గుర్తింపు అసమానంగా ఉంది, భోజ్పురి, మైథిలి, ఉర్దూలు తరచూ హిందీలో కలిసిపోతాయి.
Bodhan కార్డ్, Josh Talks పేజీ అవే మోడల్స్ విషయంలో ఏకీభవించవు కూడా. Josh Talks పట్టికలో 6.0, 13.7 ఉన్న చోట కార్డ్ హిందీకి Gemini 3 Proకు 9.3, OmniASR LLM 7Bకి 9.6 ఇస్తుంది. తేడాను ఏ పేజీ వివరించదు, కాబట్టి రెండింటి స్కోర్లను కలపలేము.
గూగుల్, ఓపెన్ఏఐ భాషల సంఖ్యలను ప్రచురిస్తాయి
2026 అక్టోబర్ 7న నవీకరించిన గూగుల్ Chirp 3 డాక్యుమెంటేషన్ హిందీని, భారతీయ ఇంగ్లిష్ను సాధారణంగా అందుబాటులో ఉన్నవిగా జాబితా చేస్తుంది. మరో పది భారతీయ భాషలు ప్రివ్యూలో ఉన్నాయి, అవి అస్సామీ, బెంగాలీ, గుజరాతీ, కన్నడ, మలయాళం, మరాఠీ, ఒడియా, పంజాబీ, తమిళం, తెలుగు. ఉర్దూ కనిపించదు. పేజీ దోష రేట్లను ఇవ్వదు.
2026 జూన్ 9న ప్రకటించిన గూగుల్ Gemini 3.5 Live Translate 70 లేదా అంతకంటే ఎక్కువ భాషల నుండి ప్రసంగాన్ని అనువదిస్తుంది, వక్త వేగాన్ని, స్వర స్థాయిని నిలుపుకోవడం లక్ష్యం. గూగుల్ మీట్ స్పీచ్ అనువాదం ఐదు భాషల నుండి 70 లేదా అంతకంటే ఎక్కువకు, ఇంగ్లిష్-మాత్రమే జతల నుండి ఒకే మీటింగ్లో 2,000కు పైగా భాషా కలయికలకు పెరుగుతుంది. అనువాదం వక్త కంటే కొన్ని సెకన్లు వెనుకే ఉంటుందని పోస్ట్ చెబుతోంది, బెంచ్మార్క్ సంఖ్యలను గాని భారతీయ భాషల పేర్లను గాని ఇవ్వదు.
2026 మేలో నివేదించిన ఓపెన్ఏఐ gpt-realtime-translate, తన కుక్బుక్ జాబితాలో హిందీ, బెంగాలీ, గుజరాతీ, మలయాళం, పంజాబీ, తెలుగుతో సహా 70కి పైగా భాషల్లో ప్రసంగాన్ని అంగీకరిస్తుంది. స్పీచ్ అవుట్పుట్ 13 భాషల్లో వస్తుంది, వాటిలో భారతీయ భాష హిందీ ఒక్కటే. ఈ మోడల్ తప్పు పేర్లను లేదా అంశాలను ప్రతిక్షేపించగలదని ఓపెన్ఏఐ కుక్బుక్ హెచ్చరిస్తుంది, లేటెన్సీ సంఖ్యలను ఇవ్వదు.
భారత్ తన సొంత భాషల్లో AI నిర్మిస్తున్న ప్రయత్నంలో వివరించిన ప్రభుత్వ వేదిక భాషిణి కూడా స్పీచ్ సేవలను అందిస్తుంది. దాని మోడల్స్కు ప్రచురిత దోష రేట్లను tuput కనుగొనలేదు, అందుకే ఇక్కడ స్కోర్ చేయలేదు. ట్రాన్స్క్రిప్షన్, అనువాదం కోసం సుప్రీంకోర్టు సొంత AI వినియోగం భారత కోర్టుల్లో AIలో ఉంది.
పేర్లు, రంగాల పదజాలం, అంకెల మూల్యాంకనాన్ని Josh Talks రచన భవిష్యత్ పనిగా జాబితా చేస్తుంది, కాబట్టి పైన ఉన్న ఏ స్కోరూ పేర్లను, పరిభాషను, అంకెలను కవర్ చేయదు.
మూలాలు మరియు మరింత చదవడానికి
- Meta AI: Omnilingual ASR, advancing automatic speech recognition (10 November 2025)
- arXiv: Omnilingual ASR, Open-Source Multilingual Speech Recognition for 1600+ Languages (12 November 2025)
- GitHub: facebookresearch/omnilingual-asr, code, model list and 7B per-language results table
- arXiv: Omnilingual MT, Machine Translation for 1,600 Languages (17 March 2026)
- Sarvam AI: Saaras V3 speech recognition (11 February 2026)
- Sarvam AI: Introducing Saaras V4 (25 September 2026)
- Sarvam AI: Sarvam Audio (3 February 2026)
- arXiv: IndicVoices, Towards building an Inclusive Multilingual Speech Dataset for Indian Languages (4 March 2024)
- arXiv: Towards Orthographically-Informed Evaluation of Speech Recognition Systems for Indian Languages (1 March 2026)
- arXiv: Voice of India, A Large-Scale Benchmark for Real-World Speech Recognition in India (21 April 2026)
- Josh Talks AI: Voice of India, Building India's National ASR Benchmark (April 2026)
- Hugging Face: Bodhan AI Indic-Transcribe-core model card (September 2026)
- DT Next: IIT-M-incubated Bodhan AI unveils open models for Indian languages (12 September 2026)
- Google Cloud: Chirp 3 transcription model documentation (last updated 7 October 2026)
- Google: Fluid, natural voice translation with Gemini 3.5 Live Translate (9 June 2026)
- OpenAI Cookbook: Build Live Translation Apps with gpt-realtime-translate
- Quantum Zeitgeist: OpenAI's New Model Translates 70+ Languages in Realtime (11 May 2026)
- TechCrunch: OpenAI upgrades its transcription and voice-generating AI models (20 March 2025)
ఈ వ్యాసం AI సాధనాల సహాయంతో పరిశోధించి రాయబడింది మరియు కచ్చితత్వం కోసం సవరించబడింది. ఇది సాధారణ సమాచారం మరియు చర్చ కోసం మాత్రమే, వృత్తిపరమైన సలహా కాదు. మా సంపాదకీయ ప్రమాణాలు మరియు నిరాకరణ చూడండి. తప్పు కనిపించిందా? మాకు తెలియజేయండి.
నచ్చిందా? తదుపరిది పొందండి.
ఒకసారి ఒక మంచి వ్యాసం, నేరుగా మీ ఇన్బాక్స్కు. స్పామ్ లేదు, ఎప్పుడైనా ఆపవచ్చు.