Skip to content
సర్వమ్ 22 భారతీయ భాషల్లో సుమారు 19% పద దోషాలను నివేదిస్తోంది, మెటా 1,600 భాషలను కవర్ చేస్తోంది, కానీ ప్రచురితమైన చాలా స్పీచ్ స్కోర్లు తయారుచేసినవారివే
కృత్రిమ మేధస్సు

సర్వమ్ 22 భారతీయ భాషల్లో సుమారు 19% పద దోషాలను నివేదిస్తోంది, మెటా 1,600 భాషలను కవర్ చేస్తోంది, కానీ ప్రచురితమైన చాలా స్పీచ్ స్కోర్లు తయారుచేసినవారివే

చిత్రణ: tuput

తెలుగు

2026 ఫిబ్రవరిలో సర్వమ్ Saaras V3 IndicVoices పరీక్షలో సుమారు 19% పద దోషం సాధించింది, మెటా ఓపెన్ మోడల్ హిందీకి 3.6 అక్షర దోష రేటును చూపుతోంది. భారతీయ ఫోన్ కాల్స్‌పై నిర్మించిన ఏకైక బెంచ్‌మార్క్ తన పరీక్ష సెట్‌ను రహస్యంగా ఉంచుతోంది, గూగుల్, ఓపెన్‌ఏఐల సొంత పేజీలు తమ తాజా స్పీచ్ ఉత్పత్తులకు భాషల సంఖ్యను ఇస్తున్నాయి కానీ భారతీయ భాషల దోష రేట్లను ఇవ్వడం లేదు.

· · 6 నిమిషాల పఠనం

సర్వమ్ AI స్పీచ్ మోడల్ Saaras V3, IndicVoices బెంచ్‌మార్క్‌పై సుమారు 19% పద దోషం సాధించిందని 2026 ఫిబ్రవరి 11న సర్వమ్ సొంత పోస్ట్ చెబుతోంది. 2025 నవంబర్ 10న విడుదలైన మెటా ఓపెన్ Omnilingual ASR మోడల్, తన ఫలితాల పట్టికలో హిందీకి 3.6 అక్షర దోష రేటును చూపుతోంది. ఆ రెండు సంఖ్యలు వేర్వేరు ఆడియోపై వేర్వేరు విషయాలను కొలుస్తాయి, ప్రచురితమైన మిగతా స్కోర్లలో చాలావాటిని పక్కపక్కన పెట్టడం కూడా అంతే కష్టం.

పద దోష రేటు (WER) అంటే మనిషి రాసిన ట్రాన్స్‌క్రిప్ట్‌తో పోలిస్తే సిస్టమ్ తప్పుగా పట్టిన పదాల వాటా. అక్షర దోష రేటు (CER) బదులుగా తప్పు అక్షరాలను లెక్కిస్తుంది. భారతీయ భాషలు మరో సమస్యను జోడిస్తాయి. అనువైన స్పెల్లింగ్, పదాలను విడగొట్టడం లేదా కలపడం ఐచ్ఛికం కావడం వల్ల సాదా WER వినియోగదారులు భావించే దానికంటే సిస్టమ్‌లను తక్కువగా రేట్ చేస్తుందని ఐఐటీ మద్రాస్‌లోని భాషా సాంకేతిక ప్రయోగశాల AI4Bharat పరిశోధకులు 2026 మార్చి 1 ప్రీప్రింట్‌లో రాశారు.

సర్వమ్ 22 భాషల మోడల్స్

Saaras V3 ఒకే మోడల్‌లో 22 అధికారిక భారతీయ భాషలను, ఇంగ్లిష్‌ను నిర్వహిస్తుంది. సర్వమ్ పోస్ట్ అన్ని భాషలకు IndicVoicesపై సుమారు 19% WERను, అత్యధికంగా మాట్లాడే పది భాషలకు 19.31%ను ఇస్తుంది. 11 భాషలను కవర్ చేసిన ముందటి Saaras V2.5 అదే సెట్‌పై సుమారు 22% స్కోర్ చేసిందని అది చెబుతోంది.

IndicVoices AI4Bharat డేటాసెట్. దాని 2024 పత్రం 22 భాషల్లో 145 జిల్లాల్లోని 16,237 మంది వక్తల 7,348 గంటల ప్రసంగాన్ని వర్ణిస్తుంది, అందులో అప్పటికి 1,639 గంటలను ట్రాన్స్‌క్రైబ్ చేశారు. తాను ఓడిస్తున్న ప్రత్యర్థులుగా GPT-4o Transcribe, Gemini 3 Pro, Deepgram Nova3, ElevenLabs Scribe v2లను సర్వమ్ పోస్ట్ పేర్కొంటుంది, కానీ వాటికి స్కోర్లు ఇవ్వదు. ఆ పోస్ట్ బయటి మూల్యాంకనకర్త పేరు చెప్పదు.

Saaras V4 2026 సెప్టెంబర్ 25న వచ్చింది. వినియోగదారు కీలక పదాలను అందించే AI4Bharat పరీక్ష IndicContextEvalపై 16.03% WERను, మొత్తం 22 భాషలకు 5.22%, అగ్ర పది భాషలకు 2.9% భాషా గుర్తింపు దోషాన్ని సర్వమ్ నివేదిస్తోంది. V4 ఖచ్చితత్వ ఫలితాల్లో చాలావరకు చార్టులుగానే కనిపిస్తాయి. సింక్రోనస్ API 30 సెకన్ల లోపు ఆడియోను తీసుకుంటుంది, బ్యాచ్ జాబ్‌లు రెండు గంటల వరకు ఫైళ్లను తీసుకుంటాయి.

2026 ఫిబ్రవరి 3న ప్రకటించిన Sarvam Audio ప్రత్యేక మోడల్, సర్వమ్ 300 కోట్ల పారామీటర్ల లాంగ్వేజ్ మోడల్‌కు ఆడియో పొడిగింపు. ఆ పోస్ట్ దాన్ని IndicVoicesపై GPT-4o Transcribe, Gemini 3 Flashతో సంఖ్యలు ఇవ్వకుండా పోలుస్తుంది, ఇంకా సాధారణంగా అందుబాటులో లేదని చెబుతోంది.

సర్వమ్ పరిశోధకుడు రచయితల్లో ఒకరైన, పీర్ సమీక్ష జరగని 2026 మార్చి AI4Bharat ప్రీప్రింట్, స్పెల్లింగ్ రూపాంతరాలు స్కోర్లను ఎంత వక్రీకరిస్తాయో కొలిచింది. దాని ఆర్థోగ్రాఫికల్లీ ఇన్ఫర్మ్డ్ WER (OIWER) ఒక పదానికి జాబితా చేసిన ఏ స్పెల్లింగ్‌నైనా అంగీకరిస్తుంది. ఒక మోడల్‌కు అది సగటున 6.3 పాయింట్లు తక్కువగా వచ్చింది, తమిళానికి సగటు అంతరం 14.4 పాయింట్లు, మలయాళానికి 13.9, మరాఠీ, గుజరాతీలకు సుమారు 5.3.

మెటా 1,600 భాషలు

Omnilingual ASR 1,600కు పైగా భాషలను కవర్ చేస్తుంది, వాటిలో 500కు పైగా భాషలను ఇంతకుముందు AI ఎన్నడూ ట్రాన్స్‌క్రైబ్ చేయలేదని మెటా అంటోంది. మోడల్స్ 30 కోట్ల నుండి 700 కోట్ల పారామీటర్ల వరకు ఉన్నాయి. కోడ్, మోడల్స్ Apache 2.0 లైసెన్స్ కింద ఉన్నాయి, పత్రంలోని డీకోడర్ లార్జ్ లాంగ్వేజ్ మోడల్స్ నుండి అరువు తీసుకుంటుంది. 700 కోట్ల పారామీటర్ల మోడల్‌తో 78% భాషలకు CER 10 కంటే తక్కువ ఉండడమే మెటా సొంత ప్రధాన ప్రకటన.

GitHubలోని ప్రాజెక్టు ఫలితాల పట్టిక భారతీయ చిత్రాన్ని ఇస్తుంది. హిందీ 236.7 గంటల శిక్షణ ఆడియో తర్వాత 3.6 CER స్కోర్ చేస్తుంది, తమిళం 379.3 గంటల తర్వాత 5.2, బెంగాలీ 2.8, ఒడియా 51.8 గంటల తర్వాత 5.8. భోజ్‌పురికి 5.5 శిక్షణ గంటలు, 16.5 CER ఉన్నాయి. సంతాలీ 0.4 గంటలపై 4.9 వద్ద ఉంది. పట్టికలో పరీక్ష ఆడియోకు పేరు పెట్టే కాలమ్ లేదు.

రెండు పరిమితులు నమోదై ఉన్నాయి. కొన్ని ఉదాహరణలతో మోడల్‌కు కొత్త భాష నేర్పడం పూర్తి శిక్షణ కంటే తక్కువ ఖచ్చితమైనదని మెటా అంటోంది. మరి GitHub పేజీ ప్రకారం చాలా చెక్‌పాయింట్‌లు 40 సెకన్లు లేదా అంతకంటే ఎక్కువ నిడివి ఉన్న క్లిప్‌లను తిరస్కరిస్తాయి, అయితే 2025 డిసెంబర్ అప్‌డేట్ పొడవైన ఆడియోకు “Unlimited” వేరియంట్‌లను జోడించింది.

అనువాదం కోసం, మెటా Omnilingual MT పత్రం (2026 మార్చి 17) రచయితలు 1,600కు పైగా భాషలకు తోడ్పడే మొదటి సిస్టమ్ అని పిలిచేదాన్ని వర్ణిస్తుంది. దాని 100 కోట్ల నుండి 800 కోట్ల పారామీటర్ల మోడల్స్ 7,000 కోట్ల పారామీటర్ల బేస్‌లైన్‌కు సరిపోతాయి లేదా దాన్ని మించుతాయని రచయితలు అంటున్నారు. తక్కువ వనరుల భాషను బేస్‌లైన్ మోడల్స్ తరచూ అర్థం చేసుకుంటాయి కానీ దాన్ని బాగా ఉత్పత్తి చేయలేవని కూడా వారు నివేదిస్తున్నారు. సారాంశంలో, తాము తెరిచిన పేజీల్లో భాషల వారీ భారతీయ స్కోర్లను tuput కనుగొనలేదు.

భారతీయ ఫోన్ కాల్స్‌పై నిర్మించిన ఏకైక పరీక్ష

AI4Bharatతో కలిసి Josh Talks నడుపుతున్న, Interspeech 2026కు అంగీకరించిన Voice of India, 15 భాషల్లో 36,691 మంది వక్తల 536 గంటల స్క్రిప్ట్ లేని టెలిఫోన్ ప్రసంగాన్ని వాడుతుంది. ఇది OI-WERతో స్కోర్ చేస్తుంది, ఇది చెల్లుబాటు అయ్యే స్పెల్లింగ్‌ల లాటిస్. ప్రధాన పరీక్ష సెట్ రహస్యం, కాబట్టి బయటివారు ఫలితాలను పునరుత్పత్తి చేయలేరు, చిన్న పబ్లిక్ నమూనా మాత్రమే ప్రణాళికలో ఉంది.

Josh Talks 2026 ఏప్రిల్ రచన తన పట్టికలో 15 సిస్టమ్‌లను స్కోర్ చేస్తుంది. ఇవి OI-WER శాతాలు, తక్కువ ఉంటే మంచిది.

మోడల్హిందీబెంగాలీతమిళం
Sarvam Audio5.06.014.2
Gemini 3 Pro6.08.515.7
ElevenLabs Scribe v27.710.020.4
IndicConformer (AI4Bharat)8.210.719.9
OmniASR LLM 7B (Meta)13.722.843.1
GPT-4o Transcribe34.044.864.2

సర్వమ్ ఉత్పత్తి అయిన Sarvam Audio మూడింటిలోనూ మొదటి స్థానంలో ఉంది. GPT-4o Transcribe 2025 మార్చి నాటి ఓపెన్‌ఏఐ మోడల్. దాని విడుదల సమయంలో, ఓపెన్‌ఏఐ అంతర్గత బెంచ్‌మార్క్‌ను ఉటంకిస్తూ, తమిళం, తెలుగు, మలయాళం, కన్నడకు 30%కి చేరువలో పద దోష రేటును టెక్‌క్రంచ్ నివేదించింది. అది Voice of India కంటే వేరే పరీక్ష.

ఆ రచన తన పరిమితులను జాబితా చేస్తుంది. స్కోరింగ్ లాటిస్‌ల వెనుక ఉన్న ఊహాత్మక పాఠాలు గుర్తింపు మోడల్స్ అంతర్గత సమూహం నుండి వస్తాయి. పేర్లు, రంగాల పదాలు, సంఖ్యలను ఇంకా పరీక్షించలేదు. పురుష వక్తల్లో స్త్రీ వక్తలతో పోలిస్తే సుమారు 19 నుండి 21% సాపేక్ష దోష జరిమానా కనిపిస్తుంది.

Bodhan సెప్టెంబర్ విడుదల, సరిపోలని సంఖ్యలు

2026 సెప్టెంబర్‌లో AI4Bharat, NVIDIAతో కలిసి పనిచేస్తున్న ఐఐటీ మద్రాస్ ఇంక్యుబేటెడ్ బృందం Bodhan AI, స్పీచ్ రికగ్నిషన్ కోసం ఓపెన్ మోడల్స్ Indic-Transcribeను విడుదల చేసింది. Core మోడల్ కార్డ్ Voice of Indiaపై సగటు OIWER 8.7 అని నివేదిస్తోంది, Saaras V3కి 10.7, IndicConformerకు 17.8, Gemini 3 Proకు 21.1. ఇది 25 భాషలను కవర్ చేస్తుంది: ఇంగ్లిష్, 22 షెడ్యూల్డ్ భాషలు, భోజ్‌పురి, భిలి. మూల్యాంకనాన్ని ఎవరు నడిపారో కార్డ్ చెప్పదు.

కార్డ్ తన పరిమితులను జాబితా చేస్తుంది. ఇది 30 సెకన్ల వరకు క్లిప్‌లపై శిక్షణ పొందింది, స్థానిక లిపిని మాత్రమే అవుట్‌పుట్ చేస్తుంది, ఒకే వక్త ఉంటారని ఊహిస్తుంది. ఆటోమేటిక్ భాషా గుర్తింపు అసమానంగా ఉంది, భోజ్‌పురి, మైథిలి, ఉర్దూలు తరచూ హిందీలో కలిసిపోతాయి.

Bodhan కార్డ్, Josh Talks పేజీ అవే మోడల్స్ విషయంలో ఏకీభవించవు కూడా. Josh Talks పట్టికలో 6.0, 13.7 ఉన్న చోట కార్డ్ హిందీకి Gemini 3 Proకు 9.3, OmniASR LLM 7Bకి 9.6 ఇస్తుంది. తేడాను ఏ పేజీ వివరించదు, కాబట్టి రెండింటి స్కోర్లను కలపలేము.

గూగుల్, ఓపెన్‌ఏఐ భాషల సంఖ్యలను ప్రచురిస్తాయి

2026 అక్టోబర్ 7న నవీకరించిన గూగుల్ Chirp 3 డాక్యుమెంటేషన్ హిందీని, భారతీయ ఇంగ్లిష్‌ను సాధారణంగా అందుబాటులో ఉన్నవిగా జాబితా చేస్తుంది. మరో పది భారతీయ భాషలు ప్రివ్యూలో ఉన్నాయి, అవి అస్సామీ, బెంగాలీ, గుజరాతీ, కన్నడ, మలయాళం, మరాఠీ, ఒడియా, పంజాబీ, తమిళం, తెలుగు. ఉర్దూ కనిపించదు. పేజీ దోష రేట్లను ఇవ్వదు.

2026 జూన్ 9న ప్రకటించిన గూగుల్ Gemini 3.5 Live Translate 70 లేదా అంతకంటే ఎక్కువ భాషల నుండి ప్రసంగాన్ని అనువదిస్తుంది, వక్త వేగాన్ని, స్వర స్థాయిని నిలుపుకోవడం లక్ష్యం. గూగుల్ మీట్ స్పీచ్ అనువాదం ఐదు భాషల నుండి 70 లేదా అంతకంటే ఎక్కువకు, ఇంగ్లిష్-మాత్రమే జతల నుండి ఒకే మీటింగ్‌లో 2,000కు పైగా భాషా కలయికలకు పెరుగుతుంది. అనువాదం వక్త కంటే కొన్ని సెకన్లు వెనుకే ఉంటుందని పోస్ట్ చెబుతోంది, బెంచ్‌మార్క్ సంఖ్యలను గాని భారతీయ భాషల పేర్లను గాని ఇవ్వదు.

2026 మేలో నివేదించిన ఓపెన్‌ఏఐ gpt-realtime-translate, తన కుక్‌బుక్ జాబితాలో హిందీ, బెంగాలీ, గుజరాతీ, మలయాళం, పంజాబీ, తెలుగుతో సహా 70కి పైగా భాషల్లో ప్రసంగాన్ని అంగీకరిస్తుంది. స్పీచ్ అవుట్‌పుట్ 13 భాషల్లో వస్తుంది, వాటిలో భారతీయ భాష హిందీ ఒక్కటే. ఈ మోడల్ తప్పు పేర్లను లేదా అంశాలను ప్రతిక్షేపించగలదని ఓపెన్‌ఏఐ కుక్‌బుక్ హెచ్చరిస్తుంది, లేటెన్సీ సంఖ్యలను ఇవ్వదు.

భారత్ తన సొంత భాషల్లో AI నిర్మిస్తున్న ప్రయత్నంలో వివరించిన ప్రభుత్వ వేదిక భాషిణి కూడా స్పీచ్ సేవలను అందిస్తుంది. దాని మోడల్స్‌కు ప్రచురిత దోష రేట్లను tuput కనుగొనలేదు, అందుకే ఇక్కడ స్కోర్ చేయలేదు. ట్రాన్స్‌క్రిప్షన్, అనువాదం కోసం సుప్రీంకోర్టు సొంత AI వినియోగం భారత కోర్టుల్లో AIలో ఉంది.

పేర్లు, రంగాల పదజాలం, అంకెల మూల్యాంకనాన్ని Josh Talks రచన భవిష్యత్ పనిగా జాబితా చేస్తుంది, కాబట్టి పైన ఉన్న ఏ స్కోరూ పేర్లను, పరిభాషను, అంకెలను కవర్ చేయదు.

Share
Copied!

మూలాలు మరియు మరింత చదవడానికి

  1. Meta AI: Omnilingual ASR, advancing automatic speech recognition (10 November 2025)
  2. arXiv: Omnilingual ASR, Open-Source Multilingual Speech Recognition for 1600+ Languages (12 November 2025)
  3. GitHub: facebookresearch/omnilingual-asr, code, model list and 7B per-language results table
  4. arXiv: Omnilingual MT, Machine Translation for 1,600 Languages (17 March 2026)
  5. Sarvam AI: Saaras V3 speech recognition (11 February 2026)
  6. Sarvam AI: Introducing Saaras V4 (25 September 2026)
  7. Sarvam AI: Sarvam Audio (3 February 2026)
  8. arXiv: IndicVoices, Towards building an Inclusive Multilingual Speech Dataset for Indian Languages (4 March 2024)
  9. arXiv: Towards Orthographically-Informed Evaluation of Speech Recognition Systems for Indian Languages (1 March 2026)
  10. arXiv: Voice of India, A Large-Scale Benchmark for Real-World Speech Recognition in India (21 April 2026)
  11. Josh Talks AI: Voice of India, Building India's National ASR Benchmark (April 2026)
  12. Hugging Face: Bodhan AI Indic-Transcribe-core model card (September 2026)
  13. DT Next: IIT-M-incubated Bodhan AI unveils open models for Indian languages (12 September 2026)
  14. Google Cloud: Chirp 3 transcription model documentation (last updated 7 October 2026)
  15. Google: Fluid, natural voice translation with Gemini 3.5 Live Translate (9 June 2026)
  16. OpenAI Cookbook: Build Live Translation Apps with gpt-realtime-translate
  17. Quantum Zeitgeist: OpenAI's New Model Translates 70+ Languages in Realtime (11 May 2026)
  18. TechCrunch: OpenAI upgrades its transcription and voice-generating AI models (20 March 2025)

ఈ వ్యాసం AI సాధనాల సహాయంతో పరిశోధించి రాయబడింది మరియు కచ్చితత్వం కోసం సవరించబడింది. ఇది సాధారణ సమాచారం మరియు చర్చ కోసం మాత్రమే, వృత్తిపరమైన సలహా కాదు. మా సంపాదకీయ ప్రమాణాలు మరియు నిరాకరణ చూడండి. తప్పు కనిపించిందా? మాకు తెలియజేయండి.

#speech recognition#machine translation#indic languages#sarvam ai#omnilingual asr#voice of india#ai4bharat#live translation

నచ్చిందా? తదుపరిది పొందండి.

ఒకసారి ఒక మంచి వ్యాసం, నేరుగా మీ ఇన్‌బాక్స్‌కు. స్పామ్ లేదు, ఎప్పుడైనా ఆపవచ్చు.

ఇదే విభాగంలో మరిన్ని: కృత్రిమ మేధస్సు
IndiaAI మిషన్‌కు గంటకు రూ. 65 చొప్పున 38,000కు పైగా GPUలు, నిధులు అందుకున్న 12 మోడల్ నిర్మాతలు ఉన్నారు, కానీ దాని 2025-26 బడ్జెట్‌ను రూ. 2,000 కోట్ల నుండి రూ. 800 కోట్లకు తగ్గించారు
కంప్యూట్ చౌకగా దొరుకుతోంది, మొదటి మోడళ్లు వచ్చాయి, బడ్జెట్ పద్దు చిన్నది. మిషన్‌లోని ప్రతి స్తంభం గురించి ప్రభుత్వ సొంత పత్రాలు ఏం చెబుతున్నాయి, Carnegie India, Takshashila, IISc తో అనుబంధం ఉన్న ఒక పరిశోధనా అధిపతి ఎక్కడ విభేదిస్తున్నారు.
ప్రపంచం మొదట ఇంగ్లీషులో AIని నిర్మించింది. భారత్ ఇప్పుడే తన సొంత భాషల్లో ఒకటి నిర్మించడానికి 1.25 బిలియన్ డాలర్లు ఖర్చు చేసింది
ఒక ప్రభుత్వ కార్యక్రమం మార్కెట్ ధరలో కొంత భాగానికి దాదాపు అరవై వేల GPUలను భారతీయ స్టార్టప్‌లకు అద్దెకు ఇస్తోంది, మరియు ఒక అనువాద వేదిక ChatGPT ఇప్పటికీ తడబడే భాషల్లో రోజుకు కోట్లాది అభ్యర్థనలను నిర్వహిస్తోంది. ప్రతి పందెం ఇంకా ఫలించలేదు.
స్కేల్ SWE-Bench Pro బోర్డు ఉత్తమ కోడింగ్ ఏజెంట్‌ను 61.5% వద్ద ఉంచింది, పరీక్షలు పాస్ అయ్యే చాలా ఫిక్స్‌లను మెయింటెయినర్లు తిరస్కరిస్తున్నారు, ఏజెంట్లు ఎంత సమయం ఆదా చేస్తాయో తన తాజా ట్రయల్ చూపలేదని METR అంటోంది
ఏజెంట్లు బలంగా ఉన్నాయని బెంచ్‌మార్క్‌లు చెబుతాయి. చిత్రం అంత విశాలంగా లేదని మెయింటెయినర్లు, ఒక యాదృచ్ఛిక ట్రయల్, ఘటన నివేదికల రాశి చెబుతాయి. ప్రతి సంఖ్య నిజంగా ఏం కొలుస్తుందో ఇక్కడ ఉంది.
← అన్ని వ్యాసాలు