चित्रण: tuput
हिन्दी
सर्वम के सारस V3 ने फ़रवरी 2026 में इंडिकवॉइसेज़ टेस्ट पर क़रीब 19% शब्द-त्रुटि दर्ज की, और मेटा के ओपन मॉडल में हिंदी के लिए 3.6 की कैरेक्टर एरर रेट लिखी है। भारतीय फ़ोन कॉलों पर बना इकलौता बेंचमार्क अपना टेस्ट सेट निजी रखता है, और गूगल व ओपनएआई के अपने नवीनतम स्पीच उत्पादों के पन्ने भाषाओं की गिनती देते हैं पर भारतीय भाषाओं की त्रुटि दरें नहीं।
सर्वम एआई का सारस V3 स्पीच मॉडल इंडिकवॉइसेज़ बेंचमार्क पर क़रीब 19% शब्द-त्रुटि स्कोर करता है, सर्वम की 11 फ़रवरी 2026 की अपनी पोस्ट के मुताबिक़। मेटा का ओपन ओम्निलिंगुअल एएसआर मॉडल, जो 10 नवंबर 2025 को जारी हुआ, अपनी नतीजा-तालिका में हिंदी के लिए 3.6 की कैरेक्टर एरर रेट लिखता है। दोनों संख्याएँ अलग-अलग ऑडियो पर अलग-अलग चीज़ें मापती हैं, और प्रकाशित बाक़ी ज़्यादातर स्कोरों को भी एक सीध में रखना उतना ही मुश्किल है।
वर्ड एरर रेट (डब्ल्यूईआर) वह हिस्सा है जितने शब्द कोई सिस्टम इंसानी ट्रांसक्रिप्ट के मुक़ाबले ग़लत पाता है। कैरेक्टर एरर रेट (सीईआर) इसके बजाय ग़लत अक्षर गिनती है। भारतीय भाषाएँ एक और दिक़्क़त जोड़ती हैं। आईआईटी मद्रास की भाषा-तकनीक प्रयोगशाला एआई4भारत के शोधकर्ताओं ने 1 मार्च 2026 के एक प्रीप्रिंट में लिखा कि वर्तनी की लचक और शब्दों को वैकल्पिक रूप से तोड़ने या जोड़ने के कारण सादा डब्ल्यूईआर सिस्टमों को उपयोगकर्ताओं के अनुभव से ज़्यादा ख़राब आँकता है।
सर्वम के 22-भाषा वाले मॉडल
सारस V3 एक ही मॉडल में 22 आधिकारिक भारतीय भाषाओं और अंग्रेज़ी को सँभालता है। सर्वम की पोस्ट सभी भाषाओं के लिए इंडिकवॉइसेज़ पर क़रीब 19% डब्ल्यूईआर देती है और सबसे ज़्यादा बोली जाने वाली दस भाषाओं के लिए 19.31%। वह कहती है कि पहले का सारस V2.5, जो 11 भाषाओं को कवर करता था, उसी सेट पर क़रीब 22% स्कोर करता था।
इंडिकवॉइसेज़ एआई4भारत का डेटासेट है। उसका 2024 का शोध-पत्र 22 भाषाओं में 145 ज़िलों के 16,237 वक्ताओं की 7,348 घंटे की बोली का वर्णन करता है, जिसमें से उस समय 1,639 घंटे ट्रांसक्राइब हो चुके थे। सर्वम की पोस्ट जीपीटी-4ओ ट्रांसक्राइब, जेमिनी 3 प्रो, डीपग्राम नोवा3 और इलेवनलैब्स स्क्राइब v2 को प्रतिद्वंद्वी बताकर कहती है कि वह उन्हें हराता है, पर उनके स्कोर नहीं छापती। पोस्ट किसी बाहरी मूल्यांकनकर्ता का नाम नहीं लेती।
सारस V4 25 सितंबर 2026 को आया। सर्वम इंडिककॉन्टेक्स्टइवल पर, जो एआई4भारत का एक टेस्ट है जिसमें उपयोगकर्ता मुख्य शब्द देता है, 16.03% डब्ल्यूईआर बताता है, और सभी 22 भाषाओं में 5.22% तथा शीर्ष दस में 2.9% की भाषा-पहचान त्रुटि। V4 के ज़्यादातर सटीकता-नतीजे सिर्फ़ चार्ट के रूप में दिखते हैं। सिंक्रोनस एपीआई 30 सेकंड से छोटा ऑडियो लेता है, और बैच जॉब दो घंटे तक की फ़ाइलें।
सर्वम ऑडियो, जिसकी घोषणा 3 फ़रवरी 2026 को हुई, एक अलग मॉडल है, सर्वम के 3-अरब-पैरामीटर वाले भाषा मॉडल का ऑडियो विस्तार। पोस्ट इंडिकवॉइसेज़ पर उसकी तुलना जीपीटी-4ओ ट्रांसक्राइब और जेमिनी 3 फ़्लैश से करती है, बिना संख्याएँ दिए, और कहती है कि वह अभी आम उपलब्धता में नहीं था।
एआई4भारत का मार्च 2026 का प्रीप्रिंट, जिसके लेखकों में एक सर्वम शोधकर्ता है और जिसकी सहकर्मी-समीक्षा नहीं हुई है, यह मापता है कि वर्तनी के रूप स्कोरों को कितना बिगाड़ते हैं। उसका वर्तनी-सूचित डब्ल्यूईआर (ओआईडब्ल्यूईआर) किसी शब्द की सूचीबद्ध हर वर्तनी को मान लेता है। एक मॉडल के लिए यह औसतन 6.3 अंक कम आया, और तमिल के लिए औसत अंतर 14.4 अंक और मलयालम के लिए 13.9 था, जबकि मराठी और गुजराती के लिए क़रीब 5.3।
मेटा की 1,600 भाषाएँ
ओम्निलिंगुअल एएसआर 1,600 से ज़्यादा भाषाओं को कवर करता है, और मेटा कहता है कि उनमें से 500 से ऊपर को पहले कभी एआई ने ट्रांसक्राइब नहीं किया था। मॉडल 30 करोड़ से 7 अरब पैरामीटर तक के हैं। कोड और मॉडल अपाचे 2.0 लाइसेंस के तहत हैं, और शोध-पत्र का डिकोडर बड़े भाषा मॉडलों से उधार लेता है। मेटा की अपनी सुर्ख़ी यह है कि उसके 7-अरब-पैरामीटर वाले मॉडल से 78% भाषाओं में सीईआर 10 से नीचे है।
गिटहब पर परियोजना की नतीजा-तालिका भारत की तस्वीर देती है। हिंदी 236.7 घंटे के प्रशिक्षण ऑडियो के बाद 3.6 सीईआर स्कोर करती है, तमिल 379.3 घंटे के बाद 5.2, बांग्ला 2.8 और ओड़िया 51.8 घंटे के बाद 5.8। भोजपुरी के पास 5.5 प्रशिक्षण घंटे हैं और 16.5 का सीईआर। संथाली 0.4 घंटे पर 4.9 पर है। तालिका में कोई स्तंभ नहीं है जो टेस्ट ऑडियो का नाम बताए।
दो सीमाएँ दर्ज हैं। मेटा कहता है कि कुछ उदाहरणों से मॉडल को नई भाषा सिखाना पूरे प्रशिक्षण से कम सटीक है। और गिटहब पन्ना कहता है कि ज़्यादातर चेकपॉइंट 40 सेकंड या उससे लंबी क्लिप ठुकरा देते हैं, हालाँकि दिसंबर 2025 के अपडेट ने लंबे ऑडियो के लिए “Unlimited” संस्करण जोड़े।
अनुवाद के लिए, मेटा का 17 मार्च 2026 का ओम्निलिंगुअल एमटी शोध-पत्र उसका वर्णन करता है जिसे लेखक 1,600 से ज़्यादा भाषाओं का समर्थन करने वाला पहला सिस्टम कहते हैं। लेखकों के मुताबिक़ उसके 1 अरब से 8 अरब पैरामीटर वाले मॉडल 70-अरब-पैरामीटर वाले बेसलाइन की बराबरी करते हैं या उसे हराते हैं। वे यह भी बताते हैं कि बेसलाइन मॉडल अक्सर कम संसाधन वाली भाषा को समझ लेते हैं पर उसे ख़राब ढंग से पैदा करते हैं। tuput को सार या खोले गए पन्नों में भारतीय भाषाओं के अलग-अलग स्कोर नहीं मिले।
भारतीय फ़ोन कॉलों पर बना इकलौता टेस्ट
वॉइस ऑफ़ इंडिया, जिसे जॉश टॉक्स एआई4भारत के साथ चलाता है और जो इंटरस्पीच 2026 में स्वीकार हुआ, 15 भाषाओं के 36,691 वक्ताओं की 536 घंटे की बिना-लिखी टेलीफ़ोन बोली इस्तेमाल करता है। वह ओआई-डब्ल्यूईआर से स्कोर करता है, जो मान्य वर्तनियों का एक जाल है। मुख्य टेस्ट सेट निजी है, इसलिए बाहरी लोग नतीजे दोहरा नहीं सकते, और सिर्फ़ एक छोटा सार्वजनिक नमूना प्रस्तावित है।
जॉश टॉक्स का अप्रैल 2026 का लेख अपनी तालिका में 15 सिस्टमों को स्कोर करता है। ये ओआई-डब्ल्यूईआर के प्रतिशत हैं, कम बेहतर है।
| मॉडल | हिंदी | बांग्ला | तमिल |
|---|---|---|---|
| Sarvam Audio | 5.0 | 6.0 | 14.2 |
| Gemini 3 Pro | 6.0 | 8.5 | 15.7 |
| ElevenLabs Scribe v2 | 7.7 | 10.0 | 20.4 |
| IndicConformer (AI4Bharat) | 8.2 | 10.7 | 19.9 |
| OmniASR LLM 7B (Meta) | 13.7 | 22.8 | 43.1 |
| GPT-4o Transcribe | 34.0 | 44.8 | 64.2 |
सर्वम ऑडियो, जो सर्वम का अपना उत्पाद है, तीनों पर पहले नंबर पर है। जीपीटी-4ओ ट्रांसक्राइब मार्च 2025 का ओपनएआई मॉडल है। टेकक्रंच ने उसके लॉन्च पर, ओपनएआई के आंतरिक बेंचमार्क का हवाला देकर, तमिल, तेलुगु, मलयालम और कन्नड़ के लिए 30% के क़रीब पहुँचती शब्द-त्रुटि दर बताई थी। यह वॉइस ऑफ़ इंडिया के टेस्ट से अलग टेस्ट है।
लेख अपनी सीमाएँ ख़ुद गिनाता है। स्कोरिंग-जालों के पीछे की परिकल्पनाएँ पहचान मॉडलों के एक आंतरिक समूह से आती हैं। नामित इकाइयाँ, क्षेत्र-विशेष शब्द और संख्याएँ अभी परखी नहीं गई हैं। पुरुष वक्ताओं पर महिला वक्ताओं के मुक़ाबले क़रीब 19 से 21% का सापेक्ष त्रुटि-दंड दिखता है।
बोधन की सितंबर की रिलीज़ और न मिलते आँकड़े
सितंबर 2026 में बोधन एआई, एआई4भारत और एनवीडिया के साथ काम करने वाले आईआईटी मद्रास में इनक्यूबेट हुए एक समूह, ने इंडिक-ट्रांसक्राइब जारी किया, जो स्पीच रिकग्निशन के ओपन मॉडल हैं। कोर मॉडल का कार्ड वॉइस ऑफ़ इंडिया पर औसत ओआईडब्ल्यूईआर 8.7 बताता है, जबकि सारस V3 का 10.7, इंडिककॉन्फ़ॉर्मर का 17.8 और जेमिनी 3 प्रो का 21.1। यह 25 भाषाओं को कवर करता है: अंग्रेज़ी, 22 अनुसूचित भाषाएँ, भोजपुरी और भीली। कार्ड यह नहीं बताता कि मूल्यांकन किसने चलाया।
कार्ड अपनी सीमाएँ गिनाता है। उसे 30 सेकंड तक की क्लिपों पर प्रशिक्षित किया गया, वह सिर्फ़ मूल लिपि में आउटपुट देता है, और मानकर चलता है कि वक्ता एक है। स्वचालित भाषा-पहचान असमान है, और भोजपुरी, मैथिली और उर्दू अक्सर हिंदी में समा जाती हैं।
बोधन का कार्ड और जॉश टॉक्स का पन्ना उन्हीं मॉडलों पर आपस में असहमत भी हैं। कार्ड जेमिनी 3 प्रो को हिंदी के लिए 9.3 और ओम्निएएसआर एलएलएम 7B को 9.6 देता है, जहाँ जॉश टॉक्स की तालिका में 6.0 और 13.7 हैं। कोई पन्ना अंतर की वजह नहीं बताता, इसलिए दोनों के स्कोर मिलाकर नहीं रखे जा सकते।
गूगल और ओपनएआई भाषाओं की गिनती छापते हैं
गूगल के चिर्प 3 दस्तावेज़, जो 7 अक्टूबर 2026 को अपडेट हुए, हिंदी और भारतीय अंग्रेज़ी को आम उपलब्धता में बताते हैं। दस और भारतीय भाषाएँ प्रीव्यू में हैं, यानी असमिया, बांग्ला, गुजराती, कन्नड़, मलयालम, मराठी, ओड़िया, पंजाबी, तमिल और तेलुगु। उर्दू नहीं दिखती। पन्ना कोई त्रुटि दर नहीं देता।
गूगल का जेमिनी 3.5 लाइव ट्रांसलेट, जिसकी घोषणा 9 जून 2026 को हुई, 70 या ज़्यादा भाषाओं की बोली का अनुवाद करता है और वक्ता की रफ़्तार और स्वर को बनाए रखने का लक्ष्य रखता है। गूगल मीट का स्पीच अनुवाद पाँच भाषाओं से बढ़कर 70 या ज़्यादा तक पहुँचता है, और सिर्फ़ अंग्रेज़ी वाले जोड़ों से एक ही मीटिंग में 2,000 से ज़्यादा भाषा-संयोजनों तक। पोस्ट कहती है कि अनुवाद वक्ता से कुछ सेकंड पीछे रहता है, और कोई बेंचमार्क आँकड़े या भारतीय भाषाओं के नाम नहीं छापती।
ओपनएआई का जीपीटी-रियलटाइम-ट्रांसलेट, जिसकी ख़बर मई 2026 में आई, 70 से ज़्यादा भाषाओं की बोली लेता है, जिनमें उसकी कुकबुक सूची में हिंदी, बांग्ला, गुजराती, मलयालम, पंजाबी और तेलुगु हैं। बोली का आउटपुट 13 भाषाओं में आता है, और उनमें हिंदी इकलौती भारतीय है। ओपनएआई की कुकबुक चेताती है कि मॉडल ग़लत नाम या इकाइयाँ बदलकर रख सकता है, और वह विलंब के कोई आँकड़े नहीं देती।
भाषिणी, सरकारी मंच जिसकी चर्चा अपनी भाषाओं में एआई बनाने की भारत की कोशिश में है, स्पीच सेवाएँ भी देता है। tuput को उसके मॉडलों की कोई प्रकाशित त्रुटि दर नहीं मिली, इसलिए उसे यहाँ स्कोर नहीं किया गया है। सुप्रीम कोर्ट के ट्रांसक्रिप्शन और अनुवाद के लिए एआई के अपने इस्तेमाल का ब्योरा भारतीय अदालतों में एआई में है।
जॉश टॉक्स का लेख नामित-इकाई, क्षेत्र-विशेष और संख्या-आधारित मूल्यांकन को भविष्य का काम बताता है, इसलिए ऊपर का कोई स्कोर नाम, शब्दजाल या अंकों को कवर नहीं करता।
स्रोत और आगे पढ़ने के लिए
- Meta AI: Omnilingual ASR, advancing automatic speech recognition (10 November 2025)
- arXiv: Omnilingual ASR, Open-Source Multilingual Speech Recognition for 1600+ Languages (12 November 2025)
- GitHub: facebookresearch/omnilingual-asr, code, model list and 7B per-language results table
- arXiv: Omnilingual MT, Machine Translation for 1,600 Languages (17 March 2026)
- Sarvam AI: Saaras V3 speech recognition (11 February 2026)
- Sarvam AI: Introducing Saaras V4 (25 September 2026)
- Sarvam AI: Sarvam Audio (3 February 2026)
- arXiv: IndicVoices, Towards building an Inclusive Multilingual Speech Dataset for Indian Languages (4 March 2024)
- arXiv: Towards Orthographically-Informed Evaluation of Speech Recognition Systems for Indian Languages (1 March 2026)
- arXiv: Voice of India, A Large-Scale Benchmark for Real-World Speech Recognition in India (21 April 2026)
- Josh Talks AI: Voice of India, Building India's National ASR Benchmark (April 2026)
- Hugging Face: Bodhan AI Indic-Transcribe-core model card (September 2026)
- DT Next: IIT-M-incubated Bodhan AI unveils open models for Indian languages (12 September 2026)
- Google Cloud: Chirp 3 transcription model documentation (last updated 7 October 2026)
- Google: Fluid, natural voice translation with Gemini 3.5 Live Translate (9 June 2026)
- OpenAI Cookbook: Build Live Translation Apps with gpt-realtime-translate
- Quantum Zeitgeist: OpenAI's New Model Translates 70+ Languages in Realtime (11 May 2026)
- TechCrunch: OpenAI upgrades its transcription and voice-generating AI models (20 March 2025)
यह लेख AI उपकरणों की सहायता से शोधित और लिखा गया है, और सटीकता के लिए संपादित किया गया है। यह केवल सामान्य जानकारी और चर्चा के लिए है, पेशेवर सलाह नहीं। हमारे संपादकीय मानक और अस्वीकरण देखें। कोई त्रुटि मिली? हमें बताएँ।
अच्छा लगा? अगला लेख पाएँ।
एक बार में एक अच्छा लेख, सीधे आपके इनबॉक्स में। कोई स्पैम नहीं, जब चाहें अनसब्सक्राइब करें।