Skip to content
सर्वम २२ भारतीय भाषांमध्ये सुमारे १९% शब्द त्रुटी नोंदवते आणि मेटा १,६०० भाषा व्यापते, पण प्रसिद्ध झालेले बहुतेक वाचन गुण बनवणाऱ्यांनीच मोजलेले आहेत
कृत्रिम बुद्धिमत्ता

सर्वम २२ भारतीय भाषांमध्ये सुमारे १९% शब्द त्रुटी नोंदवते आणि मेटा १,६०० भाषा व्यापते, पण प्रसिद्ध झालेले बहुतेक वाचन गुण बनवणाऱ्यांनीच मोजलेले आहेत

चित्रण: tuput

मराठी

सर्वमच्या सारस व्ही३ ने फेब्रुवारी २०२६ मध्ये इंडिकव्हॉइसेस चाचणीवर सुमारे १९% शब्द त्रुटी नोंदवली, आणि मेटाचे खुले मॉडेल हिंदीसाठी ३.६ अक्षर त्रुटी दर देते. भारतीय फोन कॉल्सवर बनलेली एकमेव कसोटी तिचा चाचणी संच खासगी ठेवते, आणि गुगल व ओपनएआय यांच्या नव्या वाक् उत्पादनांच्या स्वतःच्या पानांवर भाषांची संख्या आहे पण भारतीय भाषांचे त्रुटी दर नाहीत.

· · 6 मिनिटांचे वाचन

सर्वम एआयचे सारस व्ही३ हे वाक् मॉडेल इंडिकव्हॉइसेस कसोटीवर सुमारे १९% शब्द त्रुटीचा गुण मिळवते, असे सर्वमच्याच ११ फेब्रुवारी २०२६ च्या पोस्टमध्ये म्हटले आहे. मेटाचे १० नोव्हेंबर २०२५ रोजी प्रसिद्ध झालेले खुले ओम्नीलिंग्वल एएसआर मॉडेल आपल्या निकाल तक्त्यात हिंदीसाठी ३.६ अक्षर त्रुटी दर नोंदवते. हे दोन आकडे वेगळ्या ध्वनीवर वेगळ्या गोष्टी मोजतात, आणि प्रसिद्ध झालेले इतर बहुतेक गुणही तितकेच जुळवायला अवघड आहेत.

शब्द त्रुटी दर (WER) म्हणजे माणसाने लिहिलेल्या प्रतिलेखाच्या तुलनेत प्रणालीने चुकवलेल्या शब्दांचा वाटा. अक्षर त्रुटी दर (CER) त्याऐवजी चुकीची अक्षरे मोजतो. भारतीय भाषांमध्ये आणखी एक अडचण येते. आयआयटी मद्रासमधील भाषा-तंत्रज्ञान प्रयोगशाळा एआय४भारतच्या संशोधकांनी १ मार्च २०२६ च्या प्रीप्रिंटमध्ये लिहिले की लवचिक स्पेलिंग आणि शब्द तोडणे किंवा जोडणे ऐच्छिक असल्यामुळे साधा WER प्रणालींना वापरकर्त्यांना वाटते त्यापेक्षा वाईट गुण देतो.

सर्वमची २२ भाषांची मॉडेल

सारस व्ही३ एका मॉडेलमध्ये २२ अधिकृत भारतीय भाषा आणि इंग्रजी हाताळते. सर्वमच्या पोस्टमध्ये सर्व भाषांसाठी इंडिकव्हॉइसेसवर सुमारे १९% WER आणि सर्वाधिक बोलल्या जाणाऱ्या दहासाठी १९.३१% दिला आहे. ११ भाषा व्यापणारे आधीचे सारस व्ही२.५ त्याच संचावर सुमारे २२% गुण मिळवत होते, असे ते म्हणते.

इंडिकव्हॉइसेस हा एआय४भारतचा डेटासंच आहे. त्याचा २०२४ चा शोधनिबंध २२ भाषांमधील १४५ जिल्ह्यांतील १६,२३७ वक्त्यांचे ७,३४८ तासांचे बोलणे वर्णन करतो, त्यापैकी तेव्हा १,६३९ तासांचे प्रतिलेखन झाले होते. सर्वमची पोस्ट जीपीटी-४ओ ट्रान्सक्राइब, जेमिनी ३ प्रो, डीपग्राम नोव्हा३ आणि इलेव्हनलॅब्स स्क्राइब व्ही२ यांची नावे ती हरवते असे प्रतिस्पर्धी म्हणून देते, पण त्यांचे गुण छापत नाही. पोस्टमध्ये बाह्य मूल्यमापकाचे नाव नाही.

सारस व्ही४ २५ सप्टेंबर २०२६ रोजी आले. सर्वम IndicContextEval वर १६.०३% WER नोंदवते, ही एआय४भारतची चाचणी आहे जिथे वापरकर्ता मुख्य संज्ञा पुरवतो, आणि सर्व २२ भाषांमध्ये ५.२२% आणि पहिल्या दहामध्ये २.९% भाषा-ओळख त्रुटी. व्ही४ चे बहुतेक अचूकता निकाल केवळ आलेखांच्या रूपात दिसतात. सिंक्रोनस एपीआय ३० सेकंदांपेक्षा कमी ध्वनी घेते, आणि बॅच कामे दोन तासांपर्यंतच्या फाइल्स घेतात.

सर्वम ऑडिओ, ३ फेब्रुवारी २०२६ रोजी जाहीर झालेले, हे वेगळे मॉडेल आहे, सर्वमच्या ३ अब्ज पॅरामीटरच्या भाषा मॉडेलचा ध्वनी विस्तार. पोस्ट त्याची तुलना इंडिकव्हॉइसेसवर जीपीटी-४ओ ट्रान्सक्राइब आणि जेमिनी ३ फ्लॅशशी करते पण आकडे देत नाही, आणि ते अजून सर्वांसाठी उपलब्ध नव्हते असे म्हणते.

मार्च २०२६ चा एआय४भारत प्रीप्रिंट, ज्याच्या लेखकांमध्ये एक सर्वम संशोधक आहे आणि ज्याचे समवयस्क पुनरावलोकन झालेले नाही, स्पेलिंगमधील प्रकार गुणांना किती विकृत करतात ते मोजतो. त्याचा ऑर्थोग्राफिकली इन्फॉर्म्ड WER (OIWER) शब्दाचे सूचीतील कोणतेही स्पेलिंग स्वीकारतो. एका मॉडेलसाठी तो सरासरी ६.३ गुणांनी कमी आला, आणि मराठी व गुजरातीसाठी सुमारे ५.३ च्या तुलनेत तमिळसाठी सरासरी तफावत १४.४ गुण आणि मल्याळमसाठी १३.९ होती.

मेटाच्या १,६०० भाषा

ओम्नीलिंग्वल एएसआर १,६०० हून अधिक भाषा व्यापते, आणि त्यांपैकी ५०० हून अधिक भाषांचे एआयने कधीच प्रतिलेखन केले नव्हते असे मेटा म्हणते. मॉडेल ३० कोटी ते ७ अब्ज पॅरामीटरपर्यंत आहेत. कोड आणि मॉडेल अपाचे २.० परवान्याखाली आहेत, आणि निबंधातील डिकोडर मोठ्या भाषा मॉडेलांकडून उसने घेतो. मेटाचा स्वतःचा ठळक निष्कर्ष असा की ७ अब्ज पॅरामीटरच्या मॉडेलने ७८% भाषांसाठी १० पेक्षा कमी CER मिळवला.

गिटहबवरील प्रकल्पाचा निकाल तक्ता भारतीय चित्र देतो. हिंदी २३६.७ तासांच्या प्रशिक्षण ध्वनीनंतर ३.६ CER मिळवते, तमिळ ३७९.३ तासांनंतर ५.२, बंगाली २.८ आणि ओडिया ५१.८ तासांनंतर ५.८. भोजपुरीला ५.५ प्रशिक्षण तास आहेत आणि CER १६.५ आहे. संथाली ०.४ तासांवर ४.९ वर आहे. तक्त्यात चाचणी ध्वनीचे नाव सांगणारा स्तंभ नाही.

दोन मर्यादा नोंदवल्या आहेत. काही उदाहरणांवरून मॉडेलला नवी भाषा शिकवणे पूर्ण प्रशिक्षणापेक्षा कमी अचूक असते, असे मेटा म्हणते. आणि गिटहबचे पान सांगते की बहुतेक चेकपॉइंट ४० सेकंद किंवा त्याहून लांब क्लिप नाकारतात, पण डिसेंबर २०२५ च्या अद्यतनाने लांब ध्वनीसाठी “Unlimited” प्रकार जोडले.

भाषांतरासाठी, मेटाचा १७ मार्च २०२६ चा ओम्नीलिंग्वल एमटी निबंध, लेखक ज्याला १,६०० हून अधिक भाषांना आधार देणारी पहिली प्रणाली म्हणतात, तिचे वर्णन करतो. त्याची १ अब्ज ते ८ अब्ज पॅरामीटरची मॉडेल ७० अब्ज पॅरामीटरच्या आधारभूत मॉडेलशी बरोबरी करतात किंवा त्याला मागे टाकतात, असे लेखक म्हणतात. आधारभूत मॉडेल अनेकदा कमी संसाधनांच्या भाषेला समजतात पण ती वाईट निर्माण करतात, असेही ते नोंदवतात. सारांशात किंवा उघडलेल्या पानांवर tuput ला भाषावार भारतीय गुण आढळले नाहीत.

भारतीय फोन कॉल्सवर बनलेली एकमेव कसोटी

जोश टॉक्सने एआय४भारतसोबत चालवलेली आणि इंटरस्पीच २०२६ साठी स्वीकारली गेलेली व्हॉइस ऑफ इंडिया १५ भाषांमधील ३६,६९१ वक्त्यांचे ५३६ तासांचे अलिखित टेलिफोन भाषण वापरते. ती OI-WER ने गुण देते, जो वैध स्पेलिंगचा जाळीसारखा संच आहे. मुख्य चाचणी संच खासगी आहे, त्यामुळे बाहेरचे लोक निकाल पुन्हा मिळवू शकत नाहीत, आणि फक्त एक लहान सार्वजनिक नमुना नियोजित आहे.

जोश टॉक्सच्या एप्रिल २०२६ च्या लेखात त्याच्या तक्त्यात १५ प्रणालींना गुण दिले आहेत. ही OI-WER टक्केवारी आहे, कमी म्हणजे चांगले.

मॉडेलहिंदीबंगालीतमिळ
Sarvam Audio5.06.014.2
Gemini 3 Pro6.08.515.7
ElevenLabs Scribe v27.710.020.4
IndicConformer (AI4Bharat)8.210.719.9
OmniASR LLM 7B (Meta)13.722.843.1
GPT-4o Transcribe34.044.864.2

सर्वम ऑडिओ, सर्वमचे उत्पादन, तिन्ही भाषांत पहिले आहे. जीपीटी-४ओ ट्रान्सक्राइब हे मार्च २०२५ चे ओपनएआयचे मॉडेल आहे. त्याच्या प्रकाशनाच्या वेळी टेकक्रंचने ओपनएआयच्या अंतर्गत कसोटीचा हवाला देत तमिळ, तेलुगू, मल्याळम आणि कन्नडसाठी ३०% च्या जवळ जाणारा शब्द त्रुटी दर नोंदवला होता. ती व्हॉइस ऑफ इंडियाच्या कसोटीपेक्षा वेगळी चाचणी आहे.

लेख स्वतःच्या मर्यादा नोंदवतो. गुणदान जाळ्यांमागील गृहीतके ओळख मॉडेलांच्या अंतर्गत समूहातून येतात. व्यक्तिनामे, क्षेत्रीय संज्ञा आणि संख्या अजून तपासलेल्या नाहीत. महिला वक्त्यांच्या तुलनेत पुरुष वक्त्यांमध्ये सुमारे १९ ते २१% सापेक्ष त्रुटी दंड दिसतो.

बोधनचे सप्टेंबरमधील प्रकाशन आणि न जुळणारे आकडे

सप्टेंबर २०२६ मध्ये आयआयटी मद्रासमध्ये उगवलेल्या आणि एआय४भारत व एनव्हिडियासोबत काम करणाऱ्या बोधन एआयने इंडिक-ट्रान्सक्राइब, वाक् ओळखीची खुली मॉडेल, प्रसिद्ध केली. कोअर मॉडेलचे कार्ड व्हॉइस ऑफ इंडियावर सरासरी OIWER ८.७ नोंदवते, सारस व्ही३ च्या १०.७, इंडिककॉन्फॉर्मरच्या १७.८ आणि जेमिनी ३ प्रोच्या २१.१ च्या तुलनेत. ते २५ भाषा व्यापते: इंग्रजी, २२ अनुसूचित भाषा, भोजपुरी आणि भिली. मूल्यमापन कोणी केले हे कार्ड सांगत नाही.

कार्ड आपल्या मर्यादा देते. ते ३० सेकंदांपर्यंतच्या क्लिपवर प्रशिक्षित आहे, फक्त मूळ लिपीत निकाल देते, आणि एकच वक्ता गृहीत धरते. आपोआप भाषा ओळख असमान आहे, आणि भोजपुरी, मैथिली आणि उर्दू अनेकदा हिंदीत मिसळली जातात.

बोधन कार्ड आणि जोश टॉक्सचे पान त्याच मॉडेलांबद्दलही एकमत नाहीत. कार्ड जेमिनी ३ प्रोला हिंदीसाठी ९.३ आणि OmniASR LLM 7B ला ९.६ देते, तिथे जोश टॉक्सच्या तक्त्यात ६.० आणि १३.७ आहेत. कोणतेही पान फरक स्पष्ट करत नाही, म्हणून दोन्हींचे गुण एकत्र करता येत नाहीत.

गुगल आणि ओपनएआय भाषांची संख्या प्रकाशित करतात

गुगलचे चिर्प ३ दस्तऐवज, ७ ऑक्टोबर २०२६ रोजी अद्ययावत, हिंदी आणि भारतीय इंग्रजी सर्वसाधारणपणे उपलब्ध म्हणून नोंदवतात. आणखी दहा भारतीय भाषा पूर्वावलोकनात आहेत, म्हणजे आसामी, बंगाली, गुजराती, कन्नड, मल्याळम, मराठी, ओडिया, पंजाबी, तमिळ आणि तेलुगू. उर्दू दिसत नाही. पानावर त्रुटी दर दिलेले नाहीत.

गुगलचे जेमिनी ३.५ लाइव्ह ट्रान्सलेट, ९ जून २०२६ रोजी जाहीर, ७० किंवा अधिक भाषांमधील भाषण भाषांतरित करते आणि वक्त्याची गती व सूर टिकवण्याचे उद्दिष्ट ठेवते. गुगल मीटचे भाषण भाषांतर पाच भाषांवरून ७० किंवा अधिकपर्यंत आणि केवळ इंग्रजी जोड्यांवरून एका बैठकीत २,००० हून अधिक भाषा संयोगांपर्यंत वाढते. भाषांतर वक्त्याच्या काही सेकंद मागे राहते, आणि पोस्ट कोणतेही कसोटी आकडे किंवा भारतीय भाषांची नावे छापत नाही.

ओपनएआयचे gpt-realtime-translate, मे २०२६ मध्ये वृत्त, ७० हून अधिक भाषांमधील भाषण स्वीकारते, कुकबुकच्या यादीत हिंदी, बंगाली, गुजराती, मल्याळम, पंजाबी आणि तेलुगूसह. भाषण निकाल १३ भाषांमध्ये येतो, आणि हिंदी ही त्यातील एकमेव भारतीय भाषा आहे. ओपनएआयचे कुकबुक इशारा देते की मॉडेल चुकीची नावे किंवा घटक बदलून टाकू शकते, आणि ते विलंबाचे आकडे देत नाही.

भाशिनी, भारताच्या स्वतःच्या भाषांमध्ये एआय उभारण्याच्या प्रयत्नात वर्णन केलेले सरकारी व्यासपीठ, वाक् सेवाही देते. tuput ला त्याच्या मॉडेलांसाठी प्रसिद्ध झालेले त्रुटी दर आढळले नाहीत, म्हणून त्याला इथे गुण दिलेले नाहीत. सर्वोच्च न्यायालयाने प्रतिलेखन आणि भाषांतरासाठी स्वतः केलेल्या एआयच्या वापराची माहिती भारतीय न्यायालयांतील एआय मध्ये दिली आहे.

जोश टॉक्सचा लेख व्यक्तिनाम, क्षेत्रीय आणि संख्यात्मक मूल्यमापन पुढील कामात टाकतो, त्यामुळे वरीलपैकी कोणताही गुण नावे, परिभाषा किंवा अंक यांना व्यापत नाही.

Share
Copied!

स्रोत आणि पुढील वाचन

  1. Meta AI: Omnilingual ASR, advancing automatic speech recognition (10 November 2025)
  2. arXiv: Omnilingual ASR, Open-Source Multilingual Speech Recognition for 1600+ Languages (12 November 2025)
  3. GitHub: facebookresearch/omnilingual-asr, code, model list and 7B per-language results table
  4. arXiv: Omnilingual MT, Machine Translation for 1,600 Languages (17 March 2026)
  5. Sarvam AI: Saaras V3 speech recognition (11 February 2026)
  6. Sarvam AI: Introducing Saaras V4 (25 September 2026)
  7. Sarvam AI: Sarvam Audio (3 February 2026)
  8. arXiv: IndicVoices, Towards building an Inclusive Multilingual Speech Dataset for Indian Languages (4 March 2024)
  9. arXiv: Towards Orthographically-Informed Evaluation of Speech Recognition Systems for Indian Languages (1 March 2026)
  10. arXiv: Voice of India, A Large-Scale Benchmark for Real-World Speech Recognition in India (21 April 2026)
  11. Josh Talks AI: Voice of India, Building India's National ASR Benchmark (April 2026)
  12. Hugging Face: Bodhan AI Indic-Transcribe-core model card (September 2026)
  13. DT Next: IIT-M-incubated Bodhan AI unveils open models for Indian languages (12 September 2026)
  14. Google Cloud: Chirp 3 transcription model documentation (last updated 7 October 2026)
  15. Google: Fluid, natural voice translation with Gemini 3.5 Live Translate (9 June 2026)
  16. OpenAI Cookbook: Build Live Translation Apps with gpt-realtime-translate
  17. Quantum Zeitgeist: OpenAI's New Model Translates 70+ Languages in Realtime (11 May 2026)
  18. TechCrunch: OpenAI upgrades its transcription and voice-generating AI models (20 March 2025)

हा लेख AI साधनांच्या मदतीने संशोधित आणि लिहिला गेला असून अचूकतेसाठी संपादित केला आहे. हा केवळ सर्वसाधारण माहिती आणि चर्चेसाठी आहे, व्यावसायिक सल्ला नाही. आमचे संपादकीय मानक आणि अस्वीकरण पाहा. चूक आढळली? आम्हाला कळवा.

#speech recognition#machine translation#indic languages#sarvam ai#omnilingual asr#voice of india#ai4bharat#live translation

आवडलं? पुढचा लेख मिळवा.

एका वेळी एक चांगला लेख, थेट तुमच्या इनबॉक्समध्ये. स्पॅम नाही, हवं तेव्हा थांबवा.

याच विभागात आणखी: कृत्रिम बुद्धिमत्ता
इंडियाAI मिशनकडे तासाला ६५ रुपये दराने ३८,००० हून अधिक GPU आहेत आणि १२ मॉडेल बांधणाऱ्यांना निधी मिळाला आहे, पण २०२५-२६ चे त्याचे अंदाजपत्रक २,००० कोटी रुपयांवरून ८०० कोटी रुपयांपर्यंत खाली सुधारण्यात आले
संगणन स्वस्त आहे, पहिली मॉडेल बाहेर आली आहेत आणि अंदाजपत्रकातील तरतूद लहान आहे. मिशनच्या प्रत्येक स्तंभाबद्दल सरकारची स्वतःची कागदपत्रे काय सांगतात, आणि कार्नेगी इंडिया, तक्षशिला आणि IISc शी जोडलेल्या एका संशोधन प्रमुखाचा विरोध कुठे आहे.
जगाने आधी इंग्रजीत एआय बनवला. भारताने आत्ताच स्वतःच्या भाषांमध्ये एक बनवण्यासाठी १.२५ अब्ज डॉलर खर्च केले
एक सरकारी कार्यक्रम बाजारभावाच्या एका अंशात जवळपास साठ हजार GPU भारतीय स्टार्टअप्सना भाड्याने देत आहे, आणि एक भाषांतर मंच दररोज कोट्यवधी विनंत्या हाताळतो अशा भाषांमध्ये जिथे ChatGPT आजही अडखळतो. प्रत्येक डाव अजून यशस्वी झालेला नाही.
Scale च्या SWE-Bench Pro फलकावर सर्वोत्तम कोडिंग एजंट ६१.५% वर आहे, चाचण्या पास होणाऱ्या अनेक दुरुस्त्या देखभालकर्ते नाकारतात, आणि METR म्हणते की तिची ताजी चाचणी एजंट किती वेळ वाचवतात हे दाखवू शकत नाही
बेंचमार्क म्हणतात की एजंट प्रबळ आहेत. देखभालकर्ते, एक यादृच्छिक चाचणी आणि घटना अहवालांचा ढीग म्हणतात की चित्र त्यापेक्षा संकुचित आहे. प्रत्येक आकडा प्रत्यक्षात काय मोजतो ते येथे आहे.
← सर्व लेख