رسم: tuput
العربية
حقق نموذج Saaras V3 من Sarvam نحو 19 في المئة من خطأ الكلمات في اختبار IndicVoices في فبراير 2026، ويسرد نموذج Meta المفتوح معدل خطأ حروف قدره 3.6 للهندية. أما المعيار الوحيد المبني على مكالمات هاتفية هندية فيُبقي مجموعة اختباره سرية، ولا تذكر صفحتا Google وOpenAI لأحدث منتجاتهما الصوتية سوى أعداد اللغات دون معدلات خطأ للغات الهندية.
سجّل نموذج الكلام Saaras V3 من Sarvam AI نحو 19 في المئة من خطأ الكلمات في معيار IndicVoices، بحسب منشور Sarvam نفسها في 11 فبراير 2026. ونموذج Meta المفتوح Omnilingual ASR، الذي صدر في 10 نوفمبر 2025، يسرد في جدول نتائجه معدل خطأ حروف قدره 3.6 للهندية. والرقمان يقيسان أمرين مختلفين على تسجيلات مختلفة، ومعظم الدرجات المنشورة الأخرى يصعب بدورها وضعها في صف واحد.
معدل خطأ الكلمات (WER) هو حصة الكلمات التي يخطئ فيها النظام قياسا إلى تفريغ بشري. أما معدل خطأ الحروف (CER) فيعدّ الحروف الخاطئة بدلا من ذلك. وتضيف اللغات الهندية مشكلة أخرى. فقد كتب باحثون في AI4Bharat، مختبر تقنيات اللغة في IIT مدراس، في نسخة أولية بتاريخ 1 مارس 2026، أن مرونة الإملاء وجواز فصل الكلمات أو وصلها يجعلان WER البسيط يحكم على الأنظمة بأسوأ مما يجده المستخدمون.
نماذج Sarvam ذات اللغات الاثنتين والعشرين
يتعامل Saaras V3 مع 22 لغة هندية رسمية إضافة إلى الإنجليزية في نموذج واحد. ويعطي منشور Sarvam نحو 19 في المئة WER على IndicVoices لجميع اللغات و19.31 في المئة لأكثر عشر لغات تحدثا. ويقول إن Saaras V2.5 السابق، الذي غطى 11 لغة، سجّل نحو 22 في المئة على المجموعة نفسها.
IndicVoices مجموعة بيانات من AI4Bharat. وتصف ورقتها لعام 2024 7,348 ساعة من الكلام من 16,237 متحدثا في 145 منطقة عبر 22 لغة، فُرّغ منها 1,639 ساعة وقت النشر. ويسمي منشور Sarvam منافسين يتفوق عليهم هم GPT-4o Transcribe وGemini 3 Pro وDeepgram Nova3 وElevenLabs Scribe v2، لكنه لا يطبع لهم درجات. ولا يسمي المنشور جهة تقييم خارجية.
وجاء Saaras V4 في 25 سبتمبر 2026. وتعلن Sarvam 16.03 في المئة WER على IndicContextEval، وهو اختبار من AI4Bharat يقدم فيه المستخدم مصطلحات أساسية، وخطأ في تحديد اللغة قدره 5.22 في المئة عبر اللغات الـ22 كلها و2.9 في المئة عبر العشر الأولى. ومعظم نتائج دقة V4 ترد في رسوم بيانية فقط. وتقبل واجهة البرمجة المتزامنة صوتا أقل من 30 ثانية، وتقبل الدُفعات ملفات حتى ساعتين.
أما Sarvam Audio، المعلن عنه في 3 فبراير 2026، فنموذج منفصل، امتداد صوتي لنموذج Sarvam اللغوي ذي الثلاثة مليارات معامل. ويقارنه المنشور بـGPT-4o Transcribe وGemini 3 Flash على IndicVoices دون إعطاء أرقام، ويقول إنه لم يكن متاحا للجميع بعد.
وقاست نسخة AI4Bharat الأولية في مارس 2026، وبين مؤلفيها باحث من Sarvam ولم تخضع لمراجعة الأقران، مقدار ما تشوّهه صيغ الإملاء المتعددة للدرجات. ومعدل WER المراعي للإملاء (OIWER) يقبل أي إملاء مدرج للكلمة. وكان أقل بـ6.3 نقطة في المتوسط لنموذج واحد، وبلغت الفجوة المتوسطة 14.4 نقطة للتاميلية و13.9 للمالايالامية مقابل نحو 5.3 للماراثية والغوجاراتية.
لغات Meta الـ1,600
يغطي Omnilingual ASR أكثر من 1,600 لغة، وتقول Meta إن أكثر من 500 منها لم يفرّغها الذكاء الاصطناعي من قبل. وتتراوح النماذج بين 300 مليون و7 مليارات معامل. والشفرة والنماذج بترخيص Apache 2.0، ومفكك الترميز في الورقة يستعير من النماذج اللغوية الكبيرة. وعنوان Meta الرئيسي هو معدل CER أقل من 10 لـ78 في المئة من اللغات بنموذجها ذي السبعة مليارات معامل.
ويعطي جدول نتائج المشروع على GitHub الصورة الهندية. تسجل الهندية 3.6 CER بعد 236.7 ساعة من الصوت التدريبي، والتاميلية 5.2 بعد 379.3 ساعة، والبنغالية 2.8 والأودية 5.8 بعد 51.8 ساعة. وللبهوجبورية 5.5 ساعة تدريب ومعدل CER قدره 16.5. والسانتالية عند 4.9 على 0.4 ساعة. وليس في الجدول عمود يسمي الصوت المختبَر.
وثمة حدّان مسجلان. تقول Meta إن تعليم النموذج لغة جديدة من أمثلة قليلة أقل دقة من التدريب الكامل. وتقول صفحة GitHub إن معظم نقاط الحفظ ترفض المقاطع التي تبلغ 40 ثانية أو أكثر، وإن كان تحديث في ديسمبر 2025 أضاف نسخا “Unlimited” للصوت الأطول.
وفي الترجمة، تصف ورقة Omnilingual MT من Meta في 17 مارس 2026 ما يسميه المؤلفون أول نظام يدعم أكثر من 1,600 لغة. ونماذجها من مليار إلى 8 مليارات معامل تضاهي أو تتفوق على نموذج أساس ذي 70 مليار معامل، بحسب المؤلفين. ويذكرون أيضا أن نماذج الأساس كثيرا ما تفهم لغة قليلة الموارد لكنها تولّدها بشكل سيئ. ولم تجد tuput درجات للغات الهندية فرادى في الملخص ولا في الصفحات التي فتحتها.
الاختبار الوحيد المبني على مكالمات هاتفية هندية
يستخدم Voice of India، الذي تديره Josh Talks مع AI4Bharat وقُبل في Interspeech 2026، 536 ساعة من كلام هاتفي غير مكتوب مسبقا من 36,691 متحدثا بـ15 لغة. ويسجّل بـOI-WER، وهو شبكة من الإملاءات الصحيحة. ومجموعة الاختبار الأساسية سرية، فلا يستطيع الخارجيون إعادة إنتاج النتائج، ولا يُخطط إلا لعينة عامة صغيرة.
وتسجل مادة Josh Talks في أبريل 2026 درجات 15 نظاما في جدولها. هذه نسب OI-WER المئوية، والأقل أفضل.
| النموذج | الهندية | البنغالية | التاميلية |
|---|---|---|---|
| Sarvam Audio | 5.0 | 6.0 | 14.2 |
| Gemini 3 Pro | 6.0 | 8.5 | 15.7 |
| ElevenLabs Scribe v2 | 7.7 | 10.0 | 20.4 |
| IndicConformer (AI4Bharat) | 8.2 | 10.7 | 19.9 |
| OmniASR LLM 7B (Meta) | 13.7 | 22.8 | 43.1 |
| GPT-4o Transcribe | 34.0 | 44.8 | 64.2 |
يحتل Sarvam Audio، وهو منتج من Sarvam، المرتبة الأولى في الثلاث كلها. أما GPT-4o Transcribe فنموذج من OpenAI صدر في مارس 2025. وأفادت TechCrunch عند إطلاقه، نقلا عن معيار داخلي لدى OpenAI، بمعدل خطأ كلمات يقارب 30 في المئة للتاميلية والتيلوغوية والمالايالامية والكانادية. وهذا اختبار مختلف عن اختبار Voice of India.
وتسرد المادة حدودها بنفسها. فالفرضيات خلف شبكات التسجيل تأتي من تجمّع داخلي لنماذج التعرف. والأسماء العلم والمصطلحات التخصصية والأرقام لم تُختبر بعد. ويظهر المتحدثون الذكور عقوبة خطأ نسبية تبلغ نحو 19 إلى 21 في المئة قياسا إلى المتحدثات الإناث.
إصدار Bodhan في سبتمبر وأرقام لا تتطابق
في سبتمبر 2026 أطلقت Bodhan AI، وهي مجموعة حاضنتها IIT مدراس وتعمل مع AI4Bharat وNVIDIA، Indic-Transcribe، وهي نماذج مفتوحة للتعرف على الكلام. وتسجل بطاقة النموذج الأساسي (Core) متوسط OIWER قدره 8.7 على Voice of India، مقابل 10.7 لـSaaras V3 و17.8 لـIndicConformer و21.1 لـGemini 3 Pro. ويغطي 25 لغة: الإنجليزية واللغات الـ22 المجدولة والبهوجبورية والبهيلية. ولا تقول البطاقة من أجرى التقييم.
وتسرد البطاقة حدودها. فقد دُرّب على مقاطع حتى 30 ثانية، ويُخرج الكتابة بالخط الأصلي فقط، ويفترض متحدثا واحدا. وتحديد اللغة تلقائيا متفاوت، وكثيرا ما تُبتلع البهوجبورية والميثيلية والأردية في الهندية.
وتختلف بطاقة Bodhan وصفحة Josh Talks كذلك على النماذج نفسها. فالبطاقة تعطي Gemini 3 Pro الدرجة 9.3 للهندية وOmniASR LLM 7B الدرجة 9.6، حيث يعطي جدول Josh Talks 6.0 و13.7. ولا تشرح أي من الصفحتين الفرق، فلا يجوز جمع درجات الصفحتين.
Google وOpenAI تنشران أعداد اللغات
تدرج وثائق Chirp 3 من Google، المحدّثة في 7 أكتوبر 2026، الهندية والإنجليزية الهندية بوصفهما متاحتين للجميع. وعشر لغات هندية أخرى في المعاينة، هي الأسامية والبنغالية والغوجاراتية والكانادية والمالايالامية والماراثية والأودية والبنجابية والتاميلية والتيلوغوية. ولا تظهر الأردية. ولا تعطي الصفحة معدلات خطأ.
وGemini 3.5 Live Translate من Google، المعلن عنه في 9 يونيو 2026، يترجم كلاما من 70 لغة أو أكثر ويسعى إلى الحفاظ على إيقاع المتحدث ونبرته. وترتفع ترجمة الكلام في Google Meet من خمس لغات إلى 70 أو أكثر، ومن أزواج إنجليزية فقط إلى أكثر من 2,000 تركيبة لغوية في اجتماع واحد. ويقول المنشور إن الترجمة تتأخر ثوانيَ عن المتحدث، ولا يطبع أرقام معايير ولا أسماء لغات هندية.
أما gpt-realtime-translate من OpenAI، الذي ورد خبره في مايو 2026، فيقبل كلاما بأكثر من 70 لغة، منها الهندية والبنغالية والغوجاراتية والمالايالامية والبنجابية والتيلوغوية في قائمة الدليل التطبيقي (cookbook). والمخرج الصوتي بـ13 لغة، والهندية هي اللغة الهندية الوحيدة بينها. ويحذر دليل OpenAI من أن النموذج قد يستبدل أسماء أو كيانات خاطئة، ولا يعطي أرقام زمن الاستجابة.
وبهاشيني، المنصة الحكومية التي تناولناها في سعي الهند إلى ذكاء اصطناعي بلغاتها، تقدم هي أيضا خدمات كلام. ولم تجد tuput معدلات خطأ منشورة لنماذجها، ولذلك لا تُسجَّل هنا. أما استخدام المحكمة العليا نفسها للذكاء الاصطناعي في التفريغ والترجمة فمعروض في الذكاء الاصطناعي في المحاكم الهندية.
وتدرج مادة Josh Talks تقييم الأسماء العلم والمجالات المتخصصة والأرقام ضمن العمل المستقبلي، فلا تغطي أي درجة أعلاه الأسماء ولا المصطلحات ولا الأرقام.
المصادر وقراءات إضافية
- Meta AI: Omnilingual ASR, advancing automatic speech recognition (10 November 2025)
- arXiv: Omnilingual ASR, Open-Source Multilingual Speech Recognition for 1600+ Languages (12 November 2025)
- GitHub: facebookresearch/omnilingual-asr, code, model list and 7B per-language results table
- arXiv: Omnilingual MT, Machine Translation for 1,600 Languages (17 March 2026)
- Sarvam AI: Saaras V3 speech recognition (11 February 2026)
- Sarvam AI: Introducing Saaras V4 (25 September 2026)
- Sarvam AI: Sarvam Audio (3 February 2026)
- arXiv: IndicVoices, Towards building an Inclusive Multilingual Speech Dataset for Indian Languages (4 March 2024)
- arXiv: Towards Orthographically-Informed Evaluation of Speech Recognition Systems for Indian Languages (1 March 2026)
- arXiv: Voice of India, A Large-Scale Benchmark for Real-World Speech Recognition in India (21 April 2026)
- Josh Talks AI: Voice of India, Building India's National ASR Benchmark (April 2026)
- Hugging Face: Bodhan AI Indic-Transcribe-core model card (September 2026)
- DT Next: IIT-M-incubated Bodhan AI unveils open models for Indian languages (12 September 2026)
- Google Cloud: Chirp 3 transcription model documentation (last updated 7 October 2026)
- Google: Fluid, natural voice translation with Gemini 3.5 Live Translate (9 June 2026)
- OpenAI Cookbook: Build Live Translation Apps with gpt-realtime-translate
- Quantum Zeitgeist: OpenAI's New Model Translates 70+ Languages in Realtime (11 May 2026)
- TechCrunch: OpenAI upgrades its transcription and voice-generating AI models (20 March 2025)
أُعِدّ هذا المقال وكُتب بمساعدة أدوات الذكاء الاصطناعي، وحُرِّر للتحقق من دقته. وهو للمعلومة العامة والنقاش فقط، وليس مشورة مهنية. راجع معاييرنا التحريرية وإخلاء المسؤولية. وجدت خطأ؟ أخبرنا.
أعجبك المقال؟ احصل على التالي.
مقال جيد واحد في كل مرة، يصلك مباشرة إلى بريدك. بلا رسائل مزعجة، ويمكنك إلغاء الاشتراك متى شئت.