অলঙ্করণ: tuput
বাংলা
সর্বমের সারস ভি৩ ২০২৬ সালের ফেব্রুয়ারিতে ইন্ডিকভয়েসেস পরীক্ষায় প্রায় ১৯ শতাংশ শব্দ-ভুল করেছে, আর মেটার ওপেন মডেল হিন্দির জন্য ৩.৬ ক্যারেক্টার এরর রেটের কথা জানিয়েছে। ভারতীয় ফোন-কলের ওপর গড়া একমাত্র বেঞ্চমার্ক তার পরীক্ষার সেট গোপন রাখে, আর গুগল ও ওপেনএআইয়ের নিজেদের সবচেয়ে নতুন কথা-সংক্রান্ত পণ্যের পাতা ভাষার সংখ্যা দিয়েছে, কিন্তু ভারতীয় ভাষার ভুলের হার দেয়নি।
সর্বম এআইয়ের সারস ভি৩ কথা-শনাক্তকরণ মডেল ইন্ডিকভয়েসেস বেঞ্চমার্কে প্রায় ১৯ শতাংশ শব্দ-ভুল করেছে, সর্বমের নিজের ২০২৬ সালের ১১ ফেব্রুয়ারির পোস্ট অনুযায়ী। মেটার ওপেন অমনিলিঙ্গুয়াল এএসআর মডেল, যা প্রকাশিত হয় ২০২৫ সালের ১০ নভেম্বর, তার ফলাফলের ছকে হিন্দির জন্য ক্যারেক্টার এরর রেট দিয়েছে ৩.৬। দুটো সংখ্যা আলাদা জিনিস মাপছে আলাদা অডিওতে, আর প্রকাশিত অন্য স্কোরগুলোর বেশিরভাগকেও একই সারিতে বসানো সমান কঠিন।
ওয়ার্ড এরর রেট (ডব্লিউইআর) হল একজন মানুষের লেখা প্রতিলিপির সঙ্গে মিলিয়ে সিস্টেম যত শতাংশ শব্দ ভুল করে। ক্যারেক্টার এরর রেট (সিইআর) শব্দের বদলে ভুল অক্ষর গোনে। ভারতীয় ভাষায় আরেকটা সমস্যা আছে। আইআইটি মাদ্রাজের ভাষা-প্রযুক্তি ল্যাব এআই৪ভারতের গবেষকেরা ২০২৬ সালের ১ মার্চের একটি প্রিপ্রিন্টে লিখেছেন, বানানের নমনীয়তা আর শব্দ ভাঙা বা জোড়ার ঐচ্ছিক সুযোগের কারণে সাধারণ ডব্লিউইআর সিস্টেমগুলোকে ব্যবহারকারীরা যতটা খারাপ পান তার চেয়ে খারাপ দেখায়।
সর্বমের ২২ ভাষার মডেল
সারস ভি৩ একটি মডেলেই ২২টি সরকারি ভারতীয় ভাষা আর ইংরেজি সামলায়। সর্বমের পোস্ট সব ভাষার জন্য ইন্ডিকভয়েসেসে প্রায় ১৯ শতাংশ ডব্লিউইআর দিয়েছে, আর সবচেয়ে বেশি বলা দশটির জন্য ১৯.৩১ শতাংশ। তারা বলছে আগের সারস ভি২.৫, যা ১১টি ভাষা ধরত, একই সেটে স্কোর করেছিল প্রায় ২২ শতাংশ।
ইন্ডিকভয়েসেস এআই৪ভারতের একটি ডেটাসেট। ২০২৪ সালের তার গবেষণাপত্র বর্ণনা করেছে ২২টি ভাষায় ১৪৫টি জেলার ১৬,২৩৭ জন বক্তার ৭,৩৪৮ ঘণ্টার কথা, যার ১,৬৩৯ ঘণ্টা তখন প্রতিলিপি করা হয়েছিল। সর্বমের পোস্ট জিপিটি-৪ও ট্রান্সক্রাইব, জেমিনি ৩ প্রো, ডিপগ্রাম নোভা৩ আর ইলেভেনল্যাবস স্ক্রাইব ভি২-কে প্রতিদ্বন্দ্বী হিসেবে নাম করেছে যাদের তারা হারায়, কিন্তু তাদের কোনো স্কোর ছাপেনি। পোস্টে কোনো বাইরের মূল্যায়নকারীর নাম নেই।
সারস ভি৪ এসেছে ২০২৬ সালের ২৫ সেপ্টেম্বর। সর্বম ইন্ডিককনটেক্সটইভ্যাল-এ, এআই৪ভারতের একটি পরীক্ষা যেখানে ব্যবহারকারী মূল শব্দ জুগিয়ে দেন, ১৬.০৩ শতাংশ ডব্লিউইআর জানিয়েছে, আর ভাষা-শনাক্তকরণে ভুল ২২টি ভাষা মিলিয়ে ৫.২২ শতাংশ এবং শীর্ষ দশটিতে ২.৯ শতাংশ। ভি৪-এর নির্ভুলতার বেশিরভাগ ফল শুধু চার্টে দেখা যায়। সিঙ্ক্রোনাস এপিআই ৩০ সেকেন্ডের কম অডিও নেয়, আর ব্যাচ কাজে দুই ঘণ্টা পর্যন্ত ফাইল চলে।
সর্বম অডিও, যা ঘোষিত হয় ২০২৬ সালের ৩ ফেব্রুয়ারি, আলাদা একটি মডেল, সর্বমের ৩ বিলিয়ন প্যারামিটারের ভাষা মডেলের একটি অডিও সম্প্রসারণ। পোস্টটি ইন্ডিকভয়েসেসে এটিকে জিপিটি-৪ও ট্রান্সক্রাইব আর জেমিনি ৩ ফ্ল্যাশের সঙ্গে তুলনা করেছে কোনো সংখ্যা না দিয়ে, এবং বলেছে এটি তখনো সাধারণভাবে পাওয়া যেত না।
২০২৬ সালের মার্চের এআই৪ভারত প্রিপ্রিন্ট, যার লেখকদের মধ্যে একজন সর্বম গবেষক আছেন এবং যা পিয়ার রিভিউ হয়নি, মেপেছে বানানের ভিন্নতা স্কোরকে কতটা বিকৃত করে। এর অর্থোগ্রাফিকালি ইনফর্মড ডব্লিউইআর (ওআইডব্লিউইআর) একটি শব্দের যেকোনো তালিকাভুক্ত বানান গ্রহণ করে। একটি মডেলের ক্ষেত্রে এটি গড়ে ৬.৩ পয়েন্ট কম এসেছে, আর গড় ফারাক তামিলে ১৪.৪ এবং মালয়ালমে ১৩.৯ পয়েন্ট, মারাঠি ও গুজরাটিতে প্রায় ৫.৩-র বিপরীতে।
মেটার ১,৬০০ ভাষা
অমনিলিঙ্গুয়াল এএসআর ১,৬০০-র বেশি ভাষা ধরে, আর মেটা বলছে তার ৫০০-র বেশি ভাষা আগে কখনো এআই দিয়ে প্রতিলিপি করা হয়নি। মডেলগুলোর আকার ৩০০ মিলিয়ন থেকে ৭ বিলিয়ন প্যারামিটার। কোড আর মডেল অ্যাপাচি ২.০ লাইসেন্সের অধীনে, আর গবেষণাপত্রের ডিকোডার ধার করেছে বৃহৎ ভাষা মডেল থেকে। মেটার নিজের শিরোনামের দাবি, ৭ বিলিয়ন প্যারামিটারের মডেলে ৭৮ শতাংশ ভাষায় সিইআর ১০-এর নিচে।
গিটহাবে প্রকল্পের ফলাফলের ছকে ভারতের ছবি পাওয়া যায়। হিন্দিতে ২৩৬.৭ ঘণ্টার প্রশিক্ষণ অডিওর পর সিইআর ৩.৬, তামিলে ৩৭৯.৩ ঘণ্টার পর ৫.২, বাংলা ২.৮ আর ওড়িয়া ৫.৮, ৫১.৮ ঘণ্টার পর। ভোজপুরির প্রশিক্ষণ ঘণ্টা ৫.৫ আর সিইআর ১৬.৫। সাঁওতালি ০.৪ ঘণ্টায় ৪.৯। ছকে পরীক্ষার অডিওর নাম বলার কোনো কলাম নেই।
দুটি সীমাবদ্ধতা নথিভুক্ত আছে। মেটা বলছে, কয়েকটি উদাহরণ থেকে মডেলকে নতুন ভাষা শেখানো পূর্ণ প্রশিক্ষণের চেয়ে কম নির্ভুল। আর গিটহাব পাতা বলছে বেশিরভাগ চেকপয়েন্ট ৪০ সেকেন্ড বা তার বেশি লম্বা ক্লিপ প্রত্যাখ্যান করে, যদিও ২০২৫ সালের ডিসেম্বরের একটি হালনাগাদে দীর্ঘ অডিওর জন্য ‘আনলিমিটেড’ সংস্করণ যোগ হয়েছে।
অনুবাদের ক্ষেত্রে, মেটার ২০২৬ সালের ১৭ মার্চের অমনিলিঙ্গুয়াল এমটি গবেষণাপত্র বর্ণনা করেছে এমন একটি ব্যবস্থা, যাকে লেখকেরা ১,৬০০-র বেশি ভাষা সমর্থনকারী প্রথম ব্যবস্থা বলছেন। লেখকেরা বলছেন, এর ১ বিলিয়ন থেকে ৮ বিলিয়ন প্যারামিটারের মডেলগুলো ৭০ বিলিয়ন প্যারামিটারের একটি ভিত্তি-মডেলের সমান বা তার চেয়ে ভালো। তাঁরা এও জানিয়েছেন, ভিত্তি-মডেলগুলো প্রায়ই কম-সম্পদের একটি ভাষা বোঝে কিন্তু তৈরি করে খারাপভাবে। tuput সারসংক্ষেপে বা যে পাতাগুলো খুলেছে সেগুলোতে ভাষাওয়ারি ভারতীয় স্কোর পায়নি।
ভারতীয় ফোন-কলের ওপর গড়া একমাত্র পরীক্ষা
ভয়েস অফ ইন্ডিয়া, যা চালায় জোশ টকস এআই৪ভারতের সঙ্গে এবং যা ইন্টারস্পিচ ২০২৬-এ গৃহীত হয়েছে, ১৫টি ভাষায় ৩৬,৬৯১ জন বক্তার ৫৩৬ ঘণ্টার স্ক্রিপ্টহীন টেলিফোন কথা ব্যবহার করে। এটি স্কোর করে ওআই-ডব্লিউইআর দিয়ে, বৈধ বানানের একটি জালি। মূল পরীক্ষার সেট গোপন, তাই বাইরের লোক ফলাফল পুনরুৎপাদন করতে পারে না, আর শুধু একটি ছোট প্রকাশ্য নমুনার পরিকল্পনা আছে।
জোশ টকসের ২০২৬ সালের এপ্রিলের লেখা তার ছকে ১৫টি সিস্টেমের স্কোর দিয়েছে। এগুলো ওআই-ডব্লিউইআর শতাংশ, যত কম তত ভালো।
| মডেল | হিন্দি | বাংলা | তামিল |
|---|---|---|---|
| সর্বম অডিও | ৫.০ | ৬.০ | ১৪.২ |
| জেমিনি ৩ প্রো | ৬.০ | ৮.৫ | ১৫.৭ |
| ইলেভেনল্যাবস স্ক্রাইব ভি২ | ৭.৭ | ১০.০ | ২০.৪ |
| ইন্ডিককনফরমার (এআই৪ভারত) | ৮.২ | ১০.৭ | ১৯.৯ |
| ওমনিএএসআর এলএলএম ৭বি (মেটা) | ১৩.৭ | ২২.৮ | ৪৩.১ |
| জিপিটি-৪ও ট্রান্সক্রাইব | ৩৪.০ | ৪৪.৮ | ৬৪.২ |
সর্বম অডিও, সর্বমের নিজের পণ্য, তিনটিতেই প্রথম। জিপিটি-৪ও ট্রান্সক্রাইব ২০২৫ সালের মার্চের একটি ওপেনএআই মডেল। টেকক্রাঞ্চ এর উদ্বোধনের সময় ওপেনএআইয়ের অভ্যন্তরীণ বেঞ্চমার্ক উদ্ধৃত করে জানিয়েছিল, তামিল, তেলুগু, মালয়ালম ও কন্নড়ে শব্দ-ভুলের হার ৩০ শতাংশের কাছাকাছি। সেটি ভয়েস অফ ইন্ডিয়ার থেকে আলাদা পরীক্ষা।
লেখাটি নিজের সীমাবদ্ধতাও তালিকাভুক্ত করেছে। স্কোরিং জালির পেছনের অনুমানগুলো আসে শনাক্তকরণ মডেলের একটি অভ্যন্তরীণ সমন্বয় থেকে। নামযুক্ত সত্তা, ক্ষেত্র-নির্দিষ্ট শব্দ আর সংখ্যা এখনো পরীক্ষা করা হয়নি। পুরুষ বক্তাদের ক্ষেত্রে নারী বক্তাদের তুলনায় আপেক্ষিক ভুলের জরিমানা প্রায় ১৯ থেকে ২১ শতাংশ।
বোধনের সেপ্টেম্বরের প্রকাশ আর মেলে না এমন সংখ্যা
২০২৬ সালের সেপ্টেম্বরে এআই৪ভারত ও এনভিডিয়ার সঙ্গে কাজ করা আইআইটি মাদ্রাজ-ইনকিউবেটেড দল বোধন এআই প্রকাশ করেছে ইন্ডিক-ট্রান্সক্রাইব, কথা-শনাক্তকরণের ওপেন মডেল। কোর মডেলের কার্ড ভয়েস অফ ইন্ডিয়ায় গড় ওআইডব্লিউইআর জানাচ্ছে ৮.৭, সারস ভি৩-এর ১০.৭, ইন্ডিককনফরমারের ১৭.৮ আর জেমিনি ৩ প্রো-র ২১.১-এর বিপরীতে। এটি ২৫টি ভাষা ধরে: ইংরেজি, ২২টি তফসিলভুক্ত ভাষা, ভোজপুরি আর ভিলি। কার্ড বলে না মূল্যায়ন কে চালিয়েছে।
কার্ডটি নিজের সীমাবদ্ধতা তালিকাভুক্ত করেছে। এটিকে প্রশিক্ষণ দেওয়া হয়েছিল ৩০ সেকেন্ড পর্যন্ত ক্লিপে, শুধু দেশীয় লিপিতে আউটপুট দেয়, আর ধরে নেয় একজনই বক্তা। স্বয়ংক্রিয় ভাষা-শনাক্তকরণ অসমান, আর ভোজপুরি, মৈথিলি ও উর্দু প্রায়ই হিন্দির মধ্যে মিশে যায়।
বোধনের কার্ড আর জোশ টকসের পাতা একই মডেলের ব্যাপারেও একমত নয়। কার্ড জেমিনি ৩ প্রো-কে হিন্দিতে ৯.৩ আর ওমনিএএসআর এলএলএম ৭বি-কে ৯.৬ দিয়েছে, যেখানে জোশ টকসের ছকে ৬.০ ও ১৩.৭। কোনো পাতাই ফারাকটা ব্যাখ্যা করেনি, তাই দুই জায়গার স্কোর একসঙ্গে মেলানো যায় না।
গুগল ও ওপেনএআই ভাষার সংখ্যা প্রকাশ করে
গুগলের চির্প ৩ ডকুমেন্টেশন, ২০২৬ সালের ৭ অক্টোবর হালনাগাদ, হিন্দি আর ভারতীয় ইংরেজিকে সাধারণভাবে পাওয়া যাওয়া বলে তালিকাভুক্ত করেছে। আরও দশটি ভারতীয় ভাষা প্রিভিউতে আছে: অসমিয়া, বাংলা, গুজরাটি, কন্নড়, মালয়ালম, মারাঠি, ওড়িয়া, পাঞ্জাবি, তামিল আর তেলুগু। উর্দু নেই। পাতাটি কোনো ভুলের হার দেয় না।
গুগলের জেমিনি ৩.৫ লাইভ ট্রান্সলেট, ঘোষিত ২০২৬ সালের ৯ জুন, ৭০ বা তার বেশি ভাষার কথা অনুবাদ করে এবং বক্তার গতি আর স্বরের উচ্চতা ধরে রাখার লক্ষ্য রাখে। গুগল মিটের কথা-অনুবাদ পাঁচটি ভাষা থেকে ৭০ বা তার বেশিতে যায়, আর শুধু ইংরেজি-যুক্ত জোড়া থেকে একটি মিটিংয়ে ২,০০০-র বেশি ভাষা-সংমিশ্রণে। পোস্টটি বলছে অনুবাদ বক্তার কয়েক সেকেন্ড পেছনে থাকে, এবং কোনো বেঞ্চমার্ক সংখ্যা বা ভারতীয় ভাষার নাম ছাপেনি।
ওপেনএআইয়ের gpt-realtime-translate, ২০২৬ সালের মে মাসে প্রতিবেদিত, ৭০টির বেশি ভাষায় কথা নেয়, তার কুকবুকের তালিকায় হিন্দি, বাংলা, গুজরাটি, মালয়ালম, পাঞ্জাবি ও তেলুগু সহ। কথার আউটপুট আসে ১৩টি ভাষায়, আর হিন্দিই একমাত্র ভারতীয়। ওপেনএআইয়ের কুকবুক সতর্ক করেছে যে মডেল ভুল নাম বা সত্তা বসিয়ে দিতে পারে, এবং কোনো লেটেন্সির সংখ্যা দেয়নি।
ভাষিণী, যে সরকারি প্ল্যাটফর্মের কথা আছে নিজের ভাষায় এআই গড়ার ভারতের উদ্যোগ লেখায়, তারাও কথা-পরিষেবা দেয়। এর মডেলগুলোর কোনো প্রকাশিত ভুলের হার tuput পায়নি, তাই এখানে এটির স্কোর দেওয়া হয়নি। সুপ্রিম কোর্টের নিজের প্রতিলিপি ও অনুবাদে এআই ব্যবহারের কথা আছে ভারতীয় আদালতে এআই লেখায়।
জোশ টকসের লেখা নামযুক্ত সত্তা, ক্ষেত্র-নির্দিষ্ট আর সংখ্যাভিত্তিক মূল্যায়নকে ভবিষ্যতের কাজ বলে তালিকাভুক্ত করেছে, তাই ওপরের কোনো স্কোরই নাম, পরিভাষা বা অঙ্ক ধরে না।
সূত্র ও আরও পড়ার জন্য
- Meta AI: Omnilingual ASR, advancing automatic speech recognition (10 November 2025)
- arXiv: Omnilingual ASR, Open-Source Multilingual Speech Recognition for 1600+ Languages (12 November 2025)
- GitHub: facebookresearch/omnilingual-asr, code, model list and 7B per-language results table
- arXiv: Omnilingual MT, Machine Translation for 1,600 Languages (17 March 2026)
- Sarvam AI: Saaras V3 speech recognition (11 February 2026)
- Sarvam AI: Introducing Saaras V4 (25 September 2026)
- Sarvam AI: Sarvam Audio (3 February 2026)
- arXiv: IndicVoices, Towards building an Inclusive Multilingual Speech Dataset for Indian Languages (4 March 2024)
- arXiv: Towards Orthographically-Informed Evaluation of Speech Recognition Systems for Indian Languages (1 March 2026)
- arXiv: Voice of India, A Large-Scale Benchmark for Real-World Speech Recognition in India (21 April 2026)
- Josh Talks AI: Voice of India, Building India's National ASR Benchmark (April 2026)
- Hugging Face: Bodhan AI Indic-Transcribe-core model card (September 2026)
- DT Next: IIT-M-incubated Bodhan AI unveils open models for Indian languages (12 September 2026)
- Google Cloud: Chirp 3 transcription model documentation (last updated 7 October 2026)
- Google: Fluid, natural voice translation with Gemini 3.5 Live Translate (9 June 2026)
- OpenAI Cookbook: Build Live Translation Apps with gpt-realtime-translate
- Quantum Zeitgeist: OpenAI's New Model Translates 70+ Languages in Realtime (11 May 2026)
- TechCrunch: OpenAI upgrades its transcription and voice-generating AI models (20 March 2025)
এই লেখাটি AI সরঞ্জামের সহায়তায় গবেষণা ও রচনা করা হয়েছে এবং নির্ভুলতার জন্য সম্পাদনা করা হয়েছে। এটি কেবল সাধারণ তথ্য ও আলোচনার জন্য, পেশাদার পরামর্শ নয়। আমাদের সম্পাদকীয় মান ও দাবিত্যাগ দেখুন। কোনো ভুল চোখে পড়ল? আমাদের জানান।
ভালো লাগল? পরেরটিও পড়ুন।
একবারে একটি ভালো লেখা, সরাসরি আপনার ইনবক্সে। কোনো স্প্যাম নয়, যখন খুশি বন্ধ করতে পারেন।