Skip to content
সর্বম ২২টি ভারতীয় ভাষায় প্রায় ১৯ শতাংশ শব্দ-ভুলের হিসাব দিয়েছে আর মেটা ঢেকেছে ১,৬০০ ভাষা, কিন্তু প্রকাশিত কথা-শনাক্তকরণের বেশিরভাগ স্কোর এসেছে নির্মাতাদের নিজেদের কাছ থেকেই
কৃত্রিম বুদ্ধিমত্তা

সর্বম ২২টি ভারতীয় ভাষায় প্রায় ১৯ শতাংশ শব্দ-ভুলের হিসাব দিয়েছে আর মেটা ঢেকেছে ১,৬০০ ভাষা, কিন্তু প্রকাশিত কথা-শনাক্তকরণের বেশিরভাগ স্কোর এসেছে নির্মাতাদের নিজেদের কাছ থেকেই

অলঙ্করণ: tuput

বাংলা

সর্বমের সারস ভি৩ ২০২৬ সালের ফেব্রুয়ারিতে ইন্ডিকভয়েসেস পরীক্ষায় প্রায় ১৯ শতাংশ শব্দ-ভুল করেছে, আর মেটার ওপেন মডেল হিন্দির জন্য ৩.৬ ক্যারেক্টার এরর রেটের কথা জানিয়েছে। ভারতীয় ফোন-কলের ওপর গড়া একমাত্র বেঞ্চমার্ক তার পরীক্ষার সেট গোপন রাখে, আর গুগল ও ওপেনএআইয়ের নিজেদের সবচেয়ে নতুন কথা-সংক্রান্ত পণ্যের পাতা ভাষার সংখ্যা দিয়েছে, কিন্তু ভারতীয় ভাষার ভুলের হার দেয়নি।

· · 6 মিনিটের পাঠ

সর্বম এআইয়ের সারস ভি৩ কথা-শনাক্তকরণ মডেল ইন্ডিকভয়েসেস বেঞ্চমার্কে প্রায় ১৯ শতাংশ শব্দ-ভুল করেছে, সর্বমের নিজের ২০২৬ সালের ১১ ফেব্রুয়ারির পোস্ট অনুযায়ী। মেটার ওপেন অমনিলিঙ্গুয়াল এএসআর মডেল, যা প্রকাশিত হয় ২০২৫ সালের ১০ নভেম্বর, তার ফলাফলের ছকে হিন্দির জন্য ক্যারেক্টার এরর রেট দিয়েছে ৩.৬। দুটো সংখ্যা আলাদা জিনিস মাপছে আলাদা অডিওতে, আর প্রকাশিত অন্য স্কোরগুলোর বেশিরভাগকেও একই সারিতে বসানো সমান কঠিন।

ওয়ার্ড এরর রেট (ডব্লিউইআর) হল একজন মানুষের লেখা প্রতিলিপির সঙ্গে মিলিয়ে সিস্টেম যত শতাংশ শব্দ ভুল করে। ক্যারেক্টার এরর রেট (সিইআর) শব্দের বদলে ভুল অক্ষর গোনে। ভারতীয় ভাষায় আরেকটা সমস্যা আছে। আইআইটি মাদ্রাজের ভাষা-প্রযুক্তি ল্যাব এআই৪ভারতের গবেষকেরা ২০২৬ সালের ১ মার্চের একটি প্রিপ্রিন্টে লিখেছেন, বানানের নমনীয়তা আর শব্দ ভাঙা বা জোড়ার ঐচ্ছিক সুযোগের কারণে সাধারণ ডব্লিউইআর সিস্টেমগুলোকে ব্যবহারকারীরা যতটা খারাপ পান তার চেয়ে খারাপ দেখায়।

সর্বমের ২২ ভাষার মডেল

সারস ভি৩ একটি মডেলেই ২২টি সরকারি ভারতীয় ভাষা আর ইংরেজি সামলায়। সর্বমের পোস্ট সব ভাষার জন্য ইন্ডিকভয়েসেসে প্রায় ১৯ শতাংশ ডব্লিউইআর দিয়েছে, আর সবচেয়ে বেশি বলা দশটির জন্য ১৯.৩১ শতাংশ। তারা বলছে আগের সারস ভি২.৫, যা ১১টি ভাষা ধরত, একই সেটে স্কোর করেছিল প্রায় ২২ শতাংশ।

ইন্ডিকভয়েসেস এআই৪ভারতের একটি ডেটাসেট। ২০২৪ সালের তার গবেষণাপত্র বর্ণনা করেছে ২২টি ভাষায় ১৪৫টি জেলার ১৬,২৩৭ জন বক্তার ৭,৩৪৮ ঘণ্টার কথা, যার ১,৬৩৯ ঘণ্টা তখন প্রতিলিপি করা হয়েছিল। সর্বমের পোস্ট জিপিটি-৪ও ট্রান্সক্রাইব, জেমিনি ৩ প্রো, ডিপগ্রাম নোভা৩ আর ইলেভেনল্যাবস স্ক্রাইব ভি২-কে প্রতিদ্বন্দ্বী হিসেবে নাম করেছে যাদের তারা হারায়, কিন্তু তাদের কোনো স্কোর ছাপেনি। পোস্টে কোনো বাইরের মূল্যায়নকারীর নাম নেই।

সারস ভি৪ এসেছে ২০২৬ সালের ২৫ সেপ্টেম্বর। সর্বম ইন্ডিককনটেক্সটইভ্যাল-এ, এআই৪ভারতের একটি পরীক্ষা যেখানে ব্যবহারকারী মূল শব্দ জুগিয়ে দেন, ১৬.০৩ শতাংশ ডব্লিউইআর জানিয়েছে, আর ভাষা-শনাক্তকরণে ভুল ২২টি ভাষা মিলিয়ে ৫.২২ শতাংশ এবং শীর্ষ দশটিতে ২.৯ শতাংশ। ভি৪-এর নির্ভুলতার বেশিরভাগ ফল শুধু চার্টে দেখা যায়। সিঙ্ক্রোনাস এপিআই ৩০ সেকেন্ডের কম অডিও নেয়, আর ব্যাচ কাজে দুই ঘণ্টা পর্যন্ত ফাইল চলে।

সর্বম অডিও, যা ঘোষিত হয় ২০২৬ সালের ৩ ফেব্রুয়ারি, আলাদা একটি মডেল, সর্বমের ৩ বিলিয়ন প্যারামিটারের ভাষা মডেলের একটি অডিও সম্প্রসারণ। পোস্টটি ইন্ডিকভয়েসেসে এটিকে জিপিটি-৪ও ট্রান্সক্রাইব আর জেমিনি ৩ ফ্ল্যাশের সঙ্গে তুলনা করেছে কোনো সংখ্যা না দিয়ে, এবং বলেছে এটি তখনো সাধারণভাবে পাওয়া যেত না।

২০২৬ সালের মার্চের এআই৪ভারত প্রিপ্রিন্ট, যার লেখকদের মধ্যে একজন সর্বম গবেষক আছেন এবং যা পিয়ার রিভিউ হয়নি, মেপেছে বানানের ভিন্নতা স্কোরকে কতটা বিকৃত করে। এর অর্থোগ্রাফিকালি ইনফর্মড ডব্লিউইআর (ওআইডব্লিউইআর) একটি শব্দের যেকোনো তালিকাভুক্ত বানান গ্রহণ করে। একটি মডেলের ক্ষেত্রে এটি গড়ে ৬.৩ পয়েন্ট কম এসেছে, আর গড় ফারাক তামিলে ১৪.৪ এবং মালয়ালমে ১৩.৯ পয়েন্ট, মারাঠি ও গুজরাটিতে প্রায় ৫.৩-র বিপরীতে।

মেটার ১,৬০০ ভাষা

অমনিলিঙ্গুয়াল এএসআর ১,৬০০-র বেশি ভাষা ধরে, আর মেটা বলছে তার ৫০০-র বেশি ভাষা আগে কখনো এআই দিয়ে প্রতিলিপি করা হয়নি। মডেলগুলোর আকার ৩০০ মিলিয়ন থেকে ৭ বিলিয়ন প্যারামিটার। কোড আর মডেল অ্যাপাচি ২.০ লাইসেন্সের অধীনে, আর গবেষণাপত্রের ডিকোডার ধার করেছে বৃহৎ ভাষা মডেল থেকে। মেটার নিজের শিরোনামের দাবি, ৭ বিলিয়ন প্যারামিটারের মডেলে ৭৮ শতাংশ ভাষায় সিইআর ১০-এর নিচে।

গিটহাবে প্রকল্পের ফলাফলের ছকে ভারতের ছবি পাওয়া যায়। হিন্দিতে ২৩৬.৭ ঘণ্টার প্রশিক্ষণ অডিওর পর সিইআর ৩.৬, তামিলে ৩৭৯.৩ ঘণ্টার পর ৫.২, বাংলা ২.৮ আর ওড়িয়া ৫.৮, ৫১.৮ ঘণ্টার পর। ভোজপুরির প্রশিক্ষণ ঘণ্টা ৫.৫ আর সিইআর ১৬.৫। সাঁওতালি ০.৪ ঘণ্টায় ৪.৯। ছকে পরীক্ষার অডিওর নাম বলার কোনো কলাম নেই।

দুটি সীমাবদ্ধতা নথিভুক্ত আছে। মেটা বলছে, কয়েকটি উদাহরণ থেকে মডেলকে নতুন ভাষা শেখানো পূর্ণ প্রশিক্ষণের চেয়ে কম নির্ভুল। আর গিটহাব পাতা বলছে বেশিরভাগ চেকপয়েন্ট ৪০ সেকেন্ড বা তার বেশি লম্বা ক্লিপ প্রত্যাখ্যান করে, যদিও ২০২৫ সালের ডিসেম্বরের একটি হালনাগাদে দীর্ঘ অডিওর জন্য ‘আনলিমিটেড’ সংস্করণ যোগ হয়েছে।

অনুবাদের ক্ষেত্রে, মেটার ২০২৬ সালের ১৭ মার্চের অমনিলিঙ্গুয়াল এমটি গবেষণাপত্র বর্ণনা করেছে এমন একটি ব্যবস্থা, যাকে লেখকেরা ১,৬০০-র বেশি ভাষা সমর্থনকারী প্রথম ব্যবস্থা বলছেন। লেখকেরা বলছেন, এর ১ বিলিয়ন থেকে ৮ বিলিয়ন প্যারামিটারের মডেলগুলো ৭০ বিলিয়ন প্যারামিটারের একটি ভিত্তি-মডেলের সমান বা তার চেয়ে ভালো। তাঁরা এও জানিয়েছেন, ভিত্তি-মডেলগুলো প্রায়ই কম-সম্পদের একটি ভাষা বোঝে কিন্তু তৈরি করে খারাপভাবে। tuput সারসংক্ষেপে বা যে পাতাগুলো খুলেছে সেগুলোতে ভাষাওয়ারি ভারতীয় স্কোর পায়নি।

ভারতীয় ফোন-কলের ওপর গড়া একমাত্র পরীক্ষা

ভয়েস অফ ইন্ডিয়া, যা চালায় জোশ টকস এআই৪ভারতের সঙ্গে এবং যা ইন্টারস্পিচ ২০২৬-এ গৃহীত হয়েছে, ১৫টি ভাষায় ৩৬,৬৯১ জন বক্তার ৫৩৬ ঘণ্টার স্ক্রিপ্টহীন টেলিফোন কথা ব্যবহার করে। এটি স্কোর করে ওআই-ডব্লিউইআর দিয়ে, বৈধ বানানের একটি জালি। মূল পরীক্ষার সেট গোপন, তাই বাইরের লোক ফলাফল পুনরুৎপাদন করতে পারে না, আর শুধু একটি ছোট প্রকাশ্য নমুনার পরিকল্পনা আছে।

জোশ টকসের ২০২৬ সালের এপ্রিলের লেখা তার ছকে ১৫টি সিস্টেমের স্কোর দিয়েছে। এগুলো ওআই-ডব্লিউইআর শতাংশ, যত কম তত ভালো।

মডেলহিন্দিবাংলাতামিল
সর্বম অডিও৫.০৬.০১৪.২
জেমিনি ৩ প্রো৬.০৮.৫১৫.৭
ইলেভেনল্যাবস স্ক্রাইব ভি২৭.৭১০.০২০.৪
ইন্ডিককনফরমার (এআই৪ভারত)৮.২১০.৭১৯.৯
ওমনিএএসআর এলএলএম ৭বি (মেটা)১৩.৭২২.৮৪৩.১
জিপিটি-৪ও ট্রান্সক্রাইব৩৪.০৪৪.৮৬৪.২

সর্বম অডিও, সর্বমের নিজের পণ্য, তিনটিতেই প্রথম। জিপিটি-৪ও ট্রান্সক্রাইব ২০২৫ সালের মার্চের একটি ওপেনএআই মডেল। টেকক্রাঞ্চ এর উদ্বোধনের সময় ওপেনএআইয়ের অভ্যন্তরীণ বেঞ্চমার্ক উদ্ধৃত করে জানিয়েছিল, তামিল, তেলুগু, মালয়ালম ও কন্নড়ে শব্দ-ভুলের হার ৩০ শতাংশের কাছাকাছি। সেটি ভয়েস অফ ইন্ডিয়ার থেকে আলাদা পরীক্ষা।

লেখাটি নিজের সীমাবদ্ধতাও তালিকাভুক্ত করেছে। স্কোরিং জালির পেছনের অনুমানগুলো আসে শনাক্তকরণ মডেলের একটি অভ্যন্তরীণ সমন্বয় থেকে। নামযুক্ত সত্তা, ক্ষেত্র-নির্দিষ্ট শব্দ আর সংখ্যা এখনো পরীক্ষা করা হয়নি। পুরুষ বক্তাদের ক্ষেত্রে নারী বক্তাদের তুলনায় আপেক্ষিক ভুলের জরিমানা প্রায় ১৯ থেকে ২১ শতাংশ।

বোধনের সেপ্টেম্বরের প্রকাশ আর মেলে না এমন সংখ্যা

২০২৬ সালের সেপ্টেম্বরে এআই৪ভারত ও এনভিডিয়ার সঙ্গে কাজ করা আইআইটি মাদ্রাজ-ইনকিউবেটেড দল বোধন এআই প্রকাশ করেছে ইন্ডিক-ট্রান্সক্রাইব, কথা-শনাক্তকরণের ওপেন মডেল। কোর মডেলের কার্ড ভয়েস অফ ইন্ডিয়ায় গড় ওআইডব্লিউইআর জানাচ্ছে ৮.৭, সারস ভি৩-এর ১০.৭, ইন্ডিককনফরমারের ১৭.৮ আর জেমিনি ৩ প্রো-র ২১.১-এর বিপরীতে। এটি ২৫টি ভাষা ধরে: ইংরেজি, ২২টি তফসিলভুক্ত ভাষা, ভোজপুরি আর ভিলি। কার্ড বলে না মূল্যায়ন কে চালিয়েছে।

কার্ডটি নিজের সীমাবদ্ধতা তালিকাভুক্ত করেছে। এটিকে প্রশিক্ষণ দেওয়া হয়েছিল ৩০ সেকেন্ড পর্যন্ত ক্লিপে, শুধু দেশীয় লিপিতে আউটপুট দেয়, আর ধরে নেয় একজনই বক্তা। স্বয়ংক্রিয় ভাষা-শনাক্তকরণ অসমান, আর ভোজপুরি, মৈথিলি ও উর্দু প্রায়ই হিন্দির মধ্যে মিশে যায়।

বোধনের কার্ড আর জোশ টকসের পাতা একই মডেলের ব্যাপারেও একমত নয়। কার্ড জেমিনি ৩ প্রো-কে হিন্দিতে ৯.৩ আর ওমনিএএসআর এলএলএম ৭বি-কে ৯.৬ দিয়েছে, যেখানে জোশ টকসের ছকে ৬.০ ও ১৩.৭। কোনো পাতাই ফারাকটা ব্যাখ্যা করেনি, তাই দুই জায়গার স্কোর একসঙ্গে মেলানো যায় না।

গুগল ও ওপেনএআই ভাষার সংখ্যা প্রকাশ করে

গুগলের চির্প ৩ ডকুমেন্টেশন, ২০২৬ সালের ৭ অক্টোবর হালনাগাদ, হিন্দি আর ভারতীয় ইংরেজিকে সাধারণভাবে পাওয়া যাওয়া বলে তালিকাভুক্ত করেছে। আরও দশটি ভারতীয় ভাষা প্রিভিউতে আছে: অসমিয়া, বাংলা, গুজরাটি, কন্নড়, মালয়ালম, মারাঠি, ওড়িয়া, পাঞ্জাবি, তামিল আর তেলুগু। উর্দু নেই। পাতাটি কোনো ভুলের হার দেয় না।

গুগলের জেমিনি ৩.৫ লাইভ ট্রান্সলেট, ঘোষিত ২০২৬ সালের ৯ জুন, ৭০ বা তার বেশি ভাষার কথা অনুবাদ করে এবং বক্তার গতি আর স্বরের উচ্চতা ধরে রাখার লক্ষ্য রাখে। গুগল মিটের কথা-অনুবাদ পাঁচটি ভাষা থেকে ৭০ বা তার বেশিতে যায়, আর শুধু ইংরেজি-যুক্ত জোড়া থেকে একটি মিটিংয়ে ২,০০০-র বেশি ভাষা-সংমিশ্রণে। পোস্টটি বলছে অনুবাদ বক্তার কয়েক সেকেন্ড পেছনে থাকে, এবং কোনো বেঞ্চমার্ক সংখ্যা বা ভারতীয় ভাষার নাম ছাপেনি।

ওপেনএআইয়ের gpt-realtime-translate, ২০২৬ সালের মে মাসে প্রতিবেদিত, ৭০টির বেশি ভাষায় কথা নেয়, তার কুকবুকের তালিকায় হিন্দি, বাংলা, গুজরাটি, মালয়ালম, পাঞ্জাবি ও তেলুগু সহ। কথার আউটপুট আসে ১৩টি ভাষায়, আর হিন্দিই একমাত্র ভারতীয়। ওপেনএআইয়ের কুকবুক সতর্ক করেছে যে মডেল ভুল নাম বা সত্তা বসিয়ে দিতে পারে, এবং কোনো লেটেন্সির সংখ্যা দেয়নি।

ভাষিণী, যে সরকারি প্ল্যাটফর্মের কথা আছে নিজের ভাষায় এআই গড়ার ভারতের উদ্যোগ লেখায়, তারাও কথা-পরিষেবা দেয়। এর মডেলগুলোর কোনো প্রকাশিত ভুলের হার tuput পায়নি, তাই এখানে এটির স্কোর দেওয়া হয়নি। সুপ্রিম কোর্টের নিজের প্রতিলিপি ও অনুবাদে এআই ব্যবহারের কথা আছে ভারতীয় আদালতে এআই লেখায়।

জোশ টকসের লেখা নামযুক্ত সত্তা, ক্ষেত্র-নির্দিষ্ট আর সংখ্যাভিত্তিক মূল্যায়নকে ভবিষ্যতের কাজ বলে তালিকাভুক্ত করেছে, তাই ওপরের কোনো স্কোরই নাম, পরিভাষা বা অঙ্ক ধরে না।

Share
Copied!

সূত্র ও আরও পড়ার জন্য

  1. Meta AI: Omnilingual ASR, advancing automatic speech recognition (10 November 2025)
  2. arXiv: Omnilingual ASR, Open-Source Multilingual Speech Recognition for 1600+ Languages (12 November 2025)
  3. GitHub: facebookresearch/omnilingual-asr, code, model list and 7B per-language results table
  4. arXiv: Omnilingual MT, Machine Translation for 1,600 Languages (17 March 2026)
  5. Sarvam AI: Saaras V3 speech recognition (11 February 2026)
  6. Sarvam AI: Introducing Saaras V4 (25 September 2026)
  7. Sarvam AI: Sarvam Audio (3 February 2026)
  8. arXiv: IndicVoices, Towards building an Inclusive Multilingual Speech Dataset for Indian Languages (4 March 2024)
  9. arXiv: Towards Orthographically-Informed Evaluation of Speech Recognition Systems for Indian Languages (1 March 2026)
  10. arXiv: Voice of India, A Large-Scale Benchmark for Real-World Speech Recognition in India (21 April 2026)
  11. Josh Talks AI: Voice of India, Building India's National ASR Benchmark (April 2026)
  12. Hugging Face: Bodhan AI Indic-Transcribe-core model card (September 2026)
  13. DT Next: IIT-M-incubated Bodhan AI unveils open models for Indian languages (12 September 2026)
  14. Google Cloud: Chirp 3 transcription model documentation (last updated 7 October 2026)
  15. Google: Fluid, natural voice translation with Gemini 3.5 Live Translate (9 June 2026)
  16. OpenAI Cookbook: Build Live Translation Apps with gpt-realtime-translate
  17. Quantum Zeitgeist: OpenAI's New Model Translates 70+ Languages in Realtime (11 May 2026)
  18. TechCrunch: OpenAI upgrades its transcription and voice-generating AI models (20 March 2025)

এই লেখাটি AI সরঞ্জামের সহায়তায় গবেষণা ও রচনা করা হয়েছে এবং নির্ভুলতার জন্য সম্পাদনা করা হয়েছে। এটি কেবল সাধারণ তথ্য ও আলোচনার জন্য, পেশাদার পরামর্শ নয়। আমাদের সম্পাদকীয় মান ও দাবিত্যাগ দেখুন। কোনো ভুল চোখে পড়ল? আমাদের জানান।

#speech recognition#machine translation#indic languages#sarvam ai#omnilingual asr#voice of india#ai4bharat#live translation

ভালো লাগল? পরেরটিও পড়ুন।

একবারে একটি ভালো লেখা, সরাসরি আপনার ইনবক্সে। কোনো স্প্যাম নয়, যখন খুশি বন্ধ করতে পারেন।

একই বিভাগে আরও: কৃত্রিম বুদ্ধিমত্তা
ইন্ডিয়াএআই মিশনের হাতে ঘণ্টায় ₹৬৫ দরে ৩৮,০০০-এর বেশি জিপিইউ আর অর্থ পাওয়া ১২টি মডেল নির্মাতা, কিন্তু ২০২৫-২৬ সালের বাজেট বরাদ্দ ₹২,০০০ কোটি থেকে কমিয়ে ₹৮০০ কোটি করা হয়েছে
কম্পিউট সস্তা, প্রথম মডেলগুলো বেরিয়েছে, আর বাজেটের অঙ্ক ছোট। মিশনের প্রতিটি স্তম্ভ নিয়ে সরকারের নিজের নথি কী বলে, আর কার্নেগি ইন্ডিয়া, তক্ষশীলা আর আইআইএসসি-সংশ্লিষ্ট এক গবেষণাপ্রধান কোথায় আপত্তি তোলেন।
বিশ্ব প্রথমে ইংরেজিতে এআই বানিয়েছে। ভারত এইমাত্র নিজের ভাষাগুলোতে একটা বানাতে ১.২৫ বিলিয়ন ডলার খরচ করেছে
একটি সরকারি প্রোগ্রাম বাজারদরের একটা ভগ্নাংশে প্রায় ষাট হাজার GPU ভারতীয় স্টার্টআপদের ভাড়া দিচ্ছে, আর একটি অনুবাদ মঞ্চ প্রতিদিন কয়েক কোটি অনুরোধ সামলায় এমন সব ভাষায় যেখানে ChatGPT আজও হোঁচট খায়। প্রতিটা বাজি এখনও সফল হয়নি।
Scale-এর SWE-Bench Pro বোর্ডে সেরা কোডিং এজেন্ট ৬১.৫%, মেইনটেইনাররা টেস্ট পাস করা অনেক সমাধান নাকচ করেন, আর METR বলছে তাদের সাম্প্রতিক ট্রায়াল দেখাতে পারেনি এজেন্ট কতটা সময় বাঁচায়
বেঞ্চমার্ক বলে এজেন্টরা শক্তিশালী। মেইনটেইনাররা, একটি র‍্যান্ডমাইজড ট্রায়াল আর একগাদা ঘটনা-প্রতিবেদন বলে ছবিটা আরও সংকীর্ণ। প্রতিটি সংখ্যা আসলে কী মাপে, এখানে তাই দেখা যাক।
← সব লেখা