অলঙ্করণ: tuput
বাংলা
গুগল ডিপমাইন্ড ২০২৬ সালের ৩০ জুলাই Gemini Robotics 2-এর সাফল্যের হার প্রকাশ করেছে, ডাস্টপ্যানের কাজে ৩২% থেকে বাল্ব খোলায় ৯২%, কিন্তু কতবার চেষ্টা করা হয়েছে তা বলেনি। tuput যেগুলি দেখেছে তার মধ্যে NVIDIA, শাওমি আর ইউনিট্রি ওয়েট অনলাইনে রেখেছে, আর শিরোনামের সংখ্যাগুলি হয় ল্যাবগুলির নিজেদের, নয়তো কে পরীক্ষা করেছে তা বলা নেই।
গুগল ডিপমাইন্ডের ২০২৬ সালের ৩০ জুলাইয়ের Gemini Robotics 2 প্রকাশের সঙ্গে এসেছিল একটা হিউম্যানয়েড রোবটের সাফল্যের হারের চার্ট: বাল্ব খুলতে ৯২%, বাল্ব লাগাতে ৩৬%, ডাস্টপ্যান ব্যবহারে ৩২%। এর কোনোটির পেছনে কতগুলি পরীক্ষা আছে, ডিপমাইন্ডের পাতা তা বলে না।
রোবট ফাউন্ডেশন মডেল হল একটাই প্রশিক্ষিত নেটওয়ার্ক, যা ক্যামেরার ছবি আর লিখিত নির্দেশ নিয়ে অনেক ধরনের কাজ আর অনেক ধরনের রোবট-শরীরের জন্য মোটরের নির্দেশ বের করে। ২০২৬ সালে আটটি ল্যাব এমন মডেল বা তার হালনাগাদ প্রকাশ করেছে। tuput যে শিরোনামের সংখ্যাগুলির উৎস খুঁজে পেয়েছে তার প্রতিটিতে ল্যাব নিজেই পরীক্ষা চালিয়েছে, অথবা পাতায় লেখা নেই কে চালিয়েছে। ওয়েট, অর্থাৎ ডেভেলপাররা ডাউনলোড করতে পারেন এমন প্রশিক্ষিত সংখ্যাগুলি, কতটা প্রকাশ্য তা অনেক বদলায়।
গুগলের হিউম্যানয়েডের সংখ্যা, আর কারা তা ব্যবহার করতে পারে
Gemini Robotics 2 একটি ভিশন-ল্যাঙ্গুয়েজ-অ্যাকশন মডেল, সংক্ষেপে VLA: এটি ছবি আর ভাষা পড়ে আর কাজের নির্দেশ বের করে। ক্যারোলিনা পারাডার লেখা ডিপমাইন্ডের পোস্ট বলছে, এটি পুরো হিউম্যানয়েডকে ‘পায়ের পাতা থেকে আঙুলের ডগা পর্যন্ত’ নিয়ন্ত্রণ করতে পারে, দুই-হাতের রোবটও। সঙ্গে আরও দুটো মডেল এসেছে। ER 2 একটা পরিকল্পনাকারী, যে কাজটাকে ধাপে ভাগ করে VLA-কে ডাকে। On-Device 2 একটা ছোট সংস্করণ, যেটা রোবটের নিজের কম্পিউটারে চলে।
অ্যাপট্রনিকের Apollo 2 হিউম্যানয়েডে Inspire হাত লাগানো অবস্থায় ডিপমাইন্ড জানিয়েছে, টেবিল থেকে জিনিস তুলতে ৬৮.৪%, তাক থেকে ৭৬.৩% আর মেঝে থেকে ৪৫.৭%। Sharpa হাত নিয়ে বাল্ব খুলতে ৯২%, ময়লার ব্যাগ বাঁধতে ৪৪%, জিপলক ব্যাগে ৪০%, বাল্ব লাগাতে ৩৬% আর ডাস্টপ্যানে ৩২%। গ্রিপার লাগানো Franka Duo বাহুতে স্কোর পিক অ্যান্ড প্লেসে ৭৪.২%, টুল কিটিংয়ে ৭৮.৯% আর নিখুঁত ঢোকানোয় ৮৯.৬%। গুগল বলছে, একাধিক আঙুলের দক্ষতা এখনও কঠিন আর তাদের রোবটকে আরও দ্রুত নড়তে হবে। কম স্কোরের পেছনের হাতের সমস্যাটা ব্যাখ্যা করা আছে রোবটের হাত কীভাবে ধরতে শেখে সেই লেখায়।
ব্যবহারের সুযোগ সীমিত। VLA আর On-Device 2 যাচ্ছে আগাম-প্রবেশাধিকারের অংশীদারদের কাছে, আর মডেলের পাতা ১০০-র বেশি বিশ্বস্ত পরীক্ষকের কথা বলে। ER 2 গুগল AI স্টুডিওতে চেষ্টা করা যায়, যেখানে এটি প্রিভিউ বলে চিহ্নিত।
ER 2-এর নিজের কিছু সংখ্যা আছে গুগলের মূল্যায়ন থেকে: অগ্রগতি শ্রেণিবিভাগে ৫৭.৪% নির্ভুলতা, যেটি একটা ভিডিও-ফ্রেমকে কাজ কতদূর এগিয়েছে তার পাঁচটি ভাগে ফেলে, আর মুহূর্ত খোঁজায় ৯১.৩%, যেটি প্রধান ঘটনাটি যে ফ্রেমে ঘটে সেটি বেছে নেয়, গড় ভুল ০.৯৬ সেকেন্ড। গুগল ASIMOV-Agentic নামে একটি নিরাপত্তা বেঞ্চমার্কও প্রকাশ করেছে, আর বলছে পরীক্ষায় কেউ কাছে এলে ER 2 একটি হিউম্যানয়েডকে থামিয়ে দিয়েছে।
On-Device 2-এর মডেল কার্ড ব্লগের চেয়ে স্পষ্টভাষী। সেখানে সীমাবদ্ধতা হিসেবে আছে প্রশিক্ষণের বাইরের কাজে সীমিত সাধারণীকরণ আর বহু জোড়ওয়ালা রোবট নিয়ন্ত্রণের সীমিত ক্ষমতা। এর নিরাপত্তা পরীক্ষা দাঁড়িয়ে থাকা দুই-হাতের কাজেই সীমিত ছিল, তাই পুরো শরীরের ঝুঁকি এর আওতার বাইরে। ডিপমাইন্ড বলছে, একটা নতুন দুই-হাতের রোবটকে কয়েক ঘণ্টায় সংগ্রহ করা ২০০-র কম উদাহরণ দিয়ে মানিয়ে নেওয়া যায়।
ফিজিক্যাল ইন্টেলিজেন্স: pi0.7 আর ‘অদেখা’-র গোলমাল
ফিজিক্যাল ইন্টেলিজেন্স ২০২৬ সালের ১৬ এপ্রিল তাদের pi0.7 গবেষণাপত্র arXiv-এ দিয়েছে। মডেলটির আকার প্রায় ৫ বিলিয়ন প্যারামিটার: গুগলের Gemma 3 থেকে শুরু করা ৪ বিলিয়ন প্যারামিটারের ভাষা-ও-দৃষ্টি মেরুদণ্ড, আর ৮৬০ মিলিয়ন প্যারামিটারের একটি অ্যাকশন মডিউল।
প্রধান পরীক্ষাটি একটি UR5e বাহুতে শার্ট ভাঁজ করা, যার জন্য ভাঁজের কোনো তথ্য সংগ্রহ করা হয়নি। লেখকরা জানাচ্ছেন, pi0.7-এর ৮০% সাফল্য আর ৮৫.৬% কাজের অগ্রগতি, আর দশজন অভিজ্ঞ মানব টেলিঅপারেটরের ৮০.৬% সাফল্য আর ৯০.৯% অগ্রগতি। সমীক্ষাটি লেখকরাই চালিয়েছেন। অদেখা কাজ বা নতুন কাজ-ও-রোবটের জোড়ায় তাঁরা প্রায় ৬০% থেকে ৮০% সাফল্যের কথা জানান, আর আগে দেখা কাজে প্রায়ই ৯০% ছাড়িয়েছে। কাপড় ভাঁজ একটি পরিচিত কঠিন পরীক্ষা, আর তা কেন কঠিন থেকে যায় তা আছে দাবায় জিতেও কাপড় কাচায় হারা রোবটদের নিয়ে আমাদের লেখায়।
লেখকরা লিখেছেন, তাঁদের ডেটাসেটের আকার দেখে কোনটা অদেখা তা ঠিক করা কঠিন। The Decoder একটি উদাহরণ দিয়েছে: একটি রোবটকে এয়ার ফ্রায়ারে মিষ্টি আলু ঢোকাতে ধাপে ধাপে শিখিয়ে দিতে হয়েছিল, অথচ প্রশিক্ষণের তথ্যে এয়ার ফ্রায়ার বন্ধ করা রোবটের মাত্র দুটি পর্ব ছিল।
গবেষণাপত্রে ওয়েট প্রকাশ করা হবে কি না তা বলা নেই। tuput যে openpi রিপোজিটরির পাতা পড়েছে তাতে Apache 2.0 লাইসেন্সে pi0, pi0-FAST আর pi0.5 আছে, pi0.7 নেই।
স্কিল্ডের S1: অদেখা কাজে ৬৬%, সাধারণ প্রশিক্ষণে ৮৬%
স্কিল্ড AI-এর ব্লগ S1-কে পরিচয় করিয়েছে এমন একটি মডেল হিসেবে, যে কাজের একটি ভিডিও দেখে তারপর সেটি করে, ওয়েট বদলানো ছাড়াই। কাজ দশ মিনিট পর্যন্ত লম্বা হয়। ১,০০,০০০ ঘণ্টা প্রি-ট্রেনিংয়ের পর অদেখা কাজে স্কিল্ড ৬৬% সাফল্য জানাচ্ছে, একই ডেটা, গঠন আর কম্পিউট-ক্ষমতায় প্রশিক্ষিত ভাষা-নির্দেশে চলা একটি VLA-র ৯%-এর বিপরীতে। মাপকাঠিটি লম্বা কাজে প্রতি ধাপের গড় সাফল্য। স্কিল্ড বলছে দুটি অভ্যন্তরীণ বেঞ্চমার্ক সেট ব্যবহার হয়েছে, কিন্তু কাজ বা পরীক্ষার সংখ্যা দেয়নি। ব্যর্থ চেষ্টা সামলাতে মানব অপারেটররা হস্তক্ষেপ করতে পারতেন, প্রধানত তুলনার মডেলটির ক্ষেত্রে, যেটি না হলে লম্বা অদেখা কাজে শূন্য পেত।
স্কিল্ডের নিজের সংখ্যাতেই সীমাটাও দেখা যায়। ২,০০০টি প্রদর্শনীতে পোস্ট-ট্রেন করা একটি VLA, স্কিল্ড যে নতুন কাজটি পরীক্ষা করেছে তাতে ৮৬%-এ পৌঁছেছে, একটি ভিডিও থেকে পাওয়া ৬৬%-এর ওপরে। স্কিল্ডের অনুমান, একটি ভিডিও প্রায় ৩৮০টি প্রদর্শনীর সমান, আর সংখ্যাটিকে তারা অন্তর্বর্তী মান বলে। পোস্টটিতে আগাম-প্রবেশাধিকারের জন্য নাম লেখানোর সুযোগ আছে, ডাউনলোড নেই।
The Robot Report সিইও দীপক পাঠকের কথা উদ্ধৃত করেছে যে S1 এখনও হিউম্যানয়েডে বড় করা হয়নি আর ঘরে ব্যবহারের জন্য তৈরি নয়। কোন রোবটে চালানো হয়েছে, পোস্টে তার নাম নেই।
NVIDIA, শাওমি আর ইউনিট্রির খোলা ওয়েট
NVIDIA-র GR00T N1.7-এর প্যারামিটার প্রায় ৩ বিলিয়ন। ১৬ মার্চের প্রেস বিজ্ঞপ্তিতে এটিকে বাণিজ্যিক লাইসেন্সসহ আগাম-প্রবেশাধিকারে পাওয়া যায় বলা হয়েছিল। ৭ জুলাইয়ের একটি প্রযুক্তি-পোস্ট বলছে, এটি Apache 2.0-এর অধীনে প্রকাশ হয়েছে, ওয়েট Hugging Face-এ আর প্রশিক্ষণের কোড GitHub-এ, প্রায় ৩২,০০০ ঘণ্টার বাস্তব ও প্রথম-দৃষ্টিকোণের মানব তথ্য আর ৮,০০০ ঘণ্টার সিমুলেশনে প্রি-ট্রেনিংয়ের পর। N1.6-এর চেয়ে উন্নতি দেওয়া আছে শুধু আপেক্ষিকভাবে: একটি DROID পরীক্ষায় ৬১% আর SimplerEnv Bridge-এ ৫% বেশি। একই মডেলের Hugging Face কার্ডে NVIDIA ওপেন মডেল লাইসেন্সের নাম আছে, তাই লাইসেন্স নিয়ে NVIDIA-র দুটি পাতা একমত নয়।
NVIDIA-র মার্চের বিজ্ঞপ্তিতে GR00T N2-এর একটি প্রিভিউও ছিল, যেটি DreamZero গবেষণার ওপর ভিত্তি করে। NVIDIA-র প্রকৌশলীরা DreamZero-কে বর্ণনা করেন ওয়ার্ল্ড-অ্যাকশন মডেল হিসেবে, একটি নেটওয়ার্ক যা পূর্বাভাসের ভিডিও আর অ্যাকশন একসঙ্গে তৈরি করে। NVIDIA বলছে, নতুন পরিবেশে নতুন কাজে এটি শীর্ষস্থানীয় VLA-গুলির চেয়ে দ্বিগুণের বেশি বার সফল হয় আর MolmoSpaces ও RoboArena লিডারবোর্ডে প্রথম। বিজ্ঞপ্তিতে এই দাবির পেছনে কোনো তথ্য নেই, আর N2 আসার কথা ২০২৬ সালের শেষে।
শাওমির XR-1 ওয়েটের পাশাপাশি পরীক্ষাও প্রকাশ করে। Apache 2.0 লাইসেন্সের রিডমি বলছে, রোবট-শরীর ছাড়া রেকর্ড করা ১,০০,০০০ ঘণ্টার বেশি প্রদর্শনী-তথ্যে প্রি-ট্রেনিং, তারপর বিভিন্ন ধরনের রোবটে ১০,০০০ ঘণ্টার বেশি পোস্ট-ট্রেনিং। চেকপয়েন্ট, পোস্ট-ট্রেনিং কোড আর মূল্যায়ন কোড প্রকাশ্য, আর প্রযুক্তিগত প্রতিবেদন ১৬ জুলাই arXiv-এ গেছে। শাওমি RoboCasa365 সিমুলেশন বেঞ্চমার্কে ৫৭.৪% জানাচ্ছে, দ্বিতীয় সেরা মডেলের ৪৬.৬%-এর বিপরীতে। প্রতি কাজে ১০ ঘণ্টার কম তথ্য নিয়ে চারটি বাস্তব-রোবট কাজে সামগ্রিক ৭৫%, pi0.5-এর ৪০%-এর বিপরীতে, আর ৪০ ঘণ্টার কম তথ্যে ৮৫%, ৫৩%-এর বিপরীতে। ৪০ ঘণ্টার সেটআপে কাপড় মেশিনে ঢোকানোর কাজে ১০০%, বিপরীতে ৫০%। বাস্তব-রোবটের তুলনাটি শাওমির নিজের, আর রিডমি বলছে ১৫ জুলাই পর্যন্ত XR-1 RoboCasa365 আর RoboDojo লিডারবোর্ডে প্রথম।
ইউনিট্রি ১০ সেপ্টেম্বর ঘোষণা করেছে তারা UnifoLM-WLA-1.0 ওপেন-সোর্স করছে, এমন একটি মডেল যা তাদের কথায় টেবিলের কাজ আর পুরো শরীরের কাজ দুটোই চালায়। এর Hugging Face পাতায় Apache 2.0-এর অধীনে একটি বেস চেকপয়েন্ট আছে, কিন্তু tuput যখন পড়েছে তখন মডেল কার্ড ফাঁকা ছিল, তাই কাজের কোনো সংখ্যা পাওয়া যায়নি। ইউনিট্রির হিউম্যানয়েড হার্ডওয়্যার আর রোবট ভ্যাকুয়ামের সঙ্গে তার মিল নিয়ে আছে দুটির তুলনার আমাদের লেখায়।
ফিগার আর AgiBot
ফিগারের Helix 02, ২০২৬ সালের ২৭ জানুয়ারি পরিচিত করানো, ফিগারের কথায় চার মিনিটের একটি ডিশওয়াশারের কাজ চালায়, ৬১টি অ্যাকশন আর কোনো রিসেট ছাড়া। এর ভারসাম্যের স্তর ১০ মিলিয়ন প্যারামিটারের একটি নেটওয়ার্ক, ১,০০০ ঘণ্টার বেশি মানব-গতির তথ্যে প্রশিক্ষিত। পাতায় সাফল্যের হার নেই, আর আঙুল-স্তরের কাজ জুড়ে দেওয়া আছে Figure 03 হার্ডওয়্যারের সঙ্গে, যার আঙুলের ডগার সেন্সর তিন গ্রামের মতো ছোট বল টের পায়। ফিগার ফলগুলিকে প্রাথমিক বলছে। এই ধরনের হিউম্যানয়েডরা বেতনভুক্ত পাইলটে কী করেছে তা আছে হিউম্যানয়েডদের কাজে যোগ দেওয়ার আমাদের প্রতিবেদনে।
AgiBot-এর GO-2, ৯ এপ্রিল ঘোষিত, The Robot Report-এর হিসাবে LIBERO সিমুলেশন সেটে ৯৮.৫%, LIBERO-Plus-এ ৮৬.৬% আর শুধু সিমুলেশনে প্রশিক্ষণের পর বাস্তব জগতে স্থানান্তরে ৮২.৯% পেয়েছে। তিনটিই AgiBot-এর সংখ্যা, আর নিবন্ধটি বলে না GO-2-এর ওয়েট প্রকাশ্য কি না।
শতাংশগুলি কেন পাশাপাশি রাখা যায় না
LIBERO-তে ৯৮.৫% একটি নির্দিষ্ট সিমুলেশন সেটের স্কোর। ডাস্টপ্যানে ৩২% মানে ২২ জোড়ওয়ালা হাতের একটি আসল হিউম্যানয়েড। স্কিল্ডের ৬৬% লম্বা কাজে প্রতি ধাপের সাফল্যের গড়। এদের কোনো দুটির কাজ, রোবট বা স্কোর করার নিয়ম এক নয়, আর যে ল্যাবগুলি নিজেদের তুলনা করে তারা প্রতিপক্ষ হিসেবে নাম দেয় pi0.5 বা নিজেদেরই আগের সংস্করণের।
NVIDIA-র মার্চের বিজ্ঞপ্তি বলছে GR00T N2 ২০২৬ সালের শেষ নাগাদ পাওয়া যাওয়ার কথা।
সূত্র ও আরও পড়ার জন্য
- Google DeepMind: Gemini Robotics 2 brings whole body intelligence to robots (30 July 2026)
- Google DeepMind: Gemini Robotics 2 overview and trusted tester programme
- Google DeepMind: Gemini Robotics On-Device 2 model card
- Google: Introducing Gemini Robotics ER 2 (30 July 2026)
- Physical Intelligence: pi 0.7, a Steerable Generalist Robotic Foundation Model with Emergent Capabilities (arXiv 2604.15483, 16 April 2026)
- The Decoder: Physical Intelligence shows robot model with LLM-like generalization, flaws included
- Physical Intelligence: openpi repository (GitHub)
- Skild AI: Introducing S1, In-Context Learning for Robotics (August 2026)
- The Robot Report: Skild AI unveils S1 flagship robot foundation model (31 August 2026)
- NVIDIA: NVIDIA and Global Robotics Leaders Take Physical AI to the Real World (16 March 2026)
- NVIDIA Technical Blog: Develop Humanoid Robot Policies End-to-End with NVIDIA Isaac GR00T (7 July 2026)
- NVIDIA Technical Blog: Pretrained to Imagine, Fine-Tuned to Act, the Rise of World-Action Models (15 June 2026)
- Hugging Face: NVIDIA GR00T-N1.7-3B model card
- GitHub: Xiaomi-Robotics-1 (XR-1) README
- Hugging Face: Unitree Robotics models, UnifoLM-WLA-1.0-Base
- PANews: Unitree Robotics open-sources UnifoLM-WLA-1.0 embodied foundation model
- Figure: Introducing Helix 02, Full-Body Autonomy (27 January 2026)
- The Robot Report: AGIBOT releases GO-2 foundation model for embodied AI (9 April 2026)
এই লেখাটি AI সরঞ্জামের সহায়তায় গবেষণা ও রচনা করা হয়েছে এবং নির্ভুলতার জন্য সম্পাদনা করা হয়েছে। এটি কেবল সাধারণ তথ্য ও আলোচনার জন্য, পেশাদার পরামর্শ নয়। আমাদের সম্পাদকীয় মান ও দাবিত্যাগ দেখুন। কোনো ভুল চোখে পড়ল? আমাদের জানান।
ভালো লাগল? পরেরটিও পড়ুন।
একবারে একটি ভালো লেখা, সরাসরি আপনার ইনবক্সে। কোনো স্প্যাম নয়, যখন খুশি বন্ধ করতে পারেন।