Skip to content
Gemini Robotics 2 ने बल्ब काढण्यात ९२% आणि बल्ब बसवण्यात ३६% यश मिळवले, आणि Xiaomi चे खुले रोबो मॉडेल स्वतःच्या प्रत्यक्ष-रोबो चाचण्यांत pi0.5 च्या ४०% विरुद्ध ७५% नोंदवते
रोबोटिक्स

Gemini Robotics 2 ने बल्ब काढण्यात ९२% आणि बल्ब बसवण्यात ३६% यश मिळवले, आणि Xiaomi चे खुले रोबो मॉडेल स्वतःच्या प्रत्यक्ष-रोबो चाचण्यांत pi0.5 च्या ४०% विरुद्ध ७५% नोंदवते

चित्रण: tuput

मराठी

Google DeepMind ने ३० जुलै २०२६ रोजी Gemini Robotics 2 साठी यशाचे दर प्रसिद्ध केले, कचरा उचलण्याच्या कामातील ३२% पासून बल्ब काढण्यातील ९२% पर्यंत, पण चाचण्यांची संख्या दिली नाही. tuput ने तपासलेल्या मॉडेलांपैकी NVIDIA, Xiaomi आणि Unitree यांनी वेट्स ऑनलाइन ठेवले आहेत, आणि ठळक आकडे प्रयोगशाळांचे स्वतःचे आहेत किंवा चाचणी कोणी केली हे सांगितलेले नाही.

· · 7 मिनिटांचे वाचन

Google DeepMind ने ३० जुलै २०२६ रोजी Gemini Robotics 2 प्रसिद्ध केले, आणि सोबत एका ह्यूमनॉइड रोबोसाठी यशाच्या दरांचे तक्ते आले: बल्ब काढण्यात ९२%, तो बसवण्यात ३६%, कचरा उचलण्याच्या फावड्याचा वापर करण्यात ३२%. यांपैकी कोणत्याही आकड्यामागे किती प्रयत्न आहेत हे DeepMind चे पान सांगत नाही.

रोबो फाउंडेशन मॉडेल म्हणजे असे एकच प्रशिक्षित जाळे, जे कॅमेऱ्याची चित्रे आणि लिखित सूचना घेऊन अनेक कामांसाठी आणि अनेक रोबो शरीरांसाठी मोटर आदेश देते. २०२६ मध्ये आठ प्रयोगशाळांनी असे मॉडेल किंवा त्याची सुधारित आवृत्ती आणली आहे. tuput ला ज्या ज्या ठळक आकड्यांचा मागोवा घेता आला, त्या प्रत्येकासाठी प्रयोगशाळेने स्वतः चाचण्या घेतल्या आहेत, किंवा चाचणी कोणी केली हे पान सांगत नाही. वेट्स, म्हणजे विकसकाला डाउनलोड करता येणारे प्रशिक्षित आकडे, कोणाचे खुले आहेत हे खूप बदलते.

Google चे ह्यूमनॉइड आकडे, आणि ते कोण वापरू शकते

Gemini Robotics 2 हे व्हिजन-लँग्वेज-ॲक्शन मॉडेल, म्हणजे VLA, आहे: ते चित्रे आणि भाषा वाचून कृती देते. कॅरोलिना पारडा यांच्या DeepMind पोस्टनुसार ते पूर्ण ह्यूमनॉइड रोबो “पायांपासून बोटांच्या टोकांपर्यंत” तसेच दोन हातांचे रोबो चालवू शकते. सोबत दोन पूरक मॉडेल आली. ER 2 हा नियोजक आहे, जो कामाचे टप्पे पाडून VLA ला बोलावतो. On-Device 2 ही लहान आवृत्ती आहे, जी रोबोच्या स्वतःच्या संगणकावर चालते.

Apptronik च्या Apollo 2 ह्यूमनॉइडवर Inspire हातांसह, DeepMind वस्तू उचलण्याचे यश टेबलवरून ६८.४%, कपाटातून ७६.३% आणि जमिनीवरून ४५.७% नोंदवते. Sharpa हातांसह बल्ब काढण्यात ९२%, कचऱ्याची पिशवी बांधण्यात ४४%, झिपलॉक पिशवीत ४०%, बल्ब बसवण्यात ३६% आणि फावड्यात ३२% नोंदवले आहे. ग्रिपरसह Franka Duo हातांवर उचलून ठेवण्यात ७४.२%, साधने जुळवण्यात ७८.९% आणि अचूक अडकवण्यात ८९.६% गुण आहेत. Google म्हणते की अनेक बोटांची कौशल्ये अजूनही कठीण आहेत आणि त्याच्या रोबोंना अजून वेगाने हलावे लागेल. या कमी गुणांमागची हाताची अडचण रोबोचा हात पकडायला कसा शिकतो या आमच्या लेखात समजावली आहे.

उपलब्धता मर्यादित आहे. VLA आणि On-Device 2 सुरुवातीच्या प्रवेश भागीदारांना दिले जाते, आणि मॉडेलचे पान १०० हून अधिक विश्वासू चाचणीकर्ते असल्याचे सांगते. ER 2 Google AI Studio मध्ये वापरून पाहता येते, जिथे त्याला पूर्वावलोकन असे लेबल आहे.

ER 2 चे स्वतःचे आकडे Google च्या मूल्यमापनांतून आहेत: प्रगती वर्गीकरणात ५७.४% अचूकता, ज्यात व्हिडिओची एक चौकट काम किती पुढे गेले आहे यानुसार पाच पट्ट्यांत टाकली जाते, आणि क्षण शोधण्यात ९१.३%, ज्यात मुख्य घटना घडलेली चौकट निवडली जाते, सरासरी चूक ०.९६ सेकंद. Google ने ASIMOV-Agentic नावाचा सुरक्षा बेंचमार्कही प्रसिद्ध केला, आणि म्हणते की चाचण्यांत ER 2 ने माणूस जवळ आल्यावर ह्यूमनॉइडला थांबवले.

On-Device 2 चे मॉडेल कार्ड ब्लॉगपेक्षा अधिक स्पष्ट आहे. त्यात प्रशिक्षण वितरणाबाहेरच्या कामांसाठी मर्यादित सामान्यीकरण आणि अनेक सांधे असलेले रोबो चालवण्याची मर्यादित क्षमता नमूद आहे. त्याची सुरक्षा चाचणी फक्त उभ्या स्थितीतील दोन हातांच्या कामापुरती होती, म्हणजे पूर्ण शरीराचे धोके त्याच्या कक्षेबाहेर आहेत. DeepMind म्हणते की नवीन दोन हातांचा रोबो काही तासांत गोळा केलेल्या २०० हून कमी उदाहरणांमध्ये जुळवून घेता येतो.

Physical Intelligence: pi0.7 आणि “न पाहिलेले” याची अडचण

Physical Intelligence ने १६ एप्रिल २०२६ रोजी आपला pi0.7 शोधनिबंध arXiv वर टाकला. मॉडेल सुमारे ५ अब्ज पॅरामीटरचे आहे: Google च्या Gemma 3 पासून सुरू केलेला ४ अब्ज पॅरामीटरचा भाषा-आणि-दृश्य पाया, आणि ८६ कोटी पॅरामीटरचे कृती घटक.

मुख्य चाचणी UR5e हातावर शर्टच्या घड्या घालण्याची आहे, ज्यासाठी घड्यांचा कोणताही डेटा गोळा केलेला नव्हता. लेखक pi0.7 साठी ८०% यश आणि ८५.६% कामातील प्रगती नोंदवतात, तर दहा अनुभवी मानवी टेलिऑपरेटरसाठी ८०.६% यश आणि ९०.९% प्रगती. अभ्यास लेखकांनीच चालवला. न पाहिलेल्या कामांवर किंवा नवीन काम-आणि-रोबो जोड्यांवर ते सुमारे ६०% ते ८०% यश नोंदवतात, तर आधी पाहिलेली कामे अनेकदा ९०% च्या वर गेली. कपड्यांच्या घड्या घालणे ही सर्रास वापरली जाणारी कठीण कसोटी आहे, आणि ती का कठीणच राहते हे बुद्धिबळात जिंकणारे आणि कपड्यांपुढे हरणारे रोबो या आमच्या लेखात आहे.

लेखक लिहितात की त्यांच्या डेटासेटच्या आकारामुळे काय “न पाहिलेले” मानायचे हे ठरवणे कठीण आहे. The Decoder ने एक उदाहरण दिले: रताळे एअर फ्रायरमध्ये ठेवणाऱ्या रोबोला पायरी-पायरीने मार्गदर्शन लागले, आणि प्रशिक्षण डेटामध्ये रोबो एअर फ्रायर बंद करण्याचे फक्त दोन प्रसंग होते.

वेट्स प्रसिद्ध होतील का हे शोधनिबंध सांगत नाही. tuput ने वाचलेल्या openpi रिपॉझिटरीच्या पानावर Apache 2.0 परवान्याखाली pi0, pi0-FAST आणि pi0.5 आहेत, pi0.7 नाही.

Skild चे S1: न पाहिलेल्या कामांवर ६६%, साध्या प्रशिक्षणाला ८६%

Skild AI चा ब्लॉग S1 ची ओळख अशी करून देतो की ते कामाचा एक व्हिडिओ पाहते आणि मग ते काम करते, वेट्समध्ये कोणताही बदल न करता. कामे दहा मिनिटांपर्यंत चालतात. १,००,००० तासांच्या पूर्वप्रशिक्षणानंतर, न पाहिलेल्या कामांवर Skild ६६% यश नोंदवते, तर त्याच डेटा, रचना आणि संगणन शक्तीवर प्रशिक्षित भाषा-सूचित VLA चे ९%. मोजमाप लांब कामांवरील प्रति-टप्पा यशाची सरासरी आहे. Skild म्हणते की दोन अंतर्गत बेंचमार्क संच वापरले गेले आणि कामांची किंवा प्रयत्नांची संख्या देत नाही. अपयशी प्रयत्न सावरण्यासाठी मानवी चालक हस्तक्षेप करू शकत होते, मुख्यतः तुलना-मॉडेलसाठी, ज्याने अन्यथा लांब न पाहिलेल्या कामांवर शून्य गुण मिळवले.

Skild चे स्वतःचे आकडे मर्यादाही दाखवतात. नवीन कामावर २,००० प्रात्यक्षिकांनी पुढील प्रशिक्षण दिलेला VLA ८६% वर पोहोचला, जो एका व्हिडिओच्या ६६% पेक्षा वर आहे. Skild चा अंदाज आहे की एक व्हिडिओ सुमारे ३८० प्रात्यक्षिकांच्या बरोबरीचा आहे आणि हा आकडा अंतर्वेशनाने काढल्याचे ती म्हणते. पोस्ट सुरुवातीच्या प्रवेशासाठी नोंदणी देते, डाउनलोड नाही.

The Robot Report मध्ये CEO दीपक पाठक म्हणतात की S1 अजून ह्यूमनॉइडपर्यंत वाढवलेले नाही आणि घरांसाठी तयार नाही. कोणत्या रोबोंवर ते चालवले त्यांची नावे पोस्ट देत नाही.

NVIDIA, Xiaomi आणि Unitree कडून खुले वेट्स

NVIDIA च्या GR00T N1.7 मध्ये सुमारे ३ अब्ज पॅरामीटर आहेत. १६ मार्चच्या निवेदनाने ते व्यावसायिक परवान्यासह सुरुवातीच्या प्रवेशात उपलब्ध असल्याचे सांगितले. ७ जुलैची तांत्रिक पोस्ट म्हणते की ते Apache 2.0 अंतर्गत प्रसिद्ध झाले आहे, वेट्स Hugging Face वर आणि प्रशिक्षण कोड GitHub वर, सुमारे ३२,००० तासांच्या खऱ्या आणि प्रथम-पुरुषी मानवी डेटावर आणि ८,००० तासांच्या सिम्युलेशनवर पूर्वप्रशिक्षणानंतर. N1.6 पेक्षा झालेली सुधारणा फक्त सापेक्ष स्वरूपात दिली आहे: एका DROID चाचणीत ६१% आणि SimplerEnv Bridge मध्ये ५% वाढ. त्याच मॉडेलचे Hugging Face मॉडेल कार्ड NVIDIA Open Model License चे नाव घेते, म्हणजे परवान्याबद्दल NVIDIA ची दोन पाने एकमेकांशी जुळत नाहीत.

NVIDIA च्या मार्च निवेदनात GR00T N2 चेही पूर्वदर्शन होते, जे DreamZero संशोधनावर आधारित आहे. NVIDIA चे अभियंते DreamZero चे वर्णन जागतिक-कृती मॉडेल असे करतात, म्हणजे एकच जाळे जे अंदाजित व्हिडिओ आणि कृती एकत्र तयार करते. NVIDIA म्हणते की ते नवीन वातावरणातील नवीन कामांत आघाडीच्या VLA पेक्षा दुप्पट हून अधिक वेळा यशस्वी होते आणि MolmoSpaces व RoboArena लीडरबोर्डवर पहिल्या क्रमांकावर आहे. निवेदन या दाव्यामागचा कोणताही डेटा देत नाही, आणि N2 २०२६ च्या अखेरीसाठी ठरले आहे.

Xiaomi चे XR-1 आपल्या चाचण्या वेट्ससोबत प्रसिद्ध करते. त्याचे README, Apache 2.0 अंतर्गत, रोबो शरीराशिवाय नोंदवलेल्या १,००,००० तासांहून अधिक प्रात्यक्षिक डेटावरील पूर्वप्रशिक्षणाचे आणि मग रोबो प्रकारांमधील १०,००० तासांहून अधिक डेटावरील पुढील प्रशिक्षणाचे वर्णन करते. चेकपॉइंट, पुढील प्रशिक्षणाचा कोड आणि मूल्यमापन कोड सार्वजनिक आहेत, आणि तांत्रिक अहवाल १६ जुलै रोजी arXiv वर गेला. Xiaomi RoboCasa365 सिम्युलेशन बेंचमार्कवर ५७.४% नोंदवते, तर दुसऱ्या क्रमांकाच्या मॉडेलचे ४६.६%. प्रति काम १० तासांहून कमी डेटासह चार प्रत्यक्ष-रोबो कामांवर ते एकूण ७५% नोंदवते, तर pi0.5 चे ४०%, आणि ४० तासांहून कमी डेटासह ८५% विरुद्ध ५३%. कपडे यंत्रात भरण्याचे काम ४० तासांच्या मांडणीत १००% विरुद्ध ५०% पर्यंत पोहोचले. प्रत्यक्ष-रोबो तुलना Xiaomi ची स्वतःची आहे, आणि README म्हणते की १५ जुलैपर्यंत XR-1 RoboCasa365 आणि RoboDojo लीडरबोर्डवर पहिल्या क्रमांकावर आहे.

Unitree ने १० सप्टेंबर रोजी जाहीर केले की ते UnifoLM-WLA-1.0 खुल्या स्रोतात देत आहे, ज्याबद्दल ते म्हणते की ते टेबलावरील आणि पूर्ण शरीराचे दोन्ही प्रकारचे काम चालवते. त्याचे Hugging Face पान Apache 2.0 अंतर्गत एक बेस चेकपॉइंट दाखवते, पण tuput ने वाचले तेव्हा मॉडेल कार्ड रिकामे होते, म्हणून कामांचे कोणतेही आकडे उपलब्ध नव्हते. Unitree चे ह्यूमनॉइड हार्डवेअर, आणि ते रोबो व्हॅक्यूमशी काय सामायिक करते, हे दोघांच्या आमच्या तुलनेत आहे.

Figure आणि AgiBot

Figure चे Helix 02, जे २७ जानेवारी २०२६ रोजी सादर झाले, Figure च्या म्हणण्यानुसार ६१ कृतींचे चार मिनिटांचे डिशवॉशर काम रीसेटशिवाय चालवते. त्याचा तोल सांभाळणारा थर १ कोटी पॅरामीटरचे जाळे आहे, जे १,००० तासांहून अधिक मानवी हालचाली डेटावर प्रशिक्षित आहे. पान यशाचे दर देत नाही आणि बोटांच्या पातळीवरची कामे Figure 03 हार्डवेअरशी जोडते, ज्यातील बोटांच्या टोकांचे सेन्सर तीन ग्रॅमइतक्या लहान बलांचाही शोध घेतात. Figure निकालांना सुरुवातीचे म्हणते. या प्रकारच्या ह्यूमनॉइडनी पगारी चाचणी प्रकल्पांत काय केले आहे ते ह्यूमनॉइड कामावर रुजू होतात या आमच्या वृत्तात आहे.

AgiBot चे GO-2, जे ९ एप्रिल रोजी जाहीर झाले, त्याला The Robot Report LIBERO सिम्युलेशन संचावर ९८.५%, LIBERO-Plus वर ८६.६% आणि फक्त सिम्युलेशनमध्ये प्रशिक्षणानंतर प्रत्यक्ष जगात हस्तांतरणात ८२.९% असे श्रेय देते. हे तिन्ही आकडे AgiBot चे आहेत, आणि GO-2 चे वेट्स सार्वजनिक आहेत का हे लेख सांगत नाही.

टक्केवारी शेजारी शेजारी का मांडता येत नाही

LIBERO वरील ९८.५% हा निश्चित सिम्युलेशन संचावरील गुण आहे. फावड्यावरील ३२% हा २२ सांधे असलेल्या हातांचा खरा ह्यूमनॉइड आहे. Skild चे ६६% हे लांब कामांतील प्रति-टप्पा यशाची सरासरी आहे. यांपैकी कोणत्याही दोन आकड्यांचे काम, रोबो किंवा गुणांकनाचा नियम एकसारखा नाही, आणि स्वतःची तुलना करणाऱ्या प्रयोगशाळा प्रतिस्पर्धी म्हणून pi0.5 चे किंवा स्वतःच्या आधीच्या आवृत्त्यांचे नाव घेतात.

NVIDIA चे मार्च निवेदन म्हणते की GR00T N2 २०२६ च्या अखेरीपर्यंत उपलब्ध होणार आहे.

Share
Copied!

स्रोत आणि पुढील वाचन

  1. Google DeepMind: Gemini Robotics 2 brings whole body intelligence to robots (30 July 2026)
  2. Google DeepMind: Gemini Robotics 2 overview and trusted tester programme
  3. Google DeepMind: Gemini Robotics On-Device 2 model card
  4. Google: Introducing Gemini Robotics ER 2 (30 July 2026)
  5. Physical Intelligence: pi 0.7, a Steerable Generalist Robotic Foundation Model with Emergent Capabilities (arXiv 2604.15483, 16 April 2026)
  6. The Decoder: Physical Intelligence shows robot model with LLM-like generalization, flaws included
  7. Physical Intelligence: openpi repository (GitHub)
  8. Skild AI: Introducing S1, In-Context Learning for Robotics (August 2026)
  9. The Robot Report: Skild AI unveils S1 flagship robot foundation model (31 August 2026)
  10. NVIDIA: NVIDIA and Global Robotics Leaders Take Physical AI to the Real World (16 March 2026)
  11. NVIDIA Technical Blog: Develop Humanoid Robot Policies End-to-End with NVIDIA Isaac GR00T (7 July 2026)
  12. NVIDIA Technical Blog: Pretrained to Imagine, Fine-Tuned to Act, the Rise of World-Action Models (15 June 2026)
  13. Hugging Face: NVIDIA GR00T-N1.7-3B model card
  14. GitHub: Xiaomi-Robotics-1 (XR-1) README
  15. Hugging Face: Unitree Robotics models, UnifoLM-WLA-1.0-Base
  16. PANews: Unitree Robotics open-sources UnifoLM-WLA-1.0 embodied foundation model
  17. Figure: Introducing Helix 02, Full-Body Autonomy (27 January 2026)
  18. The Robot Report: AGIBOT releases GO-2 foundation model for embodied AI (9 April 2026)

हा लेख AI साधनांच्या मदतीने संशोधित आणि लिहिला गेला असून अचूकतेसाठी संपादित केला आहे. हा केवळ सर्वसाधारण माहिती आणि चर्चेसाठी आहे, व्यावसायिक सल्ला नाही. आमचे संपादकीय मानक आणि अस्वीकरण पाहा. चूक आढळली? आम्हाला कळवा.

#robot foundation models#gemini robotics 2#physical intelligence#nvidia gr00t#skild ai#xiaomi robotics#humanoid robots#vision-language-action

आवडलं? पुढचा लेख मिळवा.

एका वेळी एक चांगला लेख, थेट तुमच्या इनबॉक्समध्ये. स्पॅम नाही, हवं तेव्हा थांबवा.

याच विभागात आणखी: रोबोटिक्स
२००२ च्या रूम्बाची किंमत $१९९.९५ होती आणि त्यात नकाशा नव्हता; आजचे ह्युमनॉइड रोबोट रोबोट व्हॅक्युम उद्योगासोबत चार्जिंगची अडचण आणि एक लिडार पुरवठादार वाटून घेतात, पण त्याचे हार्डवेअर फारसे नाही
२००२ चा रूम्बा नकाशाशिवाय फिरत असे, कारण स्थान ओळखणारी यंत्रणा बसवली असती तर त्याची किंमत $१,००० हून जास्त वाढली असती. आयरोबोट, हेसाई, रोबोरॉक, इकोव्हॅक्स यांची कागदपत्रे आणि शैक्षणिक शोधनिबंध दाखवतात की त्याच्या कोणत्या कल्पना आजच्या ह्युमनॉइड रोबोटपर्यंत पोहोचल्या.
अनकॅनी व्हॅली निसर्गाचा नियम नाही. तो एक डिझाइन निर्णय आहे
ह्युमनॉइड रोबोट्स जगात ओतले जात असताना, एक जुनी भीती परत आली आहे: यंत्र जवळपास माणसासारखे दिसताना ती मळमळणारी भावना. आम्ही ती मनाचे एक निश्चित सत्य मानतो. ती नाही. हा एक सापळा आहे ज्याला अभियंते टाळणे निवडू शकतात.
२०२६ हे ते वर्ष आहे जेव्हा ह्युमनॉइड रोबोट्स अखेर कामावर हजर झाले
अनेक दशकांपासून चालणारा, बोलणारा रोबोट नेहमीच 'काही वर्षे दूर' होता. या वर्षी ते कारखान्यांच्या मजल्यांवर आणि विमानतळांवर दिसू लागले, खऱ्या कामांवर खऱ्या तासांची नोंद ठेवत. समस्या आहे ती म्हणजे त्यांची संख्या किती कमी आहे.
← सर्व लेख