Skip to content
Gemini Robotics 2 बल्ब खोलने में 92% सफल रहा और कसने में 36%, और Xiaomi का खुला रोबोट मॉडल अपने ही असली-रोबोट परीक्षणों में pi0.5 के 40% के मुक़ाबले 75% बताता है
रोबोटिक्स

Gemini Robotics 2 बल्ब खोलने में 92% सफल रहा और कसने में 36%, और Xiaomi का खुला रोबोट मॉडल अपने ही असली-रोबोट परीक्षणों में pi0.5 के 40% के मुक़ाबले 75% बताता है

चित्रण: tuput

हिन्दी

Google DeepMind ने 30 जुलाई 2026 को Gemini Robotics 2 की सफलता दरें छापीं, कूड़ा-पैन वाले काम पर 32% से लेकर बल्ब खोलने पर 92% तक, पर परीक्षणों की गिनती नहीं बताई। tuput ने जिन मॉडलों को जाँचा, उनमें NVIDIA, Xiaomi और Unitree ने अपने वेट्स ऑनलाइन रखे हैं, और सुर्ख़ी वाले आँकड़े प्रयोगशालाओं के अपने हैं या यह बताए बिना आए हैं कि परीक्षण किसने किया।

· · 9 मिनट का पठन

Google DeepMind ने 30 जुलाई 2026 को Gemini Robotics 2 जारी किया तो साथ में एक ह्यूमनॉइड रोबोट की सफलता दरों के चार्ट आए: बल्ब खोलने में 92%, उसे कसने में 36%, कूड़ा-पैन इस्तेमाल करने में 32%। DeepMind का पन्ना नहीं बताता कि इनमें से किसी के पीछे कितने परीक्षण हैं।

रोबोट फ़ाउंडेशन मॉडल एक ऐसा प्रशिक्षित नेटवर्क है जो कैमरे की तस्वीरें और लिखा हुआ निर्देश लेकर मोटरों के आदेश देता है, कई तरह के कामों और कई तरह की रोबोट देहों के लिए। 2026 में आठ प्रयोगशालाओं ने ऐसा मॉडल या उसका नया संस्करण जारी किया है। tuput जिस भी सुर्ख़ी वाले आँकड़े का स्रोत खोज पाया, उसमें या तो प्रयोगशाला ने अपने परीक्षण ख़ुद चलाए, या पन्ना यह नहीं बताता कि किसने चलाए। वेट्स, यानी वे प्रशिक्षित संख्याएँ जिन्हें कोई डेवलपर डाउनलोड कर सके, कितने सार्वजनिक हैं, यह काफ़ी अलग-अलग है।

Google के ह्यूमनॉइड आँकड़े, और उन्हें कौन इस्तेमाल कर सकता है

Gemini Robotics 2 एक विज़न-लैंग्वेज-एक्शन मॉडल है, यानी VLA: वह तस्वीरें और भाषा पढ़ता है और क्रियाएँ देता है। Carolina Parada की DeepMind पोस्ट कहती है कि वह पूरे ह्यूमनॉइड को “पैरों से उँगलियों के सिरों तक” नियंत्रित कर सकता है, और दो भुजाओं वाले रोबोट को भी। उसके साथ दो सहायक जारी हुए। ER 2 एक योजनाकार है जो किसी काम को क़दमों में बाँटता है और VLA को बुलाता है। On-Device 2 एक छोटा संस्करण है जो रोबोट के अपने कंप्यूटर पर चलता है।

Apptronik के Apollo 2 ह्यूमनॉइड पर, Inspire हाथों के साथ, DeepMind मेज़ से चीज़ उठाने में 68.4%, शेल्फ़ से 76.3% और फ़र्श से 45.7% बताता है। Sharpa हाथों के साथ वह बल्ब खोलने में 92%, कचरे की थैली बाँधने में 44%, ज़िपलॉक थैली में 40%, बल्ब कसने में 36% और कूड़ा-पैन में 32% बताता है। पकड़ने वाले ग्रिपरों के साथ Franka Duo भुजाओं पर अंक हैं: उठाकर रखने में 74.2%, औज़ार सजाने में 78.9% और सटीक डालने में 89.6%। Google कहता है कि कई उँगलियों की कुशलता अब भी चुनौती है और उसके रोबोटों को और तेज़ चलना होगा। इन कम अंकों के पीछे की हाथ की समस्या रोबोट का हाथ पकड़ना कैसे सीखता है वाले हमारे लेख में समझाई गई है।

पहुँच सीमित है। VLA और On-Device 2 शुरुआती पहुँच वाले साझेदारों को जाते हैं, और मॉडल का पन्ना 100 से ज़्यादा भरोसेमंद परीक्षकों का हवाला देता है। ER 2 को Google AI Studio में आज़माया जा सकता है, जहाँ उस पर प्रीव्यू का लेबल है।

ER 2 के अपने आँकड़े Google के मूल्यांकनों से हैं: प्रगति वर्गीकरण में 57.4% सटीकता, जिसमें वीडियो के एक फ़्रेम को पाँच वर्गों में रखा जाता है कि काम कितना आगे बढ़ा है, और क्षण खोजने में 91.3%, जिसमें वह फ़्रेम चुना जाता है जहाँ कोई अहम घटना होती है, औसत त्रुटि 0.96 सेकंड के साथ। Google ने ASIMOV-Agentic नाम का एक सुरक्षा बेंचमार्क भी छापा है, और कहता है कि परीक्षणों में ER 2 ने किसी इंसान के पास आने पर ह्यूमनॉइड को रोक दिया।

On-Device 2 का मॉडल कार्ड ब्लॉग से ज़्यादा सपाट है। वह प्रशिक्षण के दायरे से बाहर के कामों में सीमित सामान्यीकरण और बहुत सारे जोड़ों वाले रोबोट को नियंत्रित करने की सीमित क्षमता गिनाता है। उसका सुरक्षा परीक्षण सिर्फ़ खड़े होकर दो भुजाओं से किए जाने वाले काम पर हुआ, इसलिए पूरे शरीर के जोखिम उसके दायरे से बाहर हैं। DeepMind कहता है कि नए दो-भुजा रोबोट को कुछ घंटों में जुटाए गए 200 से कम उदाहरणों से ढाला जा सकता है।

Physical Intelligence: pi0.7 और “अनदेखे” की मुश्किल

Physical Intelligence ने pi0.7 का शोधपत्र 16 अप्रैल 2026 को arXiv पर डाला। मॉडल लगभग 5 अरब पैरामीटर का है: Google के Gemma 3 से शुरू हुआ 4 अरब पैरामीटर का भाषा-और-दृष्टि वाला आधार और 86 करोड़ पैरामीटर का क्रिया मॉड्यूल।

सुर्ख़ी वाला परीक्षण UR5e भुजा पर क़मीज़ तह करने का है, जिसके लिए तह करने का कोई डेटा जुटाया ही नहीं गया था। लेखक pi0.7 के लिए 80% सफलता और 85.6% काम की प्रगति बताते हैं, जबकि दस अनुभवी मानव टेलीऑपरेटरों के लिए 80.6% सफलता और 90.9% प्रगति है। अध्ययन लेखकों ने ही चलाया। अनदेखे कामों या रोबोट और काम की नई जोड़ियों पर वे लगभग 60% से 80% सफलता बताते हैं, जबकि पहले से देखे कामों पर अक्सर 90% से ऊपर रही। कपड़े तह करना तनाव-परीक्षण का आम काम है, और यह क्यों कठिन बना रहता है, यह शतरंज में जीतने और कपड़ों में हारने वाले रोबोट वाले हमारे लेख में है।

लेखक लिखते हैं कि उनके डेटासेट के आकार को देखते हुए यह तय करना मुश्किल है कि अनदेखा क्या माना जाए। The Decoder ने एक उदाहरण बताया: शकरकंद को एयर फ़्रायर में डालते रोबोट को क़दम-दर-क़दम सिखाना पड़ा, जबकि प्रशिक्षण डेटा में एयर फ़्रायर बंद करते रोबोट के सिर्फ़ दो एपिसोड थे।

शोधपत्र नहीं बताता कि वेट्स जारी होंगे या नहीं। tuput ने openpi रिपॉज़िटरी का जो पन्ना पढ़ा, उसमें Apache 2.0 लाइसेंस के तहत pi0, pi0-FAST और pi0.5 सूचीबद्ध हैं, pi0.7 नहीं।

Skild का S1: अनदेखे कामों पर 66%, सादे प्रशिक्षण पर 86%

Skild AI का ब्लॉग S1 को ऐसा मॉडल बताता है जो किसी काम का एक वीडियो देखता है और फिर उसे कर देता है, अपने वेट्स में बदलाव के बिना। काम दस मिनट तक के होते हैं। 1,00,000 घंटे के पूर्व-प्रशिक्षण के बाद अनदेखे कामों पर Skild 66% सफलता बताता है, जबकि उसी डेटा, उसी बनावट और उसी कंप्यूट पर प्रशिक्षित, भाषा-निर्देश से चलने वाले VLA के लिए 9%। पैमाना लंबे कामों पर औसत प्रति-चरण सफलता है। Skild कहता है कि दो आंतरिक बेंचमार्क सेट इस्तेमाल हुए और कामों या परीक्षणों की संख्या नहीं देता। असफल रोलआउट को सँभालने के लिए मानव ऑपरेटर दख़ल दे सकते थे, ख़ासकर बेसलाइन के लिए, जिसका अंक वरना लंबे अनदेखे कामों पर शून्य रहा।

Skild के अपने आँकड़े सीमा भी दिखाते हैं। 2,000 प्रदर्शनों पर पोस्ट-ट्रेन किया गया VLA Skild के परखे नए काम पर 86% तक पहुँचा, जो एक वीडियो वाले 66% से ऊपर है। Skild का अनुमान है कि एक वीडियो लगभग 380 प्रदर्शनों के बराबर है, और वह इस आँकड़े को इंटरपोलेट किया हुआ बताता है। पोस्ट शुरुआती पहुँच के लिए साइन-अप देती है, डाउनलोड नहीं।

The Robot Report ने CEO Deepak Pathak को यह कहते उद्धृत किया है कि S1 को अभी ह्यूमनॉइड तक नहीं बढ़ाया गया है और वह घरों के लिए तैयार नहीं है। पोस्ट उन रोबोटों के नाम नहीं बताती जिन पर यह चला।

NVIDIA, Xiaomi और Unitree के खुले वेट्स

NVIDIA के GR00T N1.7 में लगभग 3 अरब पैरामीटर हैं। उसकी 16 मार्च की प्रेस विज्ञप्ति ने उसे व्यावसायिक लाइसेंस के साथ शुरुआती पहुँच में उपलब्ध बताया। 7 जुलाई की तकनीकी पोस्ट कहती है कि वह Apache 2.0 के तहत जारी है, वेट्स Hugging Face पर और प्रशिक्षण कोड GitHub पर, लगभग 32,000 घंटे के असली और पहले-व्यक्ति मानव डेटा और 8,000 घंटे के सिमुलेशन पर पूर्व-प्रशिक्षण के बाद। N1.6 पर उसकी बढ़त सिर्फ़ सापेक्ष रूप में दी गई है: एक DROID परीक्षण पर 61% और SimplerEnv Bridge पर 5% ऊपर। उसी मॉडल का Hugging Face मॉडल कार्ड NVIDIA Open Model License का नाम लेता है, यानी NVIDIA के दोनों पन्ने लाइसेंस पर एक-दूसरे से असहमत हैं।

NVIDIA की मार्च की विज्ञप्ति ने GR00T N2 की भी झलक दी, जो DreamZero शोध पर आधारित है। NVIDIA के इंजीनियर DreamZero को वर्ल्ड-एक्शन मॉडल बताते हैं, यानी एक ऐसा नेटवर्क जो अनुमानित वीडियो और क्रियाएँ साथ-साथ बनाता है। NVIDIA कहता है कि नए माहौल में नए कामों पर वह अग्रणी VLA से दोगुनी से ज़्यादा बार सफल होता है और MolmoSpaces तथा RoboArena लीडरबोर्ड पर पहले स्थान पर है। विज्ञप्ति इस दावे के पीछे कोई डेटा नहीं देती, और N2 को 2026 के अंत के लिए रखा गया है।

Xiaomi का XR-1 अपने वेट्स के साथ अपने परीक्षण भी छापता है। उसका README, Apache 2.0 के तहत, बिना रोबोट देह के दर्ज किए प्रदर्शन-डेटा के 1,00,000 घंटे से ज़्यादा पर पूर्व-प्रशिक्षण और फिर अलग-अलग तरह के रोबोटों पर 10,000 घंटे से ज़्यादा पर पोस्ट-ट्रेनिंग बताता है। चेकपॉइंट, पोस्ट-ट्रेनिंग कोड और मूल्यांकन कोड सार्वजनिक हैं, और तकनीकी रिपोर्ट 16 जुलाई को arXiv पर गई। Xiaomi RoboCasa365 सिमुलेशन बेंचमार्क पर 57.4% बताता है, जबकि दूसरे सबसे अच्छे मॉडल का 46.6% है। प्रति काम 10 घंटे से कम डेटा वाले चार असली-रोबोट कामों पर वह कुल 75% बताता है, जबकि pi0.5 का 40%, और 40 घंटे से कम डेटा पर 85% के मुक़ाबले 53%। 40 घंटे वाली स्थिति में कपड़े मशीन में डालना 50% के मुक़ाबले 100% तक पहुँचा। असली-रोबोट तुलना Xiaomi की अपनी है, और README कहता है कि 15 जुलाई तक XR-1 RoboCasa365 और RoboDojo लीडरबोर्ड पर पहले स्थान पर है।

Unitree ने 10 सितंबर को घोषणा की कि वह UnifoLM-WLA-1.0 को ओपन-सोर्स कर रहा है, एक ऐसा मॉडल जो उसके अनुसार मेज़ पर और पूरे शरीर के, दोनों तरह के काम चलाता है। उसका Hugging Face पन्ना Apache 2.0 के तहत एक बेस चेकपॉइंट सूचीबद्ध करता है, पर tuput के पढ़ते समय मॉडल कार्ड ख़ाली था, इसलिए काम के कोई आँकड़े उपलब्ध नहीं थे। Unitree का ह्यूमनॉइड हार्डवेयर और उसमें रोबोट वैक्यूम से क्या साझा है, यह दोनों की हमारी तुलना में है।

Figure और AgiBot

Figure के अनुसार, 27 जनवरी 2026 को पेश हुआ Helix 02 चार मिनट का बर्तन धोने वाली मशीन का काम 61 क्रियाओं में बिना रीसेट के चलाता है। उसकी संतुलन परत 1 करोड़ पैरामीटर का नेटवर्क है, जिसे मानव गति के 1,000 घंटे से ज़्यादा के डेटा पर प्रशिक्षित किया गया। पन्ना कोई सफलता दर नहीं देता और उँगलियों के स्तर वाले कामों को Figure 03 हार्डवेयर से जोड़ता है, जिसकी उँगलियों की नोकों में लगे सेंसर तीन ग्राम जितने छोटे बल भी पकड़ लेते हैं। Figure इन नतीजों को शुरुआती कहता है। इस तरह के ह्यूमनॉइड ने भुगतान वाले पायलटों में क्या किया है, यह ड्यूटी पर आते ह्यूमनॉइड वाली हमारी रिपोर्ट में है।

AgiBot के GO-2 को, जिसकी घोषणा 9 अप्रैल को हुई, The Robot Report LIBERO सिमुलेशन सेट पर 98.5%, LIBERO-Plus पर 86.6% और सिर्फ़ सिमुलेशन में प्रशिक्षण के बाद असली दुनिया में स्थानांतरण पर 82.9% का श्रेय देता है। तीनों आँकड़े AgiBot के हैं, और लेख यह नहीं बताता कि GO-2 के वेट्स सार्वजनिक हैं या नहीं।

प्रतिशतों को आमने-सामने क्यों नहीं रखा जा सकता

LIBERO पर 98.5% एक तय सिमुलेशन सेट का अंक है। कूड़ा-पैन पर 32% 22 जोड़ों वाले हाथों के साथ असली ह्यूमनॉइड का है। Skild का 66% लंबे कामों पर प्रति-चरण सफलता का औसत है। इनमें से किन्हीं दो में न काम साझा है, न रोबोट, न अंक देने का नियम, और जो प्रयोगशालाएँ अपनी तुलना करती हैं वे प्रतिद्वंद्वी के रूप में pi0.5 या अपने ही मॉडलों के पुराने संस्करणों का नाम लेती हैं।

NVIDIA की मार्च की विज्ञप्ति कहती है कि GR00T N2 को 2026 के अंत तक उपलब्ध कराने की योजना है।

Share
Copied!

स्रोत और आगे पढ़ने के लिए

  1. Google DeepMind: Gemini Robotics 2 brings whole body intelligence to robots (30 July 2026)
  2. Google DeepMind: Gemini Robotics 2 overview and trusted tester programme
  3. Google DeepMind: Gemini Robotics On-Device 2 model card
  4. Google: Introducing Gemini Robotics ER 2 (30 July 2026)
  5. Physical Intelligence: pi 0.7, a Steerable Generalist Robotic Foundation Model with Emergent Capabilities (arXiv 2604.15483, 16 April 2026)
  6. The Decoder: Physical Intelligence shows robot model with LLM-like generalization, flaws included
  7. Physical Intelligence: openpi repository (GitHub)
  8. Skild AI: Introducing S1, In-Context Learning for Robotics (August 2026)
  9. The Robot Report: Skild AI unveils S1 flagship robot foundation model (31 August 2026)
  10. NVIDIA: NVIDIA and Global Robotics Leaders Take Physical AI to the Real World (16 March 2026)
  11. NVIDIA Technical Blog: Develop Humanoid Robot Policies End-to-End with NVIDIA Isaac GR00T (7 July 2026)
  12. NVIDIA Technical Blog: Pretrained to Imagine, Fine-Tuned to Act, the Rise of World-Action Models (15 June 2026)
  13. Hugging Face: NVIDIA GR00T-N1.7-3B model card
  14. GitHub: Xiaomi-Robotics-1 (XR-1) README
  15. Hugging Face: Unitree Robotics models, UnifoLM-WLA-1.0-Base
  16. PANews: Unitree Robotics open-sources UnifoLM-WLA-1.0 embodied foundation model
  17. Figure: Introducing Helix 02, Full-Body Autonomy (27 January 2026)
  18. The Robot Report: AGIBOT releases GO-2 foundation model for embodied AI (9 April 2026)

यह लेख AI उपकरणों की सहायता से शोधित और लिखा गया है, और सटीकता के लिए संपादित किया गया है। यह केवल सामान्य जानकारी और चर्चा के लिए है, पेशेवर सलाह नहीं। हमारे संपादकीय मानक और अस्वीकरण देखें। कोई त्रुटि मिली? हमें बताएँ।

#robot foundation models#gemini robotics 2#physical intelligence#nvidia gr00t#skild ai#xiaomi robotics#humanoid robots#vision-language-action

अच्छा लगा? अगला लेख पाएँ।

एक बार में एक अच्छा लेख, सीधे आपके इनबॉक्स में। कोई स्पैम नहीं, जब चाहें अनसब्सक्राइब करें।

इसी श्रेणी में और: रोबोटिक्स
2002 के Roomba की क़ीमत $199.95 थी और उसके पास कोई नक़्शा नहीं था; आज के ह्यूमनॉइड रोबोट रोबोट वैक्यूम उद्योग के साथ चार्जिंग की समस्या और एक लाइडार सप्लायर साझा करते हैं, पर हार्डवेयर लगभग नहीं
2002 का Roomba बिना नक़्शे के चलता था, क्योंकि स्थिति पहचानने वाली प्रणाली उसकी क़ीमत में $1,000 से ज़्यादा जोड़ देती। iRobot, Hesai, Roborock, Ecovacs के दस्तावेज़ और शैक्षणिक शोधपत्र बताते हैं कि उसके कौन-से विचार आज के ह्यूमनॉइड रोबोट तक पहुँचे।
अनकैनी वैली कोई प्रकृति का नियम नहीं है। यह एक डिज़ाइन का फ़ैसला है
जैसे-जैसे ह्यूमनॉइड रोबोट दुनिया में उमड़ रहे हैं, एक पुराना डर लौट आया है: वह मिचली भरा एहसास जब कोई मशीन लगभग इंसान जैसी दिखती है। हम इसे मन का एक तयशुदा तथ्य मान लेते हैं। यह वह नहीं है। यह एक ऐसा जाल है जिससे इंजीनियर बचना चुन सकते हैं।
2026 वह साल है जब ह्यूमनॉइड रोबोट आखिरकार काम पर आ गए
दशकों तक चलने-बोलने वाला रोबोट हमेशा 'कुछ ही साल दूर' रहता था। इस साल वे फैक्ट्री के फर्श पर और हवाई अड्डों पर दिखने लगे, असली कामों पर, जिनके घंटे असल में दर्ज हुए। पेच यह है कि वे कितने कम थे।
← सभी लेख