رسم: tuput
العربية
نشرت Google DeepMind في 30 يوليو 2026 نسب نجاح Gemini Robotics 2، من 32% في مهمة المجرفة الصغيرة إلى 92% في فكّ مصباح، دون ذكر عدد المحاولات. ومن النماذج التي راجعتها tuput، نشرت NVIDIA وشاومي ويونيتري أوزانها على الإنترنت، وأرقام العناوين إما من اختبارات المختبرات نفسها أو تأتي دون ذكر جهة الاختبار.
جاء إصدار Google DeepMind لـ Gemini Robotics 2 في 30 يوليو 2026 مصحوبا برسوم بيانية لنسب نجاح روبوت بشري الشكل: 92% في فكّ مصباح، و36% في تركيب مصباح، و32% في استخدام المجرفة الصغيرة. ولا تقول صفحة DeepMind كم محاولة تقف خلف أي منها.
النموذج الأساسي للروبوتات شبكة واحدة مدرَّبة تتلقى صور الكاميرا وتعليمة مكتوبة وتُخرج أوامر المحركات، لمهام كثيرة وأجسام روبوتية كثيرة. وقد أصدرت ثمانية مختبرات في 2026 نموذجا من هذا النوع أو تحديثا له. ولكل رقم رئيسي استطاعت tuput تتبعه، إما أن المختبر أجرى اختباراته بنفسه، أو أن الصفحة لا تقول من أجراها. أما الأوزان، أي الأرقام المدرَّبة التي يستطيع المطور تنزيلها، فمدى إتاحتها يتفاوت كثيرا.
أرقام غوغل للروبوت البشري ومن يستطيع استخدامها
Gemini Robotics 2 نموذج رؤية ولغة وفعل (VLA): يقرأ الصور واللغة ويُخرج أفعالا. وتقول مقالة كارولينا باراد في DeepMind إنه يستطيع التحكم في روبوتات بشرية كاملة “من القدمين إلى أطراف الأصابع” وكذلك في الروبوتات ذات الذراعين. ورافقه نموذجان مساعدان. ER 2 مخطِّط يقسم المهمة إلى خطوات ويستدعي VLA. وOn-Device 2 نسخة أصغر تعمل على حاسوب الروبوت نفسه.
على الروبوت البشري Apollo 2 من Apptronik بأيدي Inspire، تعلن DeepMind نسبة 68.4% في التقاط شيء من طاولة، و76.3% من رف، و45.7% من الأرض. وبأيدي Sharpa تعلن 92% في فكّ مصباح، و44% في ربط كيس قمامة، و40% في كيس ziplock، و36% في تركيب مصباح، و32% في المجرفة الصغيرة. وعلى ذراعي Franka Duo بقابضين تبلغ النتائج 74.2% في الالتقاط والوضع، و78.9% في تجهيز الأدوات، و89.6% في الإدخال الدقيق. وتقول غوغل إن البراعة متعددة الأصابع لا تزال صعبة، وإن روبوتاتها ما زالت تحتاج إلى حركة أسرع. ومشكلة اليد التي تقف وراء تلك النسب المنخفضة موضحة في مقالتنا عن كيف تتعلم اليد الروبوتية الإمساك.
والوصول محدود. فنموذج VLA وOn-Device 2 يذهبان إلى شركاء الوصول المبكر، وتذكر صفحة النموذج أكثر من 100 مختبِر موثوق. أما ER 2 فيمكن تجربته في Google AI Studio، حيث يُوصف بأنه نسخة معاينة.
ولـ ER 2 أرقامه الخاصة من تقييمات غوغل: دقة 57.4% في تصنيف التقدم، أي فرز لقطة الفيديو في خمس فئات بحسب مدى ما بلغته المهمة، و91.3% في إيجاد اللحظة، أي اختيار اللقطة التي يقع فيها حدث رئيسي، بخطأ متوسط 0.96 ثانية. ونشرت غوغل أيضا معيارا للسلامة اسمه ASIMOV-Agentic، وتقول إن ER 2 أوقف في الاختبارات روبوتا بشريا حين اقترب منه شخص.
وبطاقة نموذج On-Device 2 أكثر صراحة من المدونة. فهي تذكر محدودية التعميم على مهام خارج توزيع التدريب، ومحدودية القدرة على التحكم في روبوتات ذات مفاصل كثيرة. واقتصر اختبار السلامة فيها على العمل الواقف بذراعين، فمخاطر الجسم الكامل خارج نطاقها. وتقول DeepMind إن بالإمكان تكييف روبوت جديد بذراعين بأقل من 200 مثال تُجمع خلال ساعات قليلة.
Physical Intelligence: pi0.7 ومشكلة كلمة “غير مرئي”
نشرت Physical Intelligence ورقة pi0.7 على arXiv في 16 أبريل 2026. ويبلغ حجم النموذج نحو 5 مليارات معامل: عمود فقري للغة والرؤية بأربعة مليارات معامل انطلق من Gemma 3 من غوغل، مع وحدة أفعال بـ 860 مليون معامل.
والاختبار الرئيسي طيّ القمصان على ذراع UR5e لم تُجمع لها أي بيانات طيّ. ويعلن المؤلفون نسبة نجاح 80% وتقدما في المهمة بنسبة 85.6% لـ pi0.7، مقابل نجاح 80.6% وتقدم 90.9% لعشرة مشغّلين بشريين عن بُعد من أصحاب الخبرة. وقد أجرى المؤلفون الدراسة بأنفسهم. وفي المهام غير المرئية أو التركيبات الجديدة من مهمة وروبوت يعلنون نجاحا يقارب 60% إلى 80%، بينما كانت المهام التي رآها النموذج من قبل تتجاوز في أحيان كثيرة 90%. وطيّ الغسيل اختبار إجهاد شائع، وسبب بقائه صعبا مشروح في مقالتنا عن الروبوتات التي تتفوق في الشطرنج وتفشل في الغسيل.
ويكتب المؤلفون أن من الصعب تحديد ما يُعدّ غير مرئي بالنظر إلى حجم بياناتهم. وأورد موقع The Decoder مثالا واحدا: روبوت يضع بطاطا حلوة في قلاية هوائية احتاج إلى توجيه خطوة خطوة، ولم تضم بيانات التدريب سوى حلقتين لروبوت يغلق قلاية هوائية.
ولا تقول الورقة هل ستُنشر الأوزان. وصفحة مستودع openpi التي قرأتها tuput تذكر pi0 وpi0-FAST وpi0.5 برخصة Apache 2.0، ولا تذكر pi0.7.
نموذج S1 من Skild: 66% على المهام غير المرئية و86% للتدريب العادي
تقدّم مدونة Skild AI نموذج S1 بأنه يشاهد فيديو واحدا لمهمة ثم ينفذها دون أي تغيير في أوزانه. وتصل المهام إلى عشر دقائق. وفي المهام غير المرئية بعد 100,000 ساعة من التدريب المسبق، تعلن Skild نجاحا بنسبة 66% مقابل 9% لنموذج VLA يُوجَّه باللغة ودُرّب على البيانات والبنية والحوسبة نفسها. والمقياس هو نجاح كل خطوة بمتوسطه على المهام الطويلة. وتقول Skild إنها استخدمت مجموعتين داخليتين من المعايير ولا تذكر عدد المهام أو المحاولات. وكان بإمكان مشغّلين بشريين التدخل لاستعادة المحاولات الفاشلة، وخاصة للنموذج المرجعي الذي سجّل خلاف ذلك صفرا في المهام الطويلة غير المرئية.
وأرقام Skild نفسها تُظهر الحد أيضا. فنموذج VLA دُرّب لاحقا على 2,000 عرض توضيحي بلغ 86% في المهمة الجديدة التي اختبرتها Skild، أي أعلى من 66% بفيديو واحد. وتقدّر Skild أن الفيديو الواحد يعادل نحو 380 عرضا توضيحيا، وتصف هذا الرقم بأنه مُستكمَل بالاستيفاء. وتعرض المدونة تسجيلا للوصول المبكر لا رابط تنزيل.
وينقل موقع The Robot Report عن الرئيس التنفيذي ديباك باثاك قوله إن S1 لم يُوسَّع بعد ليشمل الروبوتات البشرية وليس جاهزا للمنازل. ولا تسمّي المدونة الروبوتات التي جُرّب عليها.
أوزان مفتوحة من NVIDIA وشاومي ويونيتري
يضم GR00T N1.7 من NVIDIA نحو 3 مليارات معامل. وقد وصفه بيانها الصحفي في 16 مارس بأنه متاح بوصول مبكر مع ترخيص تجاري. وتقول مقالة تقنية في 7 يوليو إنه صدر برخصة Apache 2.0، مع الأوزان على Hugging Face وشيفرة التدريب على GitHub، بعد تدريب مسبق على نحو 32,000 ساعة من البيانات الحقيقية وبيانات البشر من منظور الشخص الأول و8,000 ساعة من المحاكاة. ومكاسبه على N1.6 معطاة بصورة نسبية فقط: ارتفاع 61% في اختبار DROID واحد و5% في SimplerEnv Bridge. أما بطاقة النموذج نفسه على Hugging Face فتذكر رخصة NVIDIA Open Model License، فصفحتا NVIDIA تختلفان في الرخصة.
وعرض إصدار NVIDIA في مارس أيضا نظرة أولى على GR00T N2، المبني على بحث DreamZero. ويصف مهندسو NVIDIA نموذج DreamZero بأنه نموذج عالم وفعل، أي شبكة واحدة تولّد الفيديو المتوقع والأفعال معا. وتقول NVIDIA إنه ينجح في مهام جديدة في بيئات جديدة أكثر من ضعفي ما تنجح به نماذج VLA الرائدة، وإنه يحتل المرتبة الأولى في لوحتي MolmoSpaces وRoboArena. ولا يقدّم الإصدار بيانات تسند هذا الادعاء، ومن المقرر أن يصدر N2 في نهاية 2026.
وينشر XR-1 من شاومي اختباراته إلى جانب أوزانه. ويصف ملف README الخاص به، برخصة Apache 2.0، تدريبا مسبقا على أكثر من 100,000 ساعة من بيانات العروض المسجلة دون جسم روبوت، ثم تدريبا لاحقا على أكثر من 10,000 ساعة عبر أنواع الروبوتات. ونقاط الحفظ وشيفرة التدريب اللاحق وشيفرة التقييم عامة، وصعد التقرير التقني إلى arXiv في 16 يوليو. وتعلن شاومي 57.4% في معيار المحاكاة RoboCasa365 مقابل 46.6% للنموذج الثاني. وفي أربع مهام حقيقية بأقل من 10 ساعات من البيانات لكل مهمة تعلن 75% إجمالا مقابل 40% لـ pi0.5، و85% مقابل 53% بأقل من 40 ساعة. وبلغ تحميل الغسيل 100% مقابل 50% في إعداد الـ 40 ساعة. والمقارنة على الروبوت الحقيقي من إجراء شاومي نفسها، ويقول README إن XR-1 يحتل المرتبة الأولى في لوحتي RoboCasa365 وRoboDojo حتى 15 يوليو.
وأعلنت يونيتري في 10 سبتمبر أنها تفتح مصدر UnifoLM-WLA-1.0، وهو نموذج تقول إنه يشغّل العمل على سطح الطاولة والعمل بالجسم كاملا. وتعرض صفحته على Hugging Face نقطة حفظ أساسية برخصة Apache 2.0، لكن بطاقة النموذج كانت فارغة حين قرأتها tuput، فلم تتوفر أرقام للمهام. وعتاد يونيتري البشري الشكل، وما يشترك فيه مع المكانس الروبوتية، مشروح في مقارنتنا بين الاثنين.
Figure وAgiBot
يشغّل Helix 02 من Figure، الذي قُدّم في 27 يناير 2026، مهمة غسالة صحون من أربع دقائق بـ 61 فعلا ودون إعادة ضبط، بحسب Figure. وطبقة التوازن فيه شبكة بعشرة ملايين معامل دُرّبت على أكثر من 1,000 ساعة من بيانات الحركة البشرية. ولا تعطي الصفحة نسب نجاح، وتربط المهام على مستوى الأصابع بعتاد Figure 03، ذي مستشعرات أطراف الأصابع التي تكشف قوى لا تتجاوز ثلاثة غرامات. وتصف Figure النتائج بأنها أولية. وما فعلته الروبوتات البشرية من هذا النوع في تجارب مدفوعة موجود في تقريرنا عن الروبوتات البشرية في الدوام.
أما GO-2 من AgiBot، الذي أُعلن في 9 أبريل، فينسب إليه The Robot Report نسبة 98.5% في مجموعة المحاكاة LIBERO، و86.6% في LIBERO-Plus، و82.9% في النقل إلى العالم الحقيقي بعد تدريب بالمحاكاة وحدها. وهذه الأرقام الثلاثة كلها من AgiBot، ولا تقول المقالة هل أوزان GO-2 عامة.
لماذا لا يمكن وضع النسب جنبا إلى جنب
نسبة 98.5% في LIBERO درجة على مجموعة محاكاة ثابتة. ونسبة 32% في المجرفة الصغيرة لروبوت بشري حقيقي بأيد ذات 22 مفصلا. ونسبة 66% من Skild متوسط لنجاح كل خطوة عبر مهام طويلة. ولا يشترك اثنان منها في مهمة أو روبوت أو قاعدة تسجيل، والمختبرات التي تقارن نفسها تسمّي pi0.5 أو نسخا سابقة من نماذجها خصما.
ويقول إصدار NVIDIA في مارس إن GR00T N2 مقرر أن يكون متاحا بحلول نهاية 2026.
المصادر وقراءات إضافية
- Google DeepMind: Gemini Robotics 2 brings whole body intelligence to robots (30 July 2026)
- Google DeepMind: Gemini Robotics 2 overview and trusted tester programme
- Google DeepMind: Gemini Robotics On-Device 2 model card
- Google: Introducing Gemini Robotics ER 2 (30 July 2026)
- Physical Intelligence: pi 0.7, a Steerable Generalist Robotic Foundation Model with Emergent Capabilities (arXiv 2604.15483, 16 April 2026)
- The Decoder: Physical Intelligence shows robot model with LLM-like generalization, flaws included
- Physical Intelligence: openpi repository (GitHub)
- Skild AI: Introducing S1, In-Context Learning for Robotics (August 2026)
- The Robot Report: Skild AI unveils S1 flagship robot foundation model (31 August 2026)
- NVIDIA: NVIDIA and Global Robotics Leaders Take Physical AI to the Real World (16 March 2026)
- NVIDIA Technical Blog: Develop Humanoid Robot Policies End-to-End with NVIDIA Isaac GR00T (7 July 2026)
- NVIDIA Technical Blog: Pretrained to Imagine, Fine-Tuned to Act, the Rise of World-Action Models (15 June 2026)
- Hugging Face: NVIDIA GR00T-N1.7-3B model card
- GitHub: Xiaomi-Robotics-1 (XR-1) README
- Hugging Face: Unitree Robotics models, UnifoLM-WLA-1.0-Base
- PANews: Unitree Robotics open-sources UnifoLM-WLA-1.0 embodied foundation model
- Figure: Introducing Helix 02, Full-Body Autonomy (27 January 2026)
- The Robot Report: AGIBOT releases GO-2 foundation model for embodied AI (9 April 2026)
أُعِدّ هذا المقال وكُتب بمساعدة أدوات الذكاء الاصطناعي، وحُرِّر للتحقق من دقته. وهو للمعلومة العامة والنقاش فقط، وليس مشورة مهنية. راجع معاييرنا التحريرية وإخلاء المسؤولية. وجدت خطأ؟ أخبرنا.
أعجبك المقال؟ احصل على التالي.
مقال جيد واحد في كل مرة، يصلك مباشرة إلى بريدك. بلا رسائل مزعجة، ويمكنك إلغاء الاشتراك متى شئت.