చిత్రణ: tuput
తెలుగు
గూగుల్ డీప్మైండ్ 2026 జూలై 30న Gemini Robotics 2 విజయ రేట్లను ప్రచురించింది, డస్ట్పాన్ పనిలో 32% నుండి బల్బు విప్పడంలో 92% వరకు, ప్రయత్నాల సంఖ్యలు లేకుండా. tuput పరిశీలించిన మోడళ్లలో NVIDIA, షియోమీ, యూనిట్రీ వెయిట్స్ను ఆన్లైన్లో ఉంచాయి, ప్రధాన సంఖ్యలు ల్యాబ్ల సొంతవి లేదా పరీక్షించినవారి పేరు లేకుండా వచ్చినవి.
గూగుల్ డీప్మైండ్ 2026 జూలై 30న విడుదల చేసిన Gemini Robotics 2తో పాటు ఒక హ్యూమనాయిడ్ రోబో విజయ రేట్ల చార్టులు వచ్చాయి: లైట్ బల్బు విప్పడానికి 92%, దాన్ని బిగించడానికి 36%, డస్ట్పాన్ వాడటానికి 32%. వాటిలో దేని వెనుకైనా ఎన్ని ప్రయత్నాలు ఉన్నాయో డీప్మైండ్ పేజీ చెప్పదు.
రోబో ఫౌండేషన్ మోడల్ అంటే కెమెరా చిత్రాలను, రాతపూర్వక సూచనను తీసుకుని, అనేక పనుల కోసం, అనేక రోబో శరీరాల కోసం మోటార్ ఆదేశాలను ఇచ్చే ఒకే శిక్షణ పొందిన నెట్వర్క్. 2026లో ఎనిమిది ల్యాబ్లు ఇలాంటి మోడల్ను లేదా దాని అప్డేట్ను విడుదల చేశాయి. tuput గుర్తించగలిగిన ప్రతి ప్రధాన సంఖ్యకు, ల్యాబ్ తన సొంత పరీక్షలను నడిపింది, లేదా ఎవరు నడిపారో పేజీ చెప్పదు. వెయిట్స్, అంటే డెవలపర్ డౌన్లోడ్ చేసుకోగల శిక్షణ పొందిన సంఖ్యలు, ఏవి పబ్లిక్గా ఉన్నాయనేది చాలా మారుతుంది.
గూగుల్ హ్యూమనాయిడ్ సంఖ్యలు, వాటిని ఎవరు వాడగలరు
Gemini Robotics 2 ఒక విజన్-లాంగ్వేజ్-యాక్షన్ మోడల్, లేదా VLA: అది చిత్రాలను, భాషను చదివి చర్యలను ఇస్తుంది. పూర్తి హ్యూమనాయిడ్లను “పాదాల నుండి వేలికొనల వరకు”, అలాగే రెండు చేతుల రోబోలను నియంత్రించగలదని కరోలినా పరాడా డీప్మైండ్ పోస్ట్ చెబుతోంది. దానితో పాటు రెండు తోడు మోడళ్లు విడుదలయ్యాయి. ER 2 ఒక ప్రణాళిక రచయిత, పనిని దశలుగా విడగొట్టి VLAను పిలుస్తుంది. On-Device 2 రోబో సొంత కంప్యూటర్లో నడిచే చిన్న వెర్షన్.
Inspire చేతులతో ఉన్న Apptronik Apollo 2 హ్యూమనాయిడ్పై, ఒక వస్తువును టేబుల్ నుండి తీయడంలో 68.4%, అర నుండి 76.3%, నేల నుండి 45.7% అని డీప్మైండ్ నివేదిస్తోంది. Sharpa చేతులతో బల్బు విప్పడంలో 92%, చెత్త సంచి కట్టడంలో 44%, జిప్లాక్ సంచిలో 40%, బల్బు బిగించడంలో 36%, డస్ట్పాన్లో 32% నివేదిస్తోంది. గ్రిప్పర్లతో ఉన్న Franka Duo చేతులపై స్కోర్లు: పిక్ అండ్ ప్లేస్కు 74.2%, టూల్ కిట్టింగ్కు 78.9%, కచ్చితమైన చొప్పించడానికి 89.6%. బహుళ-వేళ్ల నైపుణ్యం ఇంకా సవాలుగానే ఉందని, తమ రోబోలు ఇంకా వేగంగా కదలాలని గూగుల్ చెబుతోంది. ఆ తక్కువ స్కోర్ల వెనుక ఉన్న చేతి సమస్య రోబో చేతి పట్టుకోవడం ఎలా నేర్చుకుంటుంది అనే మా వ్యాసంలో వివరించబడింది.
అందుబాటు పరిమితం. VLA, On-Device 2 ముందస్తు యాక్సెస్ భాగస్వాములకు వెళ్తాయి, మోడల్ పేజీ 100కు పైగా విశ్వసనీయ పరీక్షకులను పేర్కొంటుంది. ER 2ను గూగుల్ AI స్టూడియోలో ప్రయత్నించవచ్చు, అక్కడ దాన్ని ప్రివ్యూగా పేర్కొన్నారు.
ER 2కు గూగుల్ మూల్యాంకనాల నుండి సొంత సంఖ్యలు ఉన్నాయి: పురోగతి వర్గీకరణలో 57.4% కచ్చితత్వం, అంటే ఒక వీడియో ఫ్రేమ్ను పని ఎంత దూరం వచ్చిందనే ఐదు శ్రేణుల్లో ఒకదానిలో వేయడం; క్షణం కనుగొనడంలో 91.3%, అంటే ఒక కీలక సంఘటన జరిగే ఫ్రేమ్ను ఎంచుకోవడం, సగటు తప్పు 0.96 సెకన్లు. గూగుల్ ASIMOV-Agentic అనే భద్రతా బెంచ్మార్క్ను కూడా ప్రచురించింది, పరీక్షల్లో ఒక వ్యక్తి దగ్గరకు వచ్చినప్పుడు ER 2 హ్యూమనాయిడ్ను ఆపిందని చెబుతోంది.
On-Device 2 మోడల్ కార్డ్ బ్లాగ్ కంటే నిర్మొహమాటంగా ఉంది. శిక్షణ పంపిణీ వెలుపలి పనులకు పరిమిత సాధారణీకరణ, అనేక కీళ్లు ఉన్న రోబోలను నియంత్రించడంలో పరిమిత సామర్థ్యం దానిలో జాబితా చేయబడ్డాయి. దాని భద్రతా పరీక్ష నిలబడి చేసే రెండు చేతుల పనిని మాత్రమే కవర్ చేసింది, కాబట్టి పూర్తి శరీర ప్రమాదాలు దాని పరిధికి వెలుపల ఉన్నాయి. కొత్త రెండు చేతుల రోబోను, కొన్ని గంటల్లో సేకరించిన 200 కంటే తక్కువ ఉదాహరణలతో అనుకూలింపజేయవచ్చని డీప్మైండ్ చెబుతోంది.
ఫిజికల్ ఇంటెలిజెన్స్: pi0.7, “కనిపించని” అనే సమస్య
ఫిజికల్ ఇంటెలిజెన్స్ తన pi0.7 పేపర్ను 2026 ఏప్రిల్ 16న arXivలో పెట్టింది. ఆ మోడల్ సుమారు 5 బిలియన్ పారామీటర్లది: గూగుల్ Gemma 3 నుండి మొదలుపెట్టిన 4-బిలియన్-పారామీటర్ల భాష-మరియు-దృష్టి వెన్నెముక, దానికి 860-మిలియన్-పారామీటర్ల యాక్షన్ మాడ్యూల్.
ప్రధాన పరీక్ష, మడత డేటా ఏదీ సేకరించని UR5e చేతిపై చొక్కా మడవడం. pi0.7కు 80% విజయం, 85.6% పని పురోగతి ఉన్నాయని రచయితలు నివేదిస్తున్నారు, పది మంది అనుభవజ్ఞులైన మానవ టెలీఆపరేటర్లకు 80.6% విజయం, 90.9% పురోగతి ఉన్నాయి. అధ్యయనాన్ని రచయితలే నడిపారు. కనిపించని పనులు లేదా కొత్త పని-మరియు-రోబో జతల్లో సుమారు 60% నుండి 80% విజయం నివేదిస్తున్నారు, అంతకుముందే చూసిన పనులు తరచుగా 90% దాటాయి. బట్టలు మడవడం ఒక సాధారణ ఒత్తిడి పరీక్ష, అది ఎందుకు కష్టంగా ఉంటుందో చదరంగంలో గెలిచి బట్టలు ఉతకడంలో ఓడే రోబోల గురించిన మా వ్యాసం వివరిస్తుంది.
తమ డేటాసెట్ పరిమాణం దృష్ట్యా ఏది కనిపించనిదో నిర్ణయించడం కష్టమని రచయితలు రాస్తున్నారు. ది డీకోడర్ ఒక ఉదాహరణను నివేదించింది: ఒక రోబో చిలగడదుంపను ఎయిర్ ఫ్రయర్లో పెట్టడానికి దశలవారీ శిక్షణ అవసరమైంది, శిక్షణ డేటాలో రోబో ఎయిర్ ఫ్రయర్ను మూసే రెండు ఎపిసోడ్లు మాత్రమే ఉన్నాయి.
వెయిట్స్ను విడుదల చేస్తారో లేదో పేపర్ చెప్పదు. tuput చదివిన openpi రిపాజిటరీ పేజీ అపాచీ 2.0 లైసెన్స్ కింద pi0, pi0-FAST, pi0.5లను జాబితా చేస్తుంది, pi0.7ను కాదు.
స్కిల్డ్ S1: కనిపించని పనుల్లో 66%, సాధారణ శిక్షణకు 86%
స్కిల్డ్ AI బ్లాగ్ S1ను ఒక పనికి సంబంధించిన ఒక వీడియోను చూసి, తన వెయిట్స్లో ఎలాంటి మార్పు లేకుండా దాన్ని చేసే మోడల్గా పరిచయం చేస్తుంది. పనులు పది నిమిషాల వరకు ఉంటాయి. 100,000 గంటల ప్రీట్రైనింగ్ తర్వాత కనిపించని పనుల్లో, అదే డేటా, నిర్మాణం, కంప్యూట్తో శిక్షణ పొందిన భాష-ప్రాంప్ట్ VLAకు 9% ఉండగా, S1కు 66% విజయం ఉందని స్కిల్డ్ నివేదిస్తోంది. కొలమానం, సుదీర్ఘ పనులపై సగటు చేసిన ఒక్కో-దశ విజయం. రెండు అంతర్గత బెంచ్మార్క్ సూట్లను వాడామని స్కిల్డ్ చెబుతుంది, పనుల లేదా ప్రయత్నాల సంఖ్య ఇవ్వదు. విఫలమైన రోల్అవుట్లను సరిచేయడానికి మానవ ఆపరేటర్లు జోక్యం చేసుకోవచ్చు, ప్రధానంగా బేస్లైన్ కోసం, లేకపోతే అది సుదీర్ఘ కనిపించని పనుల్లో సున్నా సాధించింది.
స్కిల్డ్ సొంత సంఖ్యలే పరిమితిని కూడా చూపిస్తాయి. 2,000 ప్రదర్శనలపై పోస్ట్-ట్రైన్ చేసిన VLA, స్కిల్డ్ పరీక్షించిన కొత్త పనిలో 86% చేరింది, ఒక వీడియో నుండి వచ్చిన 66% కంటే ఎక్కువ. ఒక వీడియో సుమారు 380 ప్రదర్శనలకు సమానమని స్కిల్డ్ అంచనా వేస్తుంది, ఆ సంఖ్యను ఇంటర్పోలేట్ చేసినదిగా పిలుస్తుంది. పోస్ట్ ముందస్తు యాక్సెస్ సైన్-అప్ను ఇస్తుంది, డౌన్లోడ్ను కాదు.
S1ను ఇంకా హ్యూమనాయిడ్లకు విస్తరించలేదని, అది ఇళ్లకు సిద్ధంగా లేదని CEO దీపక్ పాఠక్ చెప్పినట్లు ది రోబో రిపోర్ట్ ఉటంకిస్తుంది. ఏ రోబోలపై నడిపారో పోస్ట్ చెప్పదు.
NVIDIA, షియోమీ, యూనిట్రీ నుండి ఓపెన్ వెయిట్స్
NVIDIA GR00T N1.7కు సుమారు 3 బిలియన్ పారామీటర్లు ఉన్నాయి. మార్చి 16 నాటి ప్రెస్ రిలీజ్ దాన్ని వాణిజ్య లైసెన్సింగ్తో ముందస్తు యాక్సెస్లో అందుబాటులో ఉందని చెప్పింది. జూలై 7 సాంకేతిక పోస్ట్, నిజమైన, మొదటి-వ్యక్తి మానవ డేటా సుమారు 32,000 గంటలు, సిమ్యులేషన్ 8,000 గంటలతో ప్రీట్రైనింగ్ తర్వాత, అది అపాచీ 2.0 కింద విడుదలైందని, వెయిట్స్ హగ్గింగ్ ఫేస్లో, శిక్షణ కోడ్ గిట్హబ్లో ఉన్నాయని చెబుతోంది. N1.6పై దాని లాభాలు సాపేక్షంగా మాత్రమే ఇవ్వబడ్డాయి: ఒక DROID పరీక్షలో 61% పెరుగుదల, SimplerEnv Bridgeలో 5%. అదే మోడల్ హగ్గింగ్ ఫేస్ మోడల్ కార్డ్ NVIDIA ఓపెన్ మోడల్ లైసెన్స్ను పేర్కొంటుంది, కాబట్టి లైసెన్స్ విషయంలో రెండు NVIDIA పేజీలు ఏకీభవించవు.
NVIDIA మార్చి విడుదల DreamZero పరిశోధన ఆధారంగా ఉన్న GR00T N2ను కూడా ముందుగా చూపింది. DreamZeroను ఒక వరల్డ్-యాక్షన్ మోడల్గా, అంటే అంచనా వీడియోను, చర్యలను కలిసి సృష్టించే ఒకే నెట్వర్క్గా NVIDIA ఇంజనీర్లు వర్ణిస్తారు. కొత్త వాతావరణాల్లో కొత్త పనుల్లో అగ్రశ్రేణి VLAల కంటే రెట్టింపుకు మించి తరచుగా అది విజయం సాధిస్తుందని, MolmoSpaces, RoboArena లీడర్బోర్డులలో మొదటి స్థానంలో ఉందని NVIDIA చెబుతోంది. ఆ వాదన వెనుక ఉన్న డేటాను విడుదల ప్రకటన ఇవ్వలేదు; N2ను 2026 చివరికి అందుబాటులోకి తేవాలనుకుంటున్నారు.
షియోమీ XR-1 తన వెయిట్స్తో పాటు పరీక్షలను ప్రచురిస్తుంది. అపాచీ 2.0 కింద ఉన్న దాని README, రోబో శరీరం లేకుండా రికార్డు చేసిన 100,000 గంటలకు పైగా ప్రదర్శన డేటాపై ప్రీట్రైనింగ్ను, తర్వాత రోబో రకాల్లో 10,000 గంటలకు పైగా పోస్ట్-ట్రైనింగ్ను వర్ణిస్తుంది. చెక్పాయింట్లు, పోస్ట్-ట్రైనింగ్ కోడ్, మూల్యాంకన కోడ్ పబ్లిక్గా ఉన్నాయి, సాంకేతిక నివేదిక జూలై 16న arXivకి వచ్చింది. RoboCasa365 సిమ్యులేషన్ బెంచ్మార్క్లో రెండో ఉత్తమ మోడల్కు 46.6% ఉండగా షియోమీ 57.4% నివేదిస్తోంది. ఒక్కో పనికి 10 గంటల కంటే తక్కువ డేటాతో నాలుగు నిజ-రోబో పనుల్లో, pi0.5కు 40% ఉండగా మొత్తం 75%, 40 గంటల కంటే తక్కువతో 53%కు బదులు 85% నివేదిస్తోంది. 40-గంటల సెట్టింగ్లో బట్టలు యంత్రంలో వేయడం 50%కు బదులు 100% చేరింది. నిజ-రోబో పోలిక షియోమీ సొంతం, జూలై 15 నాటికి XR-1 RoboCasa365, RoboDojo లీడర్బోర్డులలో మొదటి స్థానంలో ఉందని README చెబుతోంది.
యూనిట్రీ సెప్టెంబర్ 10న UnifoLM-WLA-1.0ను ఓపెన్-సోర్స్ చేస్తున్నట్లు ప్రకటించింది, అది టేబుల్టాప్ పనిని, పూర్తి శరీర పనిని రెండింటినీ నడిపిస్తుందని చెబుతోంది. దాని హగ్గింగ్ ఫేస్ పేజీ అపాచీ 2.0 కింద ఒక బేస్ చెక్పాయింట్ను జాబితా చేస్తుంది, కానీ tuput చదివినప్పుడు మోడల్ కార్డ్ ఖాళీగా ఉంది, కాబట్టి పని సంఖ్యలు అందుబాటులో లేవు. యూనిట్రీ హ్యూమనాయిడ్ హార్డ్వేర్ను, అది రోబో వాక్యూమ్లతో పంచుకునేదాన్ని ఆ రెండింటి పోలికలో చూడవచ్చు.
ఫిగర్, అగిబాట్
ఫిగర్ హెలిక్స్ 02, 2026 జనవరి 27న పరిచయం చేయబడింది, ఫిగర్ ప్రకారం రీసెట్లు లేకుండా 61 చర్యలతో నాలుగు నిమిషాల డిష్వాషర్ పనిని నడుపుతుంది. దాని బ్యాలెన్స్ పొర 1,000 గంటలకు పైగా మానవ కదలిక డేటాపై శిక్షణ పొందిన 10-మిలియన్-పారామీటర్ల నెట్వర్క్. పేజీ విజయ రేట్లు ఇవ్వదు, వేళ్ల స్థాయి పనులను మూడు గ్రాముల వంటి చిన్న బలాలను కూడా గుర్తించే వేలికొన సెన్సర్లున్న ఫిగర్ 03 హార్డ్వేర్కు ముడిపెడుతుంది. ఫలితాలు ప్రారంభ దశవని ఫిగర్ అంటుంది. ఇలాంటి హ్యూమనాయిడ్లు చెల్లింపు పైలట్లలో ఏం చేశాయో హ్యూమనాయిడ్లు పనిలో చేరడం గురించిన మా నివేదికలో ఉంది.
ఏప్రిల్ 9న ప్రకటించిన అగిబాట్ GO-2కు, LIBERO సిమ్యులేషన్ సూట్లో 98.5%, LIBERO-Plusలో 86.6%, సిమ్యులేషన్-మాత్రమే శిక్షణ తర్వాత నిజ-ప్రపంచ బదిలీలో 82.9% ఉన్నాయని ది రోబో రిపోర్ట్ చెబుతోంది. ఆ మూడూ అగిబాట్ సంఖ్యలే, GO-2 వెయిట్స్ పబ్లిక్గా ఉన్నాయో లేదో వ్యాసం చెప్పదు.
శాతాలను ఎందుకు పక్కపక్కన పెట్టలేం
LIBERO మీద 98.5% అంటే స్థిరమైన సిమ్యులేషన్ సూట్పై స్కోర్. డస్ట్పాన్ మీద 32% అంటే 22-కీళ్ల చేతులున్న నిజమైన హ్యూమనాయిడ్. స్కిల్డ్ 66% సుదీర్ఘ పనులపై ఒక్కో-దశ విజయం సగటు. వీటిలో ఏ రెండింటికీ ఒకే పని, ఒకే రోబో, ఒకే స్కోరింగ్ నియమం లేవు, తమను తాము పోల్చుకునే ల్యాబ్లు ప్రత్యర్థిగా pi0.5ను లేదా తమ సొంత మోడళ్ల పాత వెర్షన్లను పేర్కొంటాయి.
GR00T N2 2026 చివరికి అందుబాటులోకి వస్తుందని NVIDIA మార్చి విడుదల చెబుతోంది.
మూలాలు మరియు మరింత చదవడానికి
- Google DeepMind: Gemini Robotics 2 brings whole body intelligence to robots (30 July 2026)
- Google DeepMind: Gemini Robotics 2 overview and trusted tester programme
- Google DeepMind: Gemini Robotics On-Device 2 model card
- Google: Introducing Gemini Robotics ER 2 (30 July 2026)
- Physical Intelligence: pi 0.7, a Steerable Generalist Robotic Foundation Model with Emergent Capabilities (arXiv 2604.15483, 16 April 2026)
- The Decoder: Physical Intelligence shows robot model with LLM-like generalization, flaws included
- Physical Intelligence: openpi repository (GitHub)
- Skild AI: Introducing S1, In-Context Learning for Robotics (August 2026)
- The Robot Report: Skild AI unveils S1 flagship robot foundation model (31 August 2026)
- NVIDIA: NVIDIA and Global Robotics Leaders Take Physical AI to the Real World (16 March 2026)
- NVIDIA Technical Blog: Develop Humanoid Robot Policies End-to-End with NVIDIA Isaac GR00T (7 July 2026)
- NVIDIA Technical Blog: Pretrained to Imagine, Fine-Tuned to Act, the Rise of World-Action Models (15 June 2026)
- Hugging Face: NVIDIA GR00T-N1.7-3B model card
- GitHub: Xiaomi-Robotics-1 (XR-1) README
- Hugging Face: Unitree Robotics models, UnifoLM-WLA-1.0-Base
- PANews: Unitree Robotics open-sources UnifoLM-WLA-1.0 embodied foundation model
- Figure: Introducing Helix 02, Full-Body Autonomy (27 January 2026)
- The Robot Report: AGIBOT releases GO-2 foundation model for embodied AI (9 April 2026)
ఈ వ్యాసం AI సాధనాల సహాయంతో పరిశోధించి రాయబడింది మరియు కచ్చితత్వం కోసం సవరించబడింది. ఇది సాధారణ సమాచారం మరియు చర్చ కోసం మాత్రమే, వృత్తిపరమైన సలహా కాదు. మా సంపాదకీయ ప్రమాణాలు మరియు నిరాకరణ చూడండి. తప్పు కనిపించిందా? మాకు తెలియజేయండి.
నచ్చిందా? తదుపరిది పొందండి.
ఒకసారి ఒక మంచి వ్యాసం, నేరుగా మీ ఇన్బాక్స్కు. స్పామ్ లేదు, ఎప్పుడైనా ఆపవచ్చు.