Skip to content
చైనా ఉత్తమ ఓపెన్ ఏఐ మోడల్‌కు స్వతంత్ర సూచీలో 46, అగ్రశ్రేణి అమెరికన్ మోడల్‌కు 58. ఆ అంతరాన్ని నాలుగు వనరులు 2 నుండి 8 నెలల మధ్య చూపుతున్నాయి
కృత్రిమ మేధస్సు

చైనా ఉత్తమ ఓపెన్ ఏఐ మోడల్‌కు స్వతంత్ర సూచీలో 46, అగ్రశ్రేణి అమెరికన్ మోడల్‌కు 58. ఆ అంతరాన్ని నాలుగు వనరులు 2 నుండి 8 నెలల మధ్య చూపుతున్నాయి

చిత్రణ: tuput

తెలుగు

ఆర్టిఫిషియల్ అనాలిసిస్ సూచీలో ఓపెన్-వెయిట్ మోడళ్లలో షావోమీ MiMo-V2.6-Pro 46తో ముందుంది, Z.ai GLM-5.3, మూన్‌షాట్ Kimi K3 దాని వెనుక ఉన్నాయి. ఆంత్రోపిక్ Claude Opus 5.5కు 58 వచ్చింది. తాము అమెరికా అగ్రశ్రేణికి 3 నుండి 6 నెలలు వెనుక ఉన్నామని డీప్‌సీక్ సొంత నివేదిక చెబుతోంది, అమెరికా ప్రభుత్వ పరీక్షా కేంద్రం సుమారు 8 అంటోంది.

· · 6 నిమిషాల పఠనం

2026 అక్టోబరు 8న ఆర్టిఫిషియల్ అనాలిసిస్ ఇంటెలిజెన్స్ ఇండెక్స్‌లో అత్యున్నత స్థానంలో ఉన్న చైనా మోడల్ షావోమీ MiMo-V2.6-Pro. దానికి 46 స్కోర్ వచ్చింది, మొత్తం మీద 18వ స్థానంలో ఉంది. అదే పట్టికలో ఆంత్రోపిక్ Claude Opus 5.5 58తో ముందుంది, ఓపెన్‌ఏఐ GPT-6 Astra, గూగుల్ Gemini 4 Argon 53 సాధించాయి. కోడింగ్, ఏజెంట్లు, నాలెడ్జ్ వర్క్, సైన్స్‌లకు సంబంధించిన పది మూల్యాంకనాలను ఈ సూచీ ఒకే స్కోరుగా కలుపుతుందని ట్రెండింగ్ టాపిక్స్ చెబుతోంది.

ఆ దూరాన్ని నెలల్లోకి మార్చేందుకు నాలుగు వనరులు ప్రయత్నించాయి, వాటి సమాధానాలు 2 నుండి 8 వరకు ఉన్నాయి. అవి వేర్వేరు పరీక్షలను, కొలమానంగా వేర్వేరు అమెరికన్ మోడళ్లను వాడతాయి, అవి విభేదించడానికి ఎక్కువ కారణం అదే.

తాజా విడుదలలు, ల్యాబ్‌ల సొంత సంఖ్యల్లో

ఇవన్నీ మిక్స్చర్-ఆఫ్-ఎక్స్‌పర్ట్స్ మోడళ్లు. ప్రతి టోకెన్‌ను నిపుణ ఉప-నెట్‌వర్క్‌ల చిన్న సమూహానికి పంపుతారు, అందువల్ల టోకెన్‌కు నిజంగా వాడే సంఖ్యలైన “యాక్టివ్” పారామీటర్ల లెక్క మొత్తం కంటే చాలా తక్కువ. టోకెన్ అంటే ఒక పదం లేదా పద భాగం.

మోడల్మొత్తం / యాక్టివ్ పారామీటర్లుకాంటెక్స్ట్ విండోలైసెన్స్
DeepSeek V4-Pro1.6 ట్రిలియన్ / 49 బిలియన్1 మిలియన్ టోకెన్లుMIT
DeepSeek V4.1 Flash552 బిలియన్ / 16 బిలియన్1 మిలియన్ టోకెన్లుMIT
Moonshot Kimi K32.8 ట్రిలియన్ / 104 బిలియన్1 మిలియన్ టోకెన్లుKimi K3 License
Alibaba Qwen3.8-2.4T-A95B2.4 ట్రిలియన్ / 95 బిలియన్262,144 టోకెన్లు, 1,010,000 వరకు పొడిగించవచ్చుQwen3.8-Max License
Z.ai GLM-5.3753 బిలియన్ / 40 బిలియన్1 మిలియన్ టోకెన్లుGLM-5.3 License
Xiaomi MiMo-V2.6-Pro1.0 ట్రిలియన్ / 42 బిలియన్1 మిలియన్ టోకెన్లుMIT

2026 ఏప్రిల్ 26న arXivకు సమర్పించిన డీప్‌సీక్ V4 సాంకేతిక నివేదిక ఒక ప్రివ్యూను వివరిస్తుంది. V4-Proను 33 ట్రిలియన్ టోకెన్లపై, చిన్న V4-Flashను 32 ట్రిలియన్లపై ముందస్తుగా శిక్షణ ఇచ్చారని అది చెబుతోంది. ఒక మిలియన్ టోకెన్ కాంటెక్స్ట్ వద్ద, డీప్‌సీక్ ముందటి V3.2తో పోలిస్తే V4-Proకు టోకెన్‌కు కావలసిన గణన 27 శాతం, మెమరీ కాష్ 10 శాతం అని నివేదిక చెబుతోంది. V4.1 Flash, MiMo వరుసలు ఆర్టిఫిషియల్ అనాలిసిస్ పట్టిక నుండి, ఎరీనా లైసెన్స్ లేబుళ్ల నుండి తీసుకున్నవి.

Kimi K3 మోడల్ కార్డ్ 896 లో 16 ఎక్స్‌పర్ట్స్ అమరికను ఇస్తుంది, కానీ శిక్షణ టోకెన్ల సంఖ్యను గానీ శిక్షణ హార్డ్‌వేర్‌ను గానీ ఇవ్వదు. Qwen ఓపెన్ చెక్‌పాయింట్ టెక్స్ట్ మాత్రమే తీసుకుంటుంది, థింకింగ్ మోడ్‌ను ఆపలేమని దాని కార్డ్ చెబుతోంది. హోస్ట్ చేసిన Qwen3.8-Max ఇమేజ్ ఇన్‌పుట్‌ను, ఒక మిలియన్ టోకెన్ల డిఫాల్ట్‌ను జతచేస్తుంది. GLM-5.3, GLM-5.2 బేస్ మోడల్‌నే మళ్లీ వాడుతుంది, లాభాలు పోస్ట్-ట్రైనింగ్ నుండి వచ్చాయని Z.ai కార్డ్ చెబుతోంది. పోస్ట్-ట్రైనింగ్ అంటే పూర్తయిన మోడల్‌ను ఫీడ్‌బ్యాక్‌తో సర్దుబాటు చేసే దశ.

ఈ కార్డులపై ఉన్న బెంచ్‌మార్క్ సంఖ్యలు ల్యాబ్‌ల సొంతవి. కోడింగ్ పరీక్ష SWE-bench Verifiedలో V4-Pro-Maxకు 80.6 అని డీప్‌సీక్ కార్డ్ ఇస్తుంది. అదే పరీక్షలో NIST CAISI 74 కొలిచింది, తేడాకు సిస్టమ్ ప్రాంప్ట్‌లు, స్కాఫోల్డింగ్, టోకెన్ బడ్జెట్‌లు కారణమని అది చెబుతోంది.

బయటి పరీక్షకులు కొలిచినది

ఆర్టిఫిషియల్ అనాలిసిస్ తన సూచీ వెర్షన్ 4.3.2లో ఈ ఓపెన్-వెయిట్ స్కోర్లను ఇస్తుంది: MiMo-V2.6-Pro 46, GLM-5.3 45, Kimi K3 44, GLM-5.3-Flash 42, DeepSeek V4.1 Flash 39, Qwen3.8 27B (27 బిలియన్ పారామీటర్ల మోడల్) 34, MiniMax-M3 29. పూర్తి Qwen3.8 2.4Tకు 39.9 అని ట్రెండింగ్ టాపిక్స్ నివేదిస్తోంది. ఆర్టిఫిషియల్ అనాలిసిస్ పట్టికలో ఉన్న ఉత్తమ అమెరికన్ ఓపెన్ మోడళ్లు థింకింగ్ మెషీన్స్ Inkling (25), ఎన్విడియా Nemotron 3 Ultra (23).

ఫ్రాన్స్‌కు చెందిన Mistral Large 4 ప్రివ్యూకు 38.4 వచ్చింది, ఓపెన్ మోడళ్లలో అది ఎనిమిదో స్థానంలో ఉండేది, దీన్ని tuput Mistral Large 4 వ్యాసంలో నివేదించింది. ఖర్చుల్లో తేడా పెద్దది. MiMo-V2.6-Pro సూచీ టాస్క్‌కు $0.13, GLM-5.3, Kimi K3, Qwen3.8 ఒక్కొక్కటి సుమారు $2 అని ట్రెండింగ్ టాపిక్స్ ఇస్తుంది.

ఎరీనా టెక్స్ట్ లీడర్‌బోర్డ్‌లో Kimi K3 (max) 1488తో 16వ స్థానంలో ఉంది. గూగుల్ Gemini 4 Argonకు 1525 (ఎరీనా దాన్ని తాత్కాలికమని గుర్తించింది), Claude Opus 5.5కు 1507. MiMo-V2.6-Pro 26వ, GLM-5.3 27వ, DeepSeek V4.1 Flash 39వ స్థానాల్లో ఉన్నాయి. IndiaAI మిషన్ కింద నిధులు పొందిన భారతీయ మోడళ్లలో ఏదీ tuput చదివిన ఆర్టిఫిషియల్ అనాలిసిస్ ఓపెన్-వెయిట్ పట్టికలో కనిపించదు. ఆ కార్యక్రమ బడ్జెట్, GPUలు, నిధులు పొందిన నిర్మాతల వివరాలు IndiaAI మిషన్ వ్యాసంలో ఉన్నాయి.

ఓపెన్ వెయిట్స్, లైసెన్సులు కోరేవి

“ఓపెన్-వెయిట్” అంటే శిక్షణ పొందిన సంఖ్యలను ఎవరైనా డౌన్‌లోడ్ చేసుకోవచ్చు, వాడకం నిబంధనలు ల్యాబ్‌ను బట్టి మారతాయి. డీప్‌సీక్, షావోమీ MIT లైసెన్స్ వాడతాయి, దానికి దాదాపు షరతులే లేవు. GLM-5.3, Kimi K3, పెద్ద Qwen3.8లను వాణిజ్య వాడకానికి పరిమితమైనవిగా ఆర్టిఫిషియల్ అనాలిసిస్ వర్గీకరిస్తుందని ట్రెండింగ్ టాపిక్స్ నివేదిస్తోంది, అయితే tuput చదివిన లైసెన్స్ పాఠాలు అంతకంటే ఇరుకైన పరిమితులను పెడతాయి.

హోస్టెడ్-మోడల్ వ్యాపారం నడిపే, ఏ 12 నెలల్లోనైనా $20 మిలియన్లకు మించి ఆదాయం ఉన్న కంపెనీ మూన్‌షాట్‌తో వేరే ఒప్పందంపై సంతకం చేయాలని Kimi K3 లైసెన్స్ కోరుతుంది. నెలకు 100 మిలియన్లకు పైగా వినియోగదారులున్న లేదా నెలకు $20 మిలియన్ల ఆదాయం ఉన్న ఉత్పత్తి తన ఇంటర్‌ఫేస్‌పై “Kimi K3” అని చూపాలి. అంతర్గత వాడకానికి మినహాయింపు ఉంది.

Qwen3.8-Max లైసెన్స్‌లోనూ అదే ప్రదర్శన నియమం ఉంది, హోస్టెడ్-మోడల్ లేదా ఏఐ వర్క్ అసిస్టెంట్ వ్యాపారాలకు వేరే లైసెన్స్ అవసరమయ్యే పరిమితి 12 నెలల్లో $50 మిలియన్లు. Z.ai GLM-5.3 లైసెన్స్ వాణిజ్య వాడకాన్ని అనుమతిస్తుంది; మొత్తం ఆదాయం $10 బిలియన్లు దాటిన హోస్టెడ్-మోడల్ వ్యాపారాలకు మాత్రమే Z.ai భద్రతా సమీక్ష ఉంటుంది.

శిక్షణ ఖర్చు వాదనలు, అవి వదిలేసేవి

ఎక్కువగా ఉదహరించే సంఖ్య డీప్‌సీక్-V3కి $5.576 మిలియన్లు. ఒక గంటకు $2 అద్దె అనుకుని 2.788 మిలియన్ H800 GPU గంటల నుండి V3 పత్రం ఆ సంఖ్యకు వస్తుంది. ఆ మొత్తం అధికారిక శిక్షణ రన్‌ను మాత్రమే కలిగి ఉందని, అంతకుముందటి పరిశోధనను, నిర్మాణం, అల్గారిథమ్‌లు, డేటాను ఎంచుకోవడానికి చేసే చిన్న పరీక్షలైన అబ్లేషన్ ప్రయోగాలను మినహాయించిందని పత్రం స్పష్టంగా చెబుతోంది.

V4 నివేదిక టోకెన్ల సంఖ్యలను చెబుతుంది కానీ, tuput వెతికిన పాఠంలో, డాలర్ ఖర్చును గానీ మొత్తం GPU గంటలను గానీ చెప్పదు. Kimi K3 మోడల్ కార్డ్ టోకెన్ల సంఖ్యను గానీ ఖర్చును గానీ చెప్పదు.

ల్యాబ్‌లు తాము వాడుతున్నామని చెప్పే చిప్‌లు

తన ఫ్యూజ్డ్ ఎక్స్‌పర్ట్-కమ్యూనికేషన్ కెర్నల్‌ను ఎన్విడియా GPUల మీద, హువావే Ascend NPUల మీద రెండింటిపైనా ధ్రువీకరించామని, సాధారణ ఇన్ఫరెన్స్‌లో 1.50 నుండి 1.73 రెట్లు, రీఇన్‌ఫోర్స్‌మెంట్-లెర్నింగ్ రోలౌట్‌ల వంటి ఆలస్యానికి సున్నితమైన పనిలో 1.96 రెట్ల వరకు వేగం పెరిగిందని డీప్‌సీక్ నివేదిక చెబుతోంది. మోడల్‌ను ఏ చిప్‌లతో శిక్షణ ఇచ్చారో అది చెప్పదు.

V4 “ఇప్పటికీ ఎన్విడియా చిప్‌లపైనే శిక్షణ పొందింది” అని ఏప్రిల్ 27న ChinaTalk యొక్క ఐరీన్ జాంగ్, అకీబ్ జకారియా, జోర్డాన్ ష్నైడర్ రాశారు; అది వారు సాక్ష్యాన్ని చదివిన తీరు, డీప్‌సీక్ ప్రకటన కాదు. అదే వ్యాసం డీప్‌సీక్ ప్రారంభ ప్రకటనలోని ఒక ఫుట్‌నోట్‌ను ఉదహరిస్తుంది: “అత్యున్నత స్థాయి కంప్యూట్‌పై పరిమితుల వల్ల, V4-Pro సర్వీస్ త్రూపుట్ ప్రస్తుతం పరిమితంగా ఉంది.” హువావే Ascend 950 సూపర్‌నోడ్‌లు 2026 ద్వితీయార్ధంలో భారీగా అందుబాటులోకి వచ్చాక Pro ధర తగ్గుతుందని డీప్‌సీక్ ఆశిస్తోందని కూడా అది జతచేస్తుంది.

GLM-5.3 కార్డ్ vLLM-Ascend, xLLM, SGLang ద్వారా Ascendపై డిప్లాయ్‌మెంట్‌కు మద్దతు ఉందని చెబుతుంది, శిక్షణ హార్డ్‌వేర్‌ను ఇవ్వదు. తన మూల్యాంకనాల్లో కొన్ని ఎన్విడియా H20 GPUలపై నడిచాయని Kimi K3 కార్డ్ చెబుతోంది.

అమెరికా వైపు, ఫైనాన్షియల్ టైమ్స్‌ను ఉటంకిస్తూ, బైట్‌డాన్స్, టెన్సెంట్ చెరో సుమారు 10,000 ఎన్విడియా H200 చిప్‌లను అందుకున్నాయని ఆగస్టు 19న ది నెక్స్ట్ వెబ్ నివేదించింది. వాటిని ప్రధాన భూభాగం బయట ఉంచాలని బీజింగ్ కంపెనీలకు చెప్పింది, సరుకు హాంకాంగ్ మీదుగా వెళ్తుంది. జూలైలో కామర్స్ అండర్ సెక్రటరీ జెఫ్రీ కెస్లర్ “చాలా తక్కువ” వచ్చాయని కాంగ్రెస్‌కు చెప్పారని నెక్స్ట్ వెబ్ అంటుంది. నిషేధిత సర్వర్ల మళ్లింపు, చైనాకు పంపిన సర్వర్లపై అమెరికా న్యాయ శాఖ నేరారోపణ గురించిన tuput నివేదిక ఈ వ్యాసంలో ఉంది.

అంతరం గురించి నాలుగు అంచనాలు

V4-Pro-Max ప్రామాణిక రీజనింగ్ పరీక్షల్లో GPT-5.2ను, Gemini-3.0-Proను అధిగమిస్తుందని, కానీ GPT-5.4, Gemini-3.1-Proల కంటే స్వల్పంగా తక్కువని డీప్‌సీక్ నివేదిక చెబుతోంది. దాన్ని అగ్రశ్రేణి కంటే సుమారు 3 నుండి 6 నెలల వెనుకబాటుగా అది చదువుతుంది.

NIST కు చెందిన సెంటర్ ఫర్ ఏఐ స్టాండర్డ్స్ అండ్ ఇన్నోవేషన్ ఏప్రిల్‌లో V4 Proను పరీక్షించి, దాని సామర్థ్యాలు అగ్రశ్రేణి కంటే సుమారు 8 నెలలు వెనుకబడి ఉన్నాయని మే 1న ప్రచురించింది. ప్రజలకు ఇవ్వకుండా ఉంచిన రెండింటితో సహా CAISI తొమ్మిది బెంచ్‌మార్క్‌లపై, V4 Pro సుమారు 8 నెలల ముందు విడుదలైన GPT-5కు సమానంగా పనిచేసింది. ARC-AGI-2 సెమీ-ప్రైవేట్ సెట్‌లో GPT-5.5కు 79 శాతం ఉండగా దానికి 46 శాతం వచ్చింది. తన వెనుకబాటు సంఖ్య సామర్థ్యాన్ని అంచనా వేసే గణాంక నమూనా నుండి వచ్చిందని, ప్రత్యక్ష కొలత కాదని CAISI చెబుతోంది.

కాంగ్రెస్ బ్రీఫింగ్ కోసం సిద్ధం చేసిన వాంగ్మూలం నుండి విస్తరించిన వ్యాసంలో, చైనా ఓపెన్-వెయిట్ మోడళ్లు క్లోజ్డ్ అమెరికన్ అగ్రశ్రేణి కంటే సుమారు 2 నుండి 5 నెలలు వెనుక ఉన్నాయని నేథన్ లాంబర్ట్ సెప్టెంబరు 21న రాశారు. అమెరికన్ ఓపెన్ మోడళ్లు ఓపెన్‌ఏఐ, ఆంత్రోపిక్ కంటే 6 నుండి 9 నెలలు వెనుక ఉన్నాయని ఆయన అంటారు. డిస్టిలేషన్, అంటే ఒక మోడల్‌ను మరో మోడల్ అవుట్‌పుట్‌లపై శిక్షణ ఇవ్వడం, చైనా అంతరాన్ని 1 నుండి 2 నెలలు తగ్గిస్తుందని ఆయన అంచనా.

2026 జనవరి నుండి అత్యంత సమర్థమైన ఓపెన్-వెయిట్ మోడళ్లు ఎపోక్ కేపబిలిటీస్ ఇండెక్స్‌లో క్లోజ్డ్ అగ్రశ్రేణి కంటే సగటున నాలుగు నెలలు, కఠినమైన పరీక్షలో ఆరు నెలలు వెనుకబడ్డాయని, అంటే సగటున 8 సూచీ పాయింట్ల అంతరమని ఎపోక్ ఏఐ యొక్క జాక్ ఎడ్వర్డ్స్, ల్యూక్ ఎంబర్సన్ మే 29న నివేదించారు. అది చైనా మోడళ్లనే కాక సాధారణంగా ఓపెన్ మోడళ్లను కవర్ చేస్తుంది. ప్రైవేట్ బెంచ్‌మార్క్‌లలో ఓపెన్ మోడళ్లకు స్కోర్లు తక్కువ వస్తాయని, తమ అంచనా నిజమైన అంతరాన్ని తక్కువగా చూపవచ్చని ఎపోక్ జతచేస్తుంది.

Share
Copied!

మూలాలు మరియు మరింత చదవడానికి

  1. arXiv: DeepSeek-V4, Towards Highly Efficient Million-Token Context Intelligence (technical report, submitted 26 April 2026)
  2. Hugging Face: DeepSeek-V4-Pro model card
  3. arXiv: DeepSeek-V3 Technical Report
  4. Hugging Face: Kimi K3 model card (Moonshot AI)
  5. Hugging Face: Kimi K3 licence text
  6. Hugging Face: Qwen3.8-2.4T-A95B model card (Alibaba)
  7. Hugging Face: Qwen3.8-Max licence text
  8. Hugging Face: GLM-5.3 model card (Z.ai)
  9. Hugging Face: GLM-5.3 licence text
  10. Artificial Analysis: top open-weights models
  11. Artificial Analysis: leaderboard of all models by Intelligence Index
  12. Trending Topics: Mistral Large 4 on Artificial Analysis, Eighth Among Open Models (6 October 2026)
  13. Arena: text leaderboard
  14. NIST CAISI: Evaluation of DeepSeek V4 Pro (1 May 2026)
  15. Epoch AI: Open models lag state-of-the-art closed models by 4 months (29 May 2026)
  16. Interconnects: The current balance of power in open models (Nathan Lambert, 21 September 2026)
  17. ChinaTalk: DeepSeek V4 (27 April 2026)
  18. The Next Web: Nvidia's H200 finally reaches Chinese buyers (19 August 2026)

ఈ వ్యాసం AI సాధనాల సహాయంతో పరిశోధించి రాయబడింది మరియు కచ్చితత్వం కోసం సవరించబడింది. ఇది సాధారణ సమాచారం మరియు చర్చ కోసం మాత్రమే, వృత్తిపరమైన సలహా కాదు. మా సంపాదకీయ ప్రమాణాలు మరియు నిరాకరణ చూడండి. తప్పు కనిపించిందా? మాకు తెలియజేయండి.

#chinese ai#deepseek v4#kimi k3#qwen3.8#glm-5.3#open-weight models#artificial analysis#export controls

నచ్చిందా? తదుపరిది పొందండి.

ఒకసారి ఒక మంచి వ్యాసం, నేరుగా మీ ఇన్‌బాక్స్‌కు. స్పామ్ లేదు, ఎప్పుడైనా ఆపవచ్చు.

ఇదే విభాగంలో మరిన్ని: కృత్రిమ మేధస్సు
మిస్ట్రల్ 1 ట్రిలియన్ పారామీటర్ల లే చాంక్ స్వతంత్ర AI సూచికలో 38 స్కోరు సాధించింది, ఓపెన్ మోడల్స్‌లో ఎనిమిదో స్థానం, దాని వెయిట్స్ ఇంకా విడుదల కాకముందే
ఫ్రాన్స్‌కు చెందిన మిస్ట్రల్ ఒక ట్రిలియన్ పారామీటర్ల మోడల్‌ను ఆన్‌లైన్‌లో పెట్టింది, డౌన్‌లోడ్ చేయగల వెయిట్స్ ఈ నెలలోనే వస్తాయని చెప్తోంది. బయటి పరీక్షకులు దాన్ని చైనా వెలుపలి ఉత్తమ ఓపెన్ మోడల్‌గా, ఓపెన్ మోడల్స్‌లో ఎనిమిదోదిగా ర్యాంకు ఇచ్చారు, దాని పరిమాణంపై మిస్ట్రల్ సొంత సంఖ్యలు అన్నీ ఒకదానితో ఒకటి కుదరవు.
ఒక కాలిఫోర్నియా వ్యాపారవేత్త 300 మిలియన్ డాలర్లకు పైగా విలువైన AI సర్వర్లను మలేషియా, సింగపూర్ మీదుగా చైనాకు పంపాడని అమెరికా ప్రాసిక్యూటర్లు అంటున్నారు, ఈ ఆరోపణ ఇంకా కోర్టులో పరీక్షకు నిలవలేదు
సిటీ ఆఫ్ ఇండస్ట్రీలోని ఒక కంప్యూటర్ కంపెనీ యజమానిపై, నియంత్రిత చిప్‌లతో నిండిన సర్వర్లను చైనా కొనుగోలుదారులకు పంపాడని ఆరోపణ. ఈ అభియోగం వెనుక ఉన్న ఈమెయిళ్లు, డబ్బు, నియమాలు బహిరంగంగా ఉన్నాయి, విస్తృత అంచనాల్లోని అంతరాలు కూడా అంతే.
స్కేల్ SWE-Bench Pro బోర్డు ఉత్తమ కోడింగ్ ఏజెంట్‌ను 61.5% వద్ద ఉంచింది, పరీక్షలు పాస్ అయ్యే చాలా ఫిక్స్‌లను మెయింటెయినర్లు తిరస్కరిస్తున్నారు, ఏజెంట్లు ఎంత సమయం ఆదా చేస్తాయో తన తాజా ట్రయల్ చూపలేదని METR అంటోంది
ఏజెంట్లు బలంగా ఉన్నాయని బెంచ్‌మార్క్‌లు చెబుతాయి. చిత్రం అంత విశాలంగా లేదని మెయింటెయినర్లు, ఒక యాదృచ్ఛిక ట్రయల్, ఘటన నివేదికల రాశి చెబుతాయి. ప్రతి సంఖ్య నిజంగా ఏం కొలుస్తుందో ఇక్కడ ఉంది.
← అన్ని వ్యాసాలు