Skip to content
चीनचे सर्वोत्तम ओपन एआय मॉडेल स्वतंत्र निर्देशांकावर ४६ गुण मिळवते, तर अमेरिकेचे अव्वल मॉडेल ५८, आणि चार स्रोत हे अंतर २ ते ८ महिने सांगतात
कृत्रिम बुद्धिमत्ता

चीनचे सर्वोत्तम ओपन एआय मॉडेल स्वतंत्र निर्देशांकावर ४६ गुण मिळवते, तर अमेरिकेचे अव्वल मॉडेल ५८, आणि चार स्रोत हे अंतर २ ते ८ महिने सांगतात

चित्रण: tuput

मराठी

शाओमीचे MiMo-V2.6-Pro आर्टिफिशियल अनॅलिसिसच्या निर्देशांकावर ४६ गुणांसह ओपन-वेट मॉडेलमध्ये आघाडीवर आहे, Z.ai चे GLM-5.3 आणि मूनशॉटचे Kimi K3 त्यामागे. अँथ्रॉपिकचे Claude Opus 5.5 ५८ गुण मिळवते. DeepSeek चा स्वतःचा अहवाल म्हणतो की ते अमेरिकी आघाडीच्या ३ ते ६ महिने मागे आहे, आणि अमेरिकी सरकारचे चाचणी केंद्र सुमारे ८ महिने म्हणते.

· · 7 मिनिटांचे वाचन

८ ऑक्टोबर २०२६ रोजी आर्टिफिशियल अनॅलिसिसच्या इंटेलिजन्स इंडेक्सवर सर्वात वरचे चिनी मॉडेल शाओमीचे MiMo-V2.6-Pro आहे, ज्याचे गुण ४६ आहेत आणि एकूण क्रमवारीत त्याचा १८ वा क्रमांक आहे. त्याच तक्त्यात अँथ्रॉपिकचे Claude Opus 5.5 ५८ गुणांसह पहिले आहे, आणि ओपनएआयचे GPT-6 Astra व गुगलचे Gemini 4 Argon यांचे गुण ५३ आहेत. ट्रेंडिंग टॉपिक्सच्या म्हणण्यानुसार हा निर्देशांक कोडिंग, एजंट, ज्ञानकाम आणि विज्ञान यांच्या दहा मूल्यमापनांना एका गुणात एकत्र करतो.

चार स्रोतांनी हे अंतर महिन्यांत मांडण्याचा प्रयत्न केला आहे, आणि त्यांची उत्तरे २ ते ८ दरम्यान आहेत. त्यांच्या चाचण्या वेगळ्या आहेत आणि मोजपट्टी म्हणून वापरलेली अमेरिकी मॉडेलेही वेगळी आहेत, आणि ते मतभेदाचे मुख्य कारण आहे.

नवी मॉडेले, प्रयोगशाळांच्याच आकड्यांत

ही सर्व मिक्स्चर-ऑफ-एक्स्पर्ट्स मॉडेले आहेत. प्रत्येक टोकन विशेषज्ञ उप-नेटवर्कच्या लहान गटाकडे पाठवले जाते, त्यामुळे “सक्रिय” पॅरामीटरची संख्या, म्हणजे प्रत्येक टोकनसाठी प्रत्यक्ष वापरले जाणारे समायोज्य आकडे, एकूण संख्येपेक्षा खूपच कमी असते. टोकन म्हणजे एक शब्द किंवा शब्दाचा तुकडा.

मॉडेलएकूण / सक्रिय पॅरामीटरकॉन्टेक्स्ट विंडोपरवाना
DeepSeek V4-Pro१.६ ट्रिलियन / ४९ अब्ज१० लाख टोकनMIT
DeepSeek V4.1 Flash५५२ अब्ज / १६ अब्ज१० लाख टोकनMIT
Moonshot Kimi K3२.८ ट्रिलियन / १०४ अब्ज१० लाख टोकनKimi K3 License
Alibaba Qwen3.8-2.4T-A95B२.४ ट्रिलियन / ९५ अब्ज२,६२,१४४ टोकन, १०,१०,००० पर्यंत वाढवता येणारेQwen3.8-Max License
Z.ai GLM-5.3७५३ अब्ज / ४० अब्ज१० लाख टोकनGLM-5.3 License
Xiaomi MiMo-V2.6-Pro१.० ट्रिलियन / ४२ अब्ज१० लाख टोकनMIT

DeepSeek V4 चा तांत्रिक अहवाल, जो २६ एप्रिल २०२६ रोजी arXiv वर सादर झाला, एका प्रीव्ह्यूचे वर्णन करतो. त्यानुसार V4-Pro चे पूर्वप्रशिक्षण ३३ ट्रिलियन टोकनवर झाले आणि लहान V4-Flash चे ३२ ट्रिलियनवर. अहवाल सांगतो की १० लाख टोकनच्या कॉन्टेक्स्टवर V4-Pro ला DeepSeek च्या आधीच्या V3.2 पेक्षा प्रति टोकन २७% गणन आणि १०% मेमरी कॅश लागते. V4.1 Flash आणि MiMo च्या ओळी आर्टिफिशियल अनॅलिसिसच्या तक्त्यावर आणि Arena च्या परवाना लेबलांवर आधारित आहेत.

Kimi K3 चे मॉडेल कार्ड ८९६ पैकी १६ तज्ज्ञांची रचना सांगते, पण प्रशिक्षणाच्या टोकनची संख्या किंवा प्रशिक्षणाचे हार्डवेअर सांगत नाही. Qwen चा ओपन चेकपॉइंट फक्त मजकुराचा आहे, आणि त्याचे कार्ड म्हणते की थिंकिंग मोड बंद करता येत नाही. होस्ट केलेले Qwen3.8-Max चित्रांचा इनपुट आणि १० लाख टोकनचा डिफॉल्ट जोडते. GLM-5.3 हे GLM-5.2 चेच बेस मॉडेल पुन्हा वापरते, आणि Z.ai चे कार्ड म्हणते की सुधारणा पोस्ट-ट्रेनिंगमधून आल्या आहेत, म्हणजे तयार मॉडेलला अभिप्रायाने सुधारण्याच्या टप्प्यातून.

या कार्डांवरील बेंचमार्क आकडे प्रयोगशाळांचे स्वतःचे आहेत. DeepSeek चे कार्ड कोडिंग चाचणी SWE-bench Verified वर V4-Pro-Max साठी ८०.६ देते. NIST च्या CAISI ने त्याच चाचणीवर ७४ मोजले आणि फरकाचे कारण सिस्टम प्रॉम्प्ट, स्कॅफोल्डिंग आणि टोकन बजेट सांगितले.

बाहेरच्या परीक्षकांनी काय मोजले

आर्टिफिशियल अनॅलिसिस, आपल्या निर्देशांकाच्या ४.३.२ आवृत्तीवर, हे ओपन-वेट गुण देते: MiMo-V2.6-Pro ४६, GLM-5.3 ४५, Kimi K3 ४४, GLM-5.3-Flash ४२, DeepSeek V4.1 Flash ३९, Qwen3.8 27B (२७ अब्ज पॅरामीटरचे मॉडेल) ३४ आणि MiniMax-M3 २९. ट्रेंडिंग टॉपिक्स पूर्ण Qwen3.8 2.4T साठी ३९.९ नोंदवते. आर्टिफिशियल अनॅलिसिसच्या तक्त्यावरील सर्वोत्तम अमेरिकी ओपन नोंदी म्हणजे थिंकिंग मशीन्सचे Inkling २५ वर आणि एन्व्हिडियाचे Nemotron 3 Ultra २३ वर.

फ्रान्सच्या मिस्ट्रल लार्ज ४ प्रीव्ह्यूने ३८.४ गुण मिळवले, ज्याने तो ओपन मॉडेलमध्ये आठवा ठरेल, जसे tuput ने मिस्ट्रल लार्ज ४ च्या लेखात वृत्त दिले होते. खर्चात मोठा फरक आहे. ट्रेंडिंग टॉपिक्स MiMo-V2.6-Pro साठी प्रति निर्देशांक कामाला $०.१३ आणि GLM-5.3, Kimi K3 व Qwen3.8 प्रत्येकासाठी सुमारे $२ देते.

Arena च्या मजकूर लीडरबोर्डवर Kimi K3 (max) १६ व्या क्रमांकावर १४८८ गुणांसह आहे, तर गुगलच्या Gemini 4 Argon चे १५२५, ज्याला Arena प्राथमिक म्हणून चिन्हांकित करते, आणि Claude Opus 5.5 चे १५०७. MiMo-V2.6-Pro २६ वे, GLM-5.3 २७ वे आणि DeepSeek V4.1 Flash ३९ वे आहे. IndiaAI मिशन अंतर्गत निधी मिळालेल्या भारतीय मॉडेलांपैकी एकही tuput ने वाचलेल्या आर्टिफिशियल अनॅलिसिसच्या ओपन-वेट तक्त्यात दिसत नाही. कार्यक्रमाचे अंदाजपत्रक, GPU आणि निधी मिळालेले निर्माते IndiaAI मिशनच्या लेखात मांडले आहेत.

ओपन वेट आणि परवाने काय मागतात

“ओपन-वेट” याचा अर्थ कोणीही प्रशिक्षित आकडे डाउनलोड करू शकतो, आणि वापराच्या अटी प्रयोगशाळेनुसार बदलतात. DeepSeek आणि शाओमी MIT परवाना वापरतात, ज्यात जवळजवळ कोणत्याही अटी नाहीत. ट्रेंडिंग टॉपिक्स सांगते की आर्टिफिशियल अनॅलिसिस GLM-5.3, Kimi K3 आणि मोठे Qwen3.8 यांना व्यावसायिक वापरासाठी मर्यादित मानते, तरी tuput ने वाचलेल्या परवाना मजकुरांत मर्यादा याहून संकुचित आहेत.

Kimi K3 च्या परवान्यानुसार कोणत्याही १२ महिन्यांत २० दशलक्ष डॉलरहून अधिक महसूल असलेल्या, होस्ट केलेल्या मॉडेलचा व्यवसाय चालवणाऱ्या कंपनीला Moonshot सोबत स्वतंत्र करार करावा लागतो. १०० दशलक्षाहून अधिक मासिक वापरकर्ते असलेल्या किंवा मासिक २० दशलक्ष डॉलर महसूल असलेल्या उत्पादनाने आपल्या इंटरफेसवर “Kimi K3” दाखवले पाहिजे. अंतर्गत वापराला सूट आहे.

Qwen3.8-Max परवान्यात दाखवण्याचा नियम तोच आहे आणि स्वतंत्र परवान्याची मर्यादा होस्ट केलेल्या मॉडेलच्या किंवा एआय वर्क-असिस्टंट व्यवसायांसाठी १२ महिन्यांत ५० दशलक्ष डॉलर ठेवली आहे. Z.ai चा GLM-5.3 परवाना व्यावसायिक वापराला परवानगी देतो, आणि Z.ai चे सुरक्षा पुनरावलोकन फक्त अशा होस्ट केलेल्या मॉडेल व्यवसायांसाठी लागते ज्यांचा एकत्रित महसूल १० अब्ज डॉलरहून अधिक आहे.

प्रशिक्षण खर्चाचे दावे आणि ते काय वगळतात

सर्वात जास्त उद्धृत होणारा आकडा DeepSeek-V3 साठीचे $५.५७६ दशलक्ष हा आहे. V3 चा शोधनिबंध तो २.७८८ दशलक्ष H800 GPU तासांवरून, तासाला $२ च्या गृहीत भाड्याने, काढतो. शोधनिबंध सांगतो की एकूण रक्कम फक्त अधिकृत प्रशिक्षण फेरीची आहे आणि त्यात आधीचे संशोधन आणि ॲब्लेशन प्रयोग, म्हणजे रचना, अल्गोरिदम आणि डेटा निवडण्यासाठी केलेल्या छोट्या चाचण्या, वगळल्या आहेत.

V4 चा अहवाल टोकनची संख्या सांगतो, पण tuput ने शोधलेल्या मजकुरात डॉलरचा खर्च किंवा GPU तासांची बेरीज सांगत नाही. Kimi K3 चे मॉडेल कार्ड टोकनची संख्या किंवा खर्च सांगत नाही.

प्रयोगशाळा कोणत्या चिप वापरल्याचे सांगतात

DeepSeek चा अहवाल सांगतो की त्याचे फ्यूज्ड एक्स्पर्ट-कम्युनिकेशन कर्नल एन्व्हिडिया GPU आणि हुआवे Ascend NPU या दोन्हींवर तपासले गेले, सामान्य इन्फरन्सवर १.५० ते १.७३ पट गतीसह, आणि रिइन्फोर्समेंट-लर्निंग रोलआउटसारख्या विलंबसंवेदनशील कामावर १.९६ पटीपर्यंत. मॉडेलचे प्रशिक्षण कोणत्या चिपवर झाले हे तो सांगत नाही.

चायनाटॉकच्या आयरीन झांग, अकीब झकारिया आणि जॉर्डन श्नायडर यांनी २७ एप्रिल रोजी लिहिले की V4 चे प्रशिक्षण “अजूनही एन्व्हिडिया चिपवरच झाले,” हे त्यांचे पुराव्यांचे वाचन आहे, DeepSeek चे विधान नाही. त्याच लेखात DeepSeek च्या लाँच घोषणेतील एक तळटीप उद्धृत केली आहे: “उच्च दर्जाच्या संगणन क्षमतेवरील मर्यादांमुळे, V4-Pro ची सेवा क्षमता सध्या मर्यादित आहे.” हुआवेचे Ascend 950 सुपरनोड २०२६ च्या दुसऱ्या सहामाहीत मोठ्या प्रमाणात पाठवले गेले की Pro ची किंमत कमी होईल अशी DeepSeek ची अपेक्षा आहे, असेही त्यात जोडले आहे.

GLM-5.3 चे कार्ड सांगते की Ascend वरील तैनातीला vLLM-Ascend, xLLM आणि SGLang द्वारे आधार आहे, आणि प्रशिक्षणाचे हार्डवेअर देत नाही. Kimi K3 चे कार्ड सांगते की त्याची काही मूल्यमापने एन्व्हिडिया H20 GPU वर चालवली गेली.

अमेरिकेच्या बाजूने, द नेक्स्ट वेबने १९ ऑगस्ट रोजी फायनान्शियल टाइम्सचा हवाला देऊन वृत्त दिले की बाइटडान्स आणि टेन्सेंट यांना प्रत्येकी सुमारे १०,००० एन्व्हिडिया H200 चिप मिळाल्या होत्या. बीजिंगने कंपन्यांना त्या मुख्य भूमीबाहेर ठेवायला सांगितले आहे, आणि खेपा हाँगकाँगमार्गे जातात. द नेक्स्ट वेब म्हणते की जुलैमध्ये वाणिज्य खात्याचे अंडर सेक्रेटरी जेफ्री केस्लर यांनी काँग्रेसला सांगितले की “फारच थोड्या” आल्या आहेत. निर्बंधित सर्व्हरच्या वळवण्याचा विषय चीनला पाठवलेल्या सर्व्हरवरील न्याय खात्याच्या आरोपपत्राबद्दल tuput च्या वृत्तात आहे.

अंतराचे चार अंदाज

DeepSeek चा अहवाल म्हणतो की V4-Pro-Max मानक तर्कचाचण्यांमध्ये GPT-5.2 आणि Gemini-3.0-Pro ला मागे टाकते, पण GPT-5.4 आणि Gemini-3.1-Pro पासून थोडे कमी पडते. तो याचे वाचन आघाडीच्या सुमारे ३ ते ६ महिने मागे असे करतो.

NIST च्या सेंटर फॉर एआय स्टँडर्ड्स अँड इनोव्हेशनने एप्रिलमध्ये V4 Pro ची चाचणी केली आणि १ मे रोजी प्रकाशित केले की त्याची क्षमता आघाडीपेक्षा सुमारे ८ महिने मागे आहे. CAISI च्या नऊ बेंचमार्कवर, ज्यांपैकी दोन जनतेपासून राखून ठेवलेले आहेत, V4 Pro ने सुमारे ८ महिने आधी प्रसिद्ध झालेल्या GPT-5 सारखीच कामगिरी केली. ARC-AGI-2 च्या अर्ध-खाजगी संचावर त्याने ४६% मिळवले, तर GPT-5.5 ने ७९%. CAISI सांगते की तिचा मागे असण्याचा आकडा क्षमतेचा अंदाज बांधणाऱ्या सांख्यिकी मॉडेलमधून येतो, प्रत्यक्ष मोजमापातून नाही.

नॅथन लॅम्बर्ट यांनी २१ सप्टेंबर रोजी, काँग्रेसच्या एका ब्रीफिंगसाठी तयार केलेल्या साक्षीवरून विस्तारलेल्या लेखात, लिहिले की चिनी ओपन-वेट मॉडेले बंद अमेरिकी आघाडीच्या सुमारे २ ते ५ महिने मागे आहेत. अमेरिकी ओपन मॉडेले ओपनएआय आणि अँथ्रॉपिकच्या ६ ते ९ महिने मागे आहेत, असे ते म्हणतात. त्यांचा अंदाज आहे की डिस्टिलेशन, म्हणजे एका मॉडेलला दुसऱ्या मॉडेलच्या आउटपुटवर प्रशिक्षित करणे, चिनी अंतर १ ते २ महिन्यांनी कमी करते.

Epoch AI च्या जॅक एडवर्ड्स आणि ल्यूक एम्बरसन यांनी २९ मे रोजी नोंदवले की जानेवारी २०२६ पासून सर्वात सक्षम ओपन-वेट मॉडेले Epoch Capabilities Index वर बंद आघाडीच्या सरासरी चार महिने मागे आहेत, किंवा अधिक कडक चाचणीत सहा महिने, म्हणजे सरासरी ८ निर्देशांक गुणांचे अंतर. ते केवळ चिनी नव्हे तर सर्वसाधारणपणे ओपन मॉडेलांना लागू आहे. Epoch पुढे म्हणते की ओपन मॉडेले खाजगी बेंचमार्कवर कमी गुण मिळवतात, आणि तिचा अंदाज खऱ्या अंतराला कमी लेखत असू शकतो.

Share
Copied!

स्रोत आणि पुढील वाचन

  1. arXiv: DeepSeek-V4, Towards Highly Efficient Million-Token Context Intelligence (technical report, submitted 26 April 2026)
  2. Hugging Face: DeepSeek-V4-Pro model card
  3. arXiv: DeepSeek-V3 Technical Report
  4. Hugging Face: Kimi K3 model card (Moonshot AI)
  5. Hugging Face: Kimi K3 licence text
  6. Hugging Face: Qwen3.8-2.4T-A95B model card (Alibaba)
  7. Hugging Face: Qwen3.8-Max licence text
  8. Hugging Face: GLM-5.3 model card (Z.ai)
  9. Hugging Face: GLM-5.3 licence text
  10. Artificial Analysis: top open-weights models
  11. Artificial Analysis: leaderboard of all models by Intelligence Index
  12. Trending Topics: Mistral Large 4 on Artificial Analysis, Eighth Among Open Models (6 October 2026)
  13. Arena: text leaderboard
  14. NIST CAISI: Evaluation of DeepSeek V4 Pro (1 May 2026)
  15. Epoch AI: Open models lag state-of-the-art closed models by 4 months (29 May 2026)
  16. Interconnects: The current balance of power in open models (Nathan Lambert, 21 September 2026)
  17. ChinaTalk: DeepSeek V4 (27 April 2026)
  18. The Next Web: Nvidia's H200 finally reaches Chinese buyers (19 August 2026)

हा लेख AI साधनांच्या मदतीने संशोधित आणि लिहिला गेला असून अचूकतेसाठी संपादित केला आहे. हा केवळ सर्वसाधारण माहिती आणि चर्चेसाठी आहे, व्यावसायिक सल्ला नाही. आमचे संपादकीय मानक आणि अस्वीकरण पाहा. चूक आढळली? आम्हाला कळवा.

#chinese ai#deepseek v4#kimi k3#qwen3.8#glm-5.3#open-weight models#artificial analysis#export controls

आवडलं? पुढचा लेख मिळवा.

एका वेळी एक चांगला लेख, थेट तुमच्या इनबॉक्समध्ये. स्पॅम नाही, हवं तेव्हा थांबवा.

याच विभागात आणखी: कृत्रिम बुद्धिमत्ता
मिस्ट्रलच्या १ ट्रिलियन पॅरामीटरच्या ले चोंकने स्वतंत्र एआय निर्देशांकावर ३८ गुण मिळवले, ओपन मॉडेलमध्ये आठवा क्रमांक, आणि त्याचे वेट्स अजून प्रसिद्धही झालेले नाहीत
फ्रान्सच्या मिस्ट्रलने ट्रिलियन पॅरामीटरचे मॉडेल ऑनलाइन आणले आहे आणि डाउनलोड करता येणारे वेट्स याच महिन्यात येतील असे सांगितले आहे. बाहेरचे परीक्षक त्याला चीनबाहेरचे सर्वोत्तम ओपन मॉडेल आणि ओपन मॉडेलमध्ये आठवे ठरवतात, आणि त्याच्या आकाराबद्दल मिस्ट्रलचे स्वतःचे आकडेही सगळे जुळत नाहीत.
अमेरिकी सरकारी वकील म्हणतात की कॅलिफोर्नियातील एका व्यावसायिकाने ३०० दशलक्ष डॉलरपेक्षा जास्त किमतीचे एआय सर्व्हर मलेशिया आणि सिंगापूरमार्गे चीनला पाठवले; हा आरोप न्यायालयात अजून तपासला गेलेला नाही
सिटी ऑफ इंडस्ट्री येथील एका संगणक कंपनीच्या मालकावर निर्बंधित चिपने भरलेले सर्व्हर चिनी खरेदीदारांना पाठवल्याचा आरोप आहे. ई-मेल, पैसे आणि आरोपामागील नियम सार्वजनिक आहेत, आणि व्यापक अंदाजांमधील उणिवाही.
Scale च्या SWE-Bench Pro फलकावर सर्वोत्तम कोडिंग एजंट ६१.५% वर आहे, चाचण्या पास होणाऱ्या अनेक दुरुस्त्या देखभालकर्ते नाकारतात, आणि METR म्हणते की तिची ताजी चाचणी एजंट किती वेळ वाचवतात हे दाखवू शकत नाही
बेंचमार्क म्हणतात की एजंट प्रबळ आहेत. देखभालकर्ते, एक यादृच्छिक चाचणी आणि घटना अहवालांचा ढीग म्हणतात की चित्र त्यापेक्षा संकुचित आहे. प्रत्येक आकडा प्रत्यक्षात काय मोजतो ते येथे आहे.
← सर्व लेख