चित्रण: tuput
मराठी
शाओमीचे MiMo-V2.6-Pro आर्टिफिशियल अनॅलिसिसच्या निर्देशांकावर ४६ गुणांसह ओपन-वेट मॉडेलमध्ये आघाडीवर आहे, Z.ai चे GLM-5.3 आणि मूनशॉटचे Kimi K3 त्यामागे. अँथ्रॉपिकचे Claude Opus 5.5 ५८ गुण मिळवते. DeepSeek चा स्वतःचा अहवाल म्हणतो की ते अमेरिकी आघाडीच्या ३ ते ६ महिने मागे आहे, आणि अमेरिकी सरकारचे चाचणी केंद्र सुमारे ८ महिने म्हणते.
८ ऑक्टोबर २०२६ रोजी आर्टिफिशियल अनॅलिसिसच्या इंटेलिजन्स इंडेक्सवर सर्वात वरचे चिनी मॉडेल शाओमीचे MiMo-V2.6-Pro आहे, ज्याचे गुण ४६ आहेत आणि एकूण क्रमवारीत त्याचा १८ वा क्रमांक आहे. त्याच तक्त्यात अँथ्रॉपिकचे Claude Opus 5.5 ५८ गुणांसह पहिले आहे, आणि ओपनएआयचे GPT-6 Astra व गुगलचे Gemini 4 Argon यांचे गुण ५३ आहेत. ट्रेंडिंग टॉपिक्सच्या म्हणण्यानुसार हा निर्देशांक कोडिंग, एजंट, ज्ञानकाम आणि विज्ञान यांच्या दहा मूल्यमापनांना एका गुणात एकत्र करतो.
चार स्रोतांनी हे अंतर महिन्यांत मांडण्याचा प्रयत्न केला आहे, आणि त्यांची उत्तरे २ ते ८ दरम्यान आहेत. त्यांच्या चाचण्या वेगळ्या आहेत आणि मोजपट्टी म्हणून वापरलेली अमेरिकी मॉडेलेही वेगळी आहेत, आणि ते मतभेदाचे मुख्य कारण आहे.
नवी मॉडेले, प्रयोगशाळांच्याच आकड्यांत
ही सर्व मिक्स्चर-ऑफ-एक्स्पर्ट्स मॉडेले आहेत. प्रत्येक टोकन विशेषज्ञ उप-नेटवर्कच्या लहान गटाकडे पाठवले जाते, त्यामुळे “सक्रिय” पॅरामीटरची संख्या, म्हणजे प्रत्येक टोकनसाठी प्रत्यक्ष वापरले जाणारे समायोज्य आकडे, एकूण संख्येपेक्षा खूपच कमी असते. टोकन म्हणजे एक शब्द किंवा शब्दाचा तुकडा.
| मॉडेल | एकूण / सक्रिय पॅरामीटर | कॉन्टेक्स्ट विंडो | परवाना |
|---|---|---|---|
| DeepSeek V4-Pro | १.६ ट्रिलियन / ४९ अब्ज | १० लाख टोकन | MIT |
| DeepSeek V4.1 Flash | ५५२ अब्ज / १६ अब्ज | १० लाख टोकन | MIT |
| Moonshot Kimi K3 | २.८ ट्रिलियन / १०४ अब्ज | १० लाख टोकन | Kimi K3 License |
| Alibaba Qwen3.8-2.4T-A95B | २.४ ट्रिलियन / ९५ अब्ज | २,६२,१४४ टोकन, १०,१०,००० पर्यंत वाढवता येणारे | Qwen3.8-Max License |
| Z.ai GLM-5.3 | ७५३ अब्ज / ४० अब्ज | १० लाख टोकन | GLM-5.3 License |
| Xiaomi MiMo-V2.6-Pro | १.० ट्रिलियन / ४२ अब्ज | १० लाख टोकन | MIT |
DeepSeek V4 चा तांत्रिक अहवाल, जो २६ एप्रिल २०२६ रोजी arXiv वर सादर झाला, एका प्रीव्ह्यूचे वर्णन करतो. त्यानुसार V4-Pro चे पूर्वप्रशिक्षण ३३ ट्रिलियन टोकनवर झाले आणि लहान V4-Flash चे ३२ ट्रिलियनवर. अहवाल सांगतो की १० लाख टोकनच्या कॉन्टेक्स्टवर V4-Pro ला DeepSeek च्या आधीच्या V3.2 पेक्षा प्रति टोकन २७% गणन आणि १०% मेमरी कॅश लागते. V4.1 Flash आणि MiMo च्या ओळी आर्टिफिशियल अनॅलिसिसच्या तक्त्यावर आणि Arena च्या परवाना लेबलांवर आधारित आहेत.
Kimi K3 चे मॉडेल कार्ड ८९६ पैकी १६ तज्ज्ञांची रचना सांगते, पण प्रशिक्षणाच्या टोकनची संख्या किंवा प्रशिक्षणाचे हार्डवेअर सांगत नाही. Qwen चा ओपन चेकपॉइंट फक्त मजकुराचा आहे, आणि त्याचे कार्ड म्हणते की थिंकिंग मोड बंद करता येत नाही. होस्ट केलेले Qwen3.8-Max चित्रांचा इनपुट आणि १० लाख टोकनचा डिफॉल्ट जोडते. GLM-5.3 हे GLM-5.2 चेच बेस मॉडेल पुन्हा वापरते, आणि Z.ai चे कार्ड म्हणते की सुधारणा पोस्ट-ट्रेनिंगमधून आल्या आहेत, म्हणजे तयार मॉडेलला अभिप्रायाने सुधारण्याच्या टप्प्यातून.
या कार्डांवरील बेंचमार्क आकडे प्रयोगशाळांचे स्वतःचे आहेत. DeepSeek चे कार्ड कोडिंग चाचणी SWE-bench Verified वर V4-Pro-Max साठी ८०.६ देते. NIST च्या CAISI ने त्याच चाचणीवर ७४ मोजले आणि फरकाचे कारण सिस्टम प्रॉम्प्ट, स्कॅफोल्डिंग आणि टोकन बजेट सांगितले.
बाहेरच्या परीक्षकांनी काय मोजले
आर्टिफिशियल अनॅलिसिस, आपल्या निर्देशांकाच्या ४.३.२ आवृत्तीवर, हे ओपन-वेट गुण देते: MiMo-V2.6-Pro ४६, GLM-5.3 ४५, Kimi K3 ४४, GLM-5.3-Flash ४२, DeepSeek V4.1 Flash ३९, Qwen3.8 27B (२७ अब्ज पॅरामीटरचे मॉडेल) ३४ आणि MiniMax-M3 २९. ट्रेंडिंग टॉपिक्स पूर्ण Qwen3.8 2.4T साठी ३९.९ नोंदवते. आर्टिफिशियल अनॅलिसिसच्या तक्त्यावरील सर्वोत्तम अमेरिकी ओपन नोंदी म्हणजे थिंकिंग मशीन्सचे Inkling २५ वर आणि एन्व्हिडियाचे Nemotron 3 Ultra २३ वर.
फ्रान्सच्या मिस्ट्रल लार्ज ४ प्रीव्ह्यूने ३८.४ गुण मिळवले, ज्याने तो ओपन मॉडेलमध्ये आठवा ठरेल, जसे tuput ने मिस्ट्रल लार्ज ४ च्या लेखात वृत्त दिले होते. खर्चात मोठा फरक आहे. ट्रेंडिंग टॉपिक्स MiMo-V2.6-Pro साठी प्रति निर्देशांक कामाला $०.१३ आणि GLM-5.3, Kimi K3 व Qwen3.8 प्रत्येकासाठी सुमारे $२ देते.
Arena च्या मजकूर लीडरबोर्डवर Kimi K3 (max) १६ व्या क्रमांकावर १४८८ गुणांसह आहे, तर गुगलच्या Gemini 4 Argon चे १५२५, ज्याला Arena प्राथमिक म्हणून चिन्हांकित करते, आणि Claude Opus 5.5 चे १५०७. MiMo-V2.6-Pro २६ वे, GLM-5.3 २७ वे आणि DeepSeek V4.1 Flash ३९ वे आहे. IndiaAI मिशन अंतर्गत निधी मिळालेल्या भारतीय मॉडेलांपैकी एकही tuput ने वाचलेल्या आर्टिफिशियल अनॅलिसिसच्या ओपन-वेट तक्त्यात दिसत नाही. कार्यक्रमाचे अंदाजपत्रक, GPU आणि निधी मिळालेले निर्माते IndiaAI मिशनच्या लेखात मांडले आहेत.
ओपन वेट आणि परवाने काय मागतात
“ओपन-वेट” याचा अर्थ कोणीही प्रशिक्षित आकडे डाउनलोड करू शकतो, आणि वापराच्या अटी प्रयोगशाळेनुसार बदलतात. DeepSeek आणि शाओमी MIT परवाना वापरतात, ज्यात जवळजवळ कोणत्याही अटी नाहीत. ट्रेंडिंग टॉपिक्स सांगते की आर्टिफिशियल अनॅलिसिस GLM-5.3, Kimi K3 आणि मोठे Qwen3.8 यांना व्यावसायिक वापरासाठी मर्यादित मानते, तरी tuput ने वाचलेल्या परवाना मजकुरांत मर्यादा याहून संकुचित आहेत.
Kimi K3 च्या परवान्यानुसार कोणत्याही १२ महिन्यांत २० दशलक्ष डॉलरहून अधिक महसूल असलेल्या, होस्ट केलेल्या मॉडेलचा व्यवसाय चालवणाऱ्या कंपनीला Moonshot सोबत स्वतंत्र करार करावा लागतो. १०० दशलक्षाहून अधिक मासिक वापरकर्ते असलेल्या किंवा मासिक २० दशलक्ष डॉलर महसूल असलेल्या उत्पादनाने आपल्या इंटरफेसवर “Kimi K3” दाखवले पाहिजे. अंतर्गत वापराला सूट आहे.
Qwen3.8-Max परवान्यात दाखवण्याचा नियम तोच आहे आणि स्वतंत्र परवान्याची मर्यादा होस्ट केलेल्या मॉडेलच्या किंवा एआय वर्क-असिस्टंट व्यवसायांसाठी १२ महिन्यांत ५० दशलक्ष डॉलर ठेवली आहे. Z.ai चा GLM-5.3 परवाना व्यावसायिक वापराला परवानगी देतो, आणि Z.ai चे सुरक्षा पुनरावलोकन फक्त अशा होस्ट केलेल्या मॉडेल व्यवसायांसाठी लागते ज्यांचा एकत्रित महसूल १० अब्ज डॉलरहून अधिक आहे.
प्रशिक्षण खर्चाचे दावे आणि ते काय वगळतात
सर्वात जास्त उद्धृत होणारा आकडा DeepSeek-V3 साठीचे $५.५७६ दशलक्ष हा आहे. V3 चा शोधनिबंध तो २.७८८ दशलक्ष H800 GPU तासांवरून, तासाला $२ च्या गृहीत भाड्याने, काढतो. शोधनिबंध सांगतो की एकूण रक्कम फक्त अधिकृत प्रशिक्षण फेरीची आहे आणि त्यात आधीचे संशोधन आणि ॲब्लेशन प्रयोग, म्हणजे रचना, अल्गोरिदम आणि डेटा निवडण्यासाठी केलेल्या छोट्या चाचण्या, वगळल्या आहेत.
V4 चा अहवाल टोकनची संख्या सांगतो, पण tuput ने शोधलेल्या मजकुरात डॉलरचा खर्च किंवा GPU तासांची बेरीज सांगत नाही. Kimi K3 चे मॉडेल कार्ड टोकनची संख्या किंवा खर्च सांगत नाही.
प्रयोगशाळा कोणत्या चिप वापरल्याचे सांगतात
DeepSeek चा अहवाल सांगतो की त्याचे फ्यूज्ड एक्स्पर्ट-कम्युनिकेशन कर्नल एन्व्हिडिया GPU आणि हुआवे Ascend NPU या दोन्हींवर तपासले गेले, सामान्य इन्फरन्सवर १.५० ते १.७३ पट गतीसह, आणि रिइन्फोर्समेंट-लर्निंग रोलआउटसारख्या विलंबसंवेदनशील कामावर १.९६ पटीपर्यंत. मॉडेलचे प्रशिक्षण कोणत्या चिपवर झाले हे तो सांगत नाही.
चायनाटॉकच्या आयरीन झांग, अकीब झकारिया आणि जॉर्डन श्नायडर यांनी २७ एप्रिल रोजी लिहिले की V4 चे प्रशिक्षण “अजूनही एन्व्हिडिया चिपवरच झाले,” हे त्यांचे पुराव्यांचे वाचन आहे, DeepSeek चे विधान नाही. त्याच लेखात DeepSeek च्या लाँच घोषणेतील एक तळटीप उद्धृत केली आहे: “उच्च दर्जाच्या संगणन क्षमतेवरील मर्यादांमुळे, V4-Pro ची सेवा क्षमता सध्या मर्यादित आहे.” हुआवेचे Ascend 950 सुपरनोड २०२६ च्या दुसऱ्या सहामाहीत मोठ्या प्रमाणात पाठवले गेले की Pro ची किंमत कमी होईल अशी DeepSeek ची अपेक्षा आहे, असेही त्यात जोडले आहे.
GLM-5.3 चे कार्ड सांगते की Ascend वरील तैनातीला vLLM-Ascend, xLLM आणि SGLang द्वारे आधार आहे, आणि प्रशिक्षणाचे हार्डवेअर देत नाही. Kimi K3 चे कार्ड सांगते की त्याची काही मूल्यमापने एन्व्हिडिया H20 GPU वर चालवली गेली.
अमेरिकेच्या बाजूने, द नेक्स्ट वेबने १९ ऑगस्ट रोजी फायनान्शियल टाइम्सचा हवाला देऊन वृत्त दिले की बाइटडान्स आणि टेन्सेंट यांना प्रत्येकी सुमारे १०,००० एन्व्हिडिया H200 चिप मिळाल्या होत्या. बीजिंगने कंपन्यांना त्या मुख्य भूमीबाहेर ठेवायला सांगितले आहे, आणि खेपा हाँगकाँगमार्गे जातात. द नेक्स्ट वेब म्हणते की जुलैमध्ये वाणिज्य खात्याचे अंडर सेक्रेटरी जेफ्री केस्लर यांनी काँग्रेसला सांगितले की “फारच थोड्या” आल्या आहेत. निर्बंधित सर्व्हरच्या वळवण्याचा विषय चीनला पाठवलेल्या सर्व्हरवरील न्याय खात्याच्या आरोपपत्राबद्दल tuput च्या वृत्तात आहे.
अंतराचे चार अंदाज
DeepSeek चा अहवाल म्हणतो की V4-Pro-Max मानक तर्कचाचण्यांमध्ये GPT-5.2 आणि Gemini-3.0-Pro ला मागे टाकते, पण GPT-5.4 आणि Gemini-3.1-Pro पासून थोडे कमी पडते. तो याचे वाचन आघाडीच्या सुमारे ३ ते ६ महिने मागे असे करतो.
NIST च्या सेंटर फॉर एआय स्टँडर्ड्स अँड इनोव्हेशनने एप्रिलमध्ये V4 Pro ची चाचणी केली आणि १ मे रोजी प्रकाशित केले की त्याची क्षमता आघाडीपेक्षा सुमारे ८ महिने मागे आहे. CAISI च्या नऊ बेंचमार्कवर, ज्यांपैकी दोन जनतेपासून राखून ठेवलेले आहेत, V4 Pro ने सुमारे ८ महिने आधी प्रसिद्ध झालेल्या GPT-5 सारखीच कामगिरी केली. ARC-AGI-2 च्या अर्ध-खाजगी संचावर त्याने ४६% मिळवले, तर GPT-5.5 ने ७९%. CAISI सांगते की तिचा मागे असण्याचा आकडा क्षमतेचा अंदाज बांधणाऱ्या सांख्यिकी मॉडेलमधून येतो, प्रत्यक्ष मोजमापातून नाही.
नॅथन लॅम्बर्ट यांनी २१ सप्टेंबर रोजी, काँग्रेसच्या एका ब्रीफिंगसाठी तयार केलेल्या साक्षीवरून विस्तारलेल्या लेखात, लिहिले की चिनी ओपन-वेट मॉडेले बंद अमेरिकी आघाडीच्या सुमारे २ ते ५ महिने मागे आहेत. अमेरिकी ओपन मॉडेले ओपनएआय आणि अँथ्रॉपिकच्या ६ ते ९ महिने मागे आहेत, असे ते म्हणतात. त्यांचा अंदाज आहे की डिस्टिलेशन, म्हणजे एका मॉडेलला दुसऱ्या मॉडेलच्या आउटपुटवर प्रशिक्षित करणे, चिनी अंतर १ ते २ महिन्यांनी कमी करते.
Epoch AI च्या जॅक एडवर्ड्स आणि ल्यूक एम्बरसन यांनी २९ मे रोजी नोंदवले की जानेवारी २०२६ पासून सर्वात सक्षम ओपन-वेट मॉडेले Epoch Capabilities Index वर बंद आघाडीच्या सरासरी चार महिने मागे आहेत, किंवा अधिक कडक चाचणीत सहा महिने, म्हणजे सरासरी ८ निर्देशांक गुणांचे अंतर. ते केवळ चिनी नव्हे तर सर्वसाधारणपणे ओपन मॉडेलांना लागू आहे. Epoch पुढे म्हणते की ओपन मॉडेले खाजगी बेंचमार्कवर कमी गुण मिळवतात, आणि तिचा अंदाज खऱ्या अंतराला कमी लेखत असू शकतो.
स्रोत आणि पुढील वाचन
- arXiv: DeepSeek-V4, Towards Highly Efficient Million-Token Context Intelligence (technical report, submitted 26 April 2026)
- Hugging Face: DeepSeek-V4-Pro model card
- arXiv: DeepSeek-V3 Technical Report
- Hugging Face: Kimi K3 model card (Moonshot AI)
- Hugging Face: Kimi K3 licence text
- Hugging Face: Qwen3.8-2.4T-A95B model card (Alibaba)
- Hugging Face: Qwen3.8-Max licence text
- Hugging Face: GLM-5.3 model card (Z.ai)
- Hugging Face: GLM-5.3 licence text
- Artificial Analysis: top open-weights models
- Artificial Analysis: leaderboard of all models by Intelligence Index
- Trending Topics: Mistral Large 4 on Artificial Analysis, Eighth Among Open Models (6 October 2026)
- Arena: text leaderboard
- NIST CAISI: Evaluation of DeepSeek V4 Pro (1 May 2026)
- Epoch AI: Open models lag state-of-the-art closed models by 4 months (29 May 2026)
- Interconnects: The current balance of power in open models (Nathan Lambert, 21 September 2026)
- ChinaTalk: DeepSeek V4 (27 April 2026)
- The Next Web: Nvidia's H200 finally reaches Chinese buyers (19 August 2026)
हा लेख AI साधनांच्या मदतीने संशोधित आणि लिहिला गेला असून अचूकतेसाठी संपादित केला आहे. हा केवळ सर्वसाधारण माहिती आणि चर्चेसाठी आहे, व्यावसायिक सल्ला नाही. आमचे संपादकीय मानक आणि अस्वीकरण पाहा. चूक आढळली? आम्हाला कळवा.
आवडलं? पुढचा लेख मिळवा.
एका वेळी एक चांगला लेख, थेट तुमच्या इनबॉक्समध्ये. स्पॅम नाही, हवं तेव्हा थांबवा.