चित्रण: tuput
हिन्दी
Artificial Analysis के इंडेक्स पर ओपन-वेट मॉडलों में Xiaomi का MiMo-V2.6-Pro 46 अंक के साथ सबसे आगे है, Z.ai के GLM-5.3 और Moonshot के Kimi K3 से ऊपर। Anthropic का Claude Opus 5.5 58 पाता है। DeepSeek की अपनी रिपोर्ट कहती है कि वह अमेरिकी अग्रिम पंक्ति से 3 से 6 महीने पीछे है, और अमेरिकी सरकार का परीक्षण केंद्र कहता है लगभग 8।
8 अक्टूबर 2026 को Artificial Analysis के Intelligence Index पर सबसे ऊँचे स्थान वाला चीनी मॉडल Xiaomi का MiMo-V2.6-Pro है, जो 46 अंक पाता है और कुल मिलाकर 18वें नंबर पर है। उसी तालिका में Anthropic का Claude Opus 5.5 58 अंक के साथ सबसे ऊपर है, और OpenAI का GPT-6 Astra और Google का Gemini 4 Argon 53 पाते हैं। Trending Topics के मुताबिक़ यह इंडेक्स कोडिंग, एजेंट, ज्ञान-आधारित काम और विज्ञान के दस मूल्यांकनों को मिलाकर एक स्कोर बनाता है।
चार स्रोतों ने इस दूरी को महीनों में बदलने की कोशिश की है, और उनके जवाब 2 से 8 के बीच हैं। वे अलग-अलग परीक्षण और पैमाने के तौर पर अलग-अलग अमेरिकी मॉडल इस्तेमाल करते हैं, और उनकी असहमति की ज़्यादातर वजह यही है।
सबसे नई रिलीज़, लैबों के अपने आँकड़ों में
ये सभी मिक्सचर-ऑफ़-एक्सपर्ट्स मॉडल हैं। हर टोकन विशेषज्ञ उप-नेटवर्कों के एक छोटे समूह को भेजा जाता है, इसलिए “सक्रिय” पैरामीटर की गिनती, यानी प्रति टोकन असल में इस्तेमाल होने वाली समायोज्य संख्याएँ, कुल से बहुत कम होती है। टोकन एक शब्द या शब्द का टुकड़ा होता है।
| मॉडल | कुल / सक्रिय पैरामीटर | कॉन्टेक्स्ट विंडो | लाइसेंस |
|---|---|---|---|
| DeepSeek V4-Pro | 1.6 ट्रिलियन / 49 अरब | 10 लाख टोकन | MIT |
| DeepSeek V4.1 Flash | 552 अरब / 16 अरब | 10 लाख टोकन | MIT |
| Moonshot Kimi K3 | 2.8 ट्रिलियन / 104 अरब | 10 लाख टोकन | Kimi K3 License |
| Alibaba Qwen3.8-2.4T-A95B | 2.4 ट्रिलियन / 95 अरब | 262,144 टोकन, बढ़ाकर 1,010,000 तक | Qwen3.8-Max License |
| Z.ai GLM-5.3 | 753 अरब / 40 अरब | 10 लाख टोकन | GLM-5.3 License |
| Xiaomi MiMo-V2.6-Pro | 1.0 ट्रिलियन / 42 अरब | 10 लाख टोकन | MIT |
26 अप्रैल 2026 को arXiv पर जमा की गई DeepSeek V4 की तकनीकी रिपोर्ट एक प्रीव्यू का वर्णन करती है। उसके अनुसार V4-Pro को 33 ट्रिलियन टोकन पर और छोटे V4-Flash को 32 ट्रिलियन पर प्री-ट्रेन किया गया। रिपोर्ट कहती है कि दस लाख टोकन के कॉन्टेक्स्ट पर V4-Pro को DeepSeek के पिछले V3.2 की प्रति-टोकन गणना का 27% और मेमोरी कैश का 10% लगता है। V4.1 Flash और MiMo की पंक्तियाँ Artificial Analysis की तालिका और Arena के लाइसेंस लेबलों से ली गई हैं।
Kimi K3 का मॉडल कार्ड 896 में से 16 विशेषज्ञ परतों का ढाँचा बताता है, पर ट्रेनिंग टोकनों की गिनती और ट्रेनिंग का हार्डवेयर नहीं बताता। Qwen का ओपन चेकपॉइंट सिर्फ़ टेक्स्ट वाला है, और उसके कार्ड के अनुसार थिंकिंग मोड बंद नहीं किया जा सकता। होस्ट किया गया Qwen3.8-Max इमेज इनपुट और दस लाख टोकन का डिफ़ॉल्ट जोड़ता है। GLM-5.3, GLM-5.2 के ही बेस मॉडल को दोबारा इस्तेमाल करता है, और Z.ai का कार्ड कहता है कि सुधार पोस्ट-ट्रेनिंग से आए हैं, यानी उस चरण से जिसमें तैयार मॉडल को फ़ीडबैक के ज़रिए ढाला जाता है।
इन कार्डों पर बेंचमार्क के आँकड़े लैबों के अपने हैं। DeepSeek का कार्ड कोडिंग टेस्ट SWE-bench Verified पर V4-Pro-Max के लिए 80.6 दर्ज करता है। NIST के CAISI ने उसी टेस्ट पर 74 नापा, और फ़र्क़ का कारण सिस्टम प्रॉम्प्ट, स्कैफ़ोल्डिंग और टोकन बजट को बताया।
बाहर के परीक्षकों ने क्या नापा
Artificial Analysis अपने इंडेक्स के संस्करण 4.3.2 पर ये ओपन-वेट स्कोर दर्ज करता है: MiMo-V2.6-Pro 46, GLM-5.3 45, Kimi K3 44, GLM-5.3-Flash 42, DeepSeek V4.1 Flash 39, Qwen3.8 27B (27 अरब पैरामीटर वाला मॉडल) 34 और MiniMax-M3 29। Trending Topics पूरे Qwen3.8 2.4T के लिए 39.9 बताता है। Artificial Analysis की तालिका में सबसे अच्छी अमेरिकी ओपन प्रविष्टियाँ Thinking Machines का Inkling 25 पर और Nvidia का Nemotron 3 Ultra 23 पर हैं।
फ़्रांस के Mistral Large 4 प्रीव्यू ने 38.4 पाया, जो ओपन मॉडलों में आठवें स्थान पर आता, जैसा tuput ने Mistral Large 4 वाले लेख में बताया था। लागत में भारी फ़र्क़ है। Trending Topics प्रति इंडेक्स टास्क MiMo-V2.6-Pro के लिए $0.13 और GLM-5.3, Kimi K3 और Qwen3.8 के लिए लगभग $2 प्रत्येक बताता है।
Arena की टेक्स्ट लीडरबोर्ड पर Kimi K3 (max) 1488 अंक के साथ 16वें स्थान पर है। इसकी तुलना में Google का Gemini 4 Argon 1525 पर है, जिसे Arena ने प्रारंभिक चिह्नित किया है, और Claude Opus 5.5 1507 पर। MiMo-V2.6-Pro 26वें, GLM-5.3 27वें और DeepSeek V4.1 Flash 39वें स्थान पर हैं। IndiaAI Mission के तहत जिन भारतीय मॉडलों को पैसा मिला, उनमें से कोई भी उस Artificial Analysis ओपन-वेट तालिका में नहीं दिखता जो tuput ने पढ़ी। कार्यक्रम का बजट, GPU और पैसा पाने वाले निर्माता IndiaAI Mission वाले लेख में दिए गए हैं।
ओपन वेट, और लाइसेंस क्या माँगते हैं
“ओपन-वेट” का मतलब है कि कोई भी ट्रेन की हुई संख्याएँ डाउनलोड कर सकता है, और इस्तेमाल की शर्तें लैब-लैब में अलग हैं। DeepSeek और Xiaomi MIT लाइसेंस इस्तेमाल करते हैं, जिसमें लगभग कोई शर्त नहीं है। Trending Topics के अनुसार Artificial Analysis GLM-5.3, Kimi K3 और बड़े Qwen3.8 को व्यावसायिक इस्तेमाल के लिए प्रतिबंधित श्रेणी में रखता है, हालाँकि tuput ने जो लाइसेंस पाठ पढ़े, उनमें सीमाएँ इससे संकरी हैं।
Kimi K3 का लाइसेंस माँगता है कि होस्ट किए जाने वाले मॉडल का कारोबार चलाने वाली कंपनी, जिसकी किसी भी 12 महीने में आय 20 मिलियन डॉलर से ज़्यादा हो, Moonshot के साथ अलग समझौता करे। जिस उत्पाद के 100 मिलियन से ज़्यादा मासिक उपयोगकर्ता हों, या 20 मिलियन डॉलर की मासिक आय हो, उसे अपने इंटरफ़ेस पर “Kimi K3” दिखाना होगा। आंतरिक इस्तेमाल को छूट है।
Qwen3.8-Max लाइसेंस में यही दिखाने का नियम है, और होस्ट किए मॉडल या AI वर्क-असिस्टेंट के कारोबारों के लिए अलग लाइसेंस की सीमा 12 महीनों में 50 मिलियन डॉलर रखी गई है। Z.ai का GLM-5.3 लाइसेंस व्यावसायिक इस्तेमाल की अनुमति देता है, और Z.ai की सुरक्षा समीक्षा सिर्फ़ उन होस्टेड-मॉडल कारोबारों के लिए रखता है जिनकी कुल आय 10 अरब डॉलर से ज़्यादा है।
ट्रेनिंग-लागत के दावे और जो वे छोड़ देते हैं
सबसे ज़्यादा उद्धृत किया जाने वाला आँकड़ा DeepSeek-V3 के लिए 5.576 मिलियन डॉलर है। V3 का शोधपत्र इस तक 2.788 मिलियन H800 GPU घंटों को 2 डॉलर प्रति घंटे के मानकर किराए से पहुँचता है। शोधपत्र साफ़ कहता है कि यह कुल सिर्फ़ आधिकारिक ट्रेनिंग रन को गिनता है और पहले के शोध और ablation प्रयोगों को, यानी आर्किटेक्चर, एल्गोरिदम और डेटा चुनने के लिए किए गए छोटे परीक्षणों को, शामिल नहीं करता।
V4 की रिपोर्ट टोकनों की गिनती बताती है, पर जिस पाठ में tuput ने खोजा, उसमें डॉलर की लागत या GPU घंटों का कुल नहीं है। Kimi K3 के मॉडल कार्ड में न टोकन गिनती है, न लागत।
लैबें कौन-सी चिप इस्तेमाल करने की बात कहती हैं
DeepSeek की रिपोर्ट कहती है कि उसका फ़्यूज़्ड एक्सपर्ट-कम्युनिकेशन कर्नल Nvidia GPU और Huawei Ascend NPU, दोनों पर परखा गया, जिसमें सामान्य इन्फ़रेंस पर 1.50 से 1.73 गुना और देरी के प्रति संवेदनशील कामों पर, जैसे रीइन्फ़ोर्समेंट-लर्निंग रोलआउट, 1.96 गुना तक की रफ़्तार बढ़ी। वह यह नहीं बताती कि मॉडल की ट्रेनिंग किन चिपों पर हुई।
ChinaTalk के Irene Zhang, Aqib Zakaria और Jordan Schneider ने 27 अप्रैल को लिखा कि V4 “अब भी Nvidia चिपों पर ट्रेन हुआ” था, जो सबूतों की उनकी अपनी व्याख्या है, DeepSeek का बयान नहीं। उसी लेख में DeepSeek की लॉन्च घोषणा के एक फ़ुटनोट का हवाला है: “उच्च-स्तरीय कंप्यूट की पाबंदियों के कारण V4-Pro की सेवा-क्षमता फ़िलहाल सीमित है।” लेख जोड़ता है कि DeepSeek को उम्मीद है कि 2026 की दूसरी छमाही में Huawei के Ascend 950 सुपरनोड बड़ी संख्या में आने पर Pro की क़ीमत गिरेगी।
GLM-5.3 का कार्ड कहता है कि Ascend पर तैनाती vLLM-Ascend, xLLM और SGLang के ज़रिए समर्थित है, और ट्रेनिंग हार्डवेयर नहीं बताता। Kimi K3 का कार्ड कहता है कि उसके कुछ मूल्यांकन Nvidia H20 GPU पर चलाए गए।
अमेरिकी पक्ष पर, The Next Web ने 19 अगस्त को फ़ाइनेंशियल टाइम्स के हवाले से लिखा कि ByteDance और Tencent को लगभग 10,000-10,000 Nvidia H200 चिप मिले। बीजिंग ने कंपनियों से कहा है कि उन्हें मुख्य भूमि के बाहर रखें, और खेपें हांगकांग से होकर जाती हैं। The Next Web के अनुसार जुलाई में वाणिज्य अंडर सेक्रेटरी जेफ़्री केसलर ने कांग्रेस को बताया कि “बहुत कम” पहुँचे हैं। प्रतिबंधित सर्वरों के रास्ता बदलने पर tuput की चीन भेजे गए सर्वरों पर न्याय विभाग के अभियोग वाली रिपोर्ट है।
फ़ासले के चार अनुमान
DeepSeek की रिपोर्ट कहती है कि V4-Pro-Max मानक तर्क-परीक्षणों पर GPT-5.2 और Gemini-3.0-Pro से आगे है, पर GPT-5.4 और Gemini-3.1-Pro से मामूली रूप से पीछे रह जाता है। वह इसे अग्रिम पंक्ति से लगभग 3 से 6 महीने पीछे होना पढ़ती है।
अमेरिकी NIST के सेंटर फ़ॉर AI स्टैंडर्ड्स एंड इनोवेशन ने अप्रैल में V4 Pro को परखा और 1 मई को प्रकाशित किया कि उसकी क्षमताएँ अग्रिम पंक्ति से लगभग 8 महीने पीछे हैं। CAISI के नौ बेंचमार्कों पर, जिनमें दो जनता से छिपाकर रखे गए हैं, V4 Pro का प्रदर्शन लगभग 8 महीने पहले जारी हुए GPT-5 जैसा रहा। ARC-AGI-2 के अर्ध-निजी सेट पर उसने 46% पाया, जबकि GPT-5.5 ने 79%। CAISI कहता है कि उसका अंतर का आँकड़ा एक सांख्यिकीय मॉडल से आता है जो क्षमता का अनुमान लगाता है, सीधा माप नहीं है।
Nathan Lambert ने 21 सितंबर को, कांग्रेस की एक ब्रीफ़िंग के लिए तैयार गवाही से बढ़ाए गए एक लेख में, लिखा कि चीनी ओपन-वेट मॉडल बंद अमेरिकी अग्रिम पंक्ति से लगभग 2 से 5 महीने पीछे हैं। उनके अनुसार अमेरिकी ओपन मॉडल OpenAI और Anthropic से 6 से 9 महीने पीछे हैं। उनका अनुमान है कि डिस्टिलेशन, यानी किसी मॉडल को दूसरे मॉडल के आउटपुट पर ट्रेन करना, चीनी अंतर को 1 से 2 महीने घटा देता है।
Epoch AI के Jack Edwards और Luke Emberson ने 29 मई को बताया कि जनवरी 2026 से सबसे सक्षम ओपन-वेट मॉडल Epoch Capabilities Index पर बंद अग्रिम पंक्ति से औसतन चार महीने पीछे रहे हैं, या ज़्यादा सख़्त परीक्षण पर छह महीने, यानी इंडेक्स के औसतन 8 अंकों का अंतर। यह आम तौर पर ओपन मॉडलों को कवर करता है, सिर्फ़ चीनी मॉडलों को नहीं। Epoch जोड़ता है कि ओपन मॉडल निजी बेंचमार्कों पर कम स्कोर करते हैं, और यह कि उसका अनुमान असली अंतर को कम करके बता सकता है।
स्रोत और आगे पढ़ने के लिए
- arXiv: DeepSeek-V4, Towards Highly Efficient Million-Token Context Intelligence (technical report, submitted 26 April 2026)
- Hugging Face: DeepSeek-V4-Pro model card
- arXiv: DeepSeek-V3 Technical Report
- Hugging Face: Kimi K3 model card (Moonshot AI)
- Hugging Face: Kimi K3 licence text
- Hugging Face: Qwen3.8-2.4T-A95B model card (Alibaba)
- Hugging Face: Qwen3.8-Max licence text
- Hugging Face: GLM-5.3 model card (Z.ai)
- Hugging Face: GLM-5.3 licence text
- Artificial Analysis: top open-weights models
- Artificial Analysis: leaderboard of all models by Intelligence Index
- Trending Topics: Mistral Large 4 on Artificial Analysis, Eighth Among Open Models (6 October 2026)
- Arena: text leaderboard
- NIST CAISI: Evaluation of DeepSeek V4 Pro (1 May 2026)
- Epoch AI: Open models lag state-of-the-art closed models by 4 months (29 May 2026)
- Interconnects: The current balance of power in open models (Nathan Lambert, 21 September 2026)
- ChinaTalk: DeepSeek V4 (27 April 2026)
- The Next Web: Nvidia's H200 finally reaches Chinese buyers (19 August 2026)
यह लेख AI उपकरणों की सहायता से शोधित और लिखा गया है, और सटीकता के लिए संपादित किया गया है। यह केवल सामान्य जानकारी और चर्चा के लिए है, पेशेवर सलाह नहीं। हमारे संपादकीय मानक और अस्वीकरण देखें। कोई त्रुटि मिली? हमें बताएँ।
अच्छा लगा? अगला लेख पाएँ।
एक बार में एक अच्छा लेख, सीधे आपके इनबॉक्स में। कोई स्पैम नहीं, जब चाहें अनसब्सक्राइब करें।