অলঙ্করণ: tuput
বাংলা
আর্টিফিশিয়াল অ্যানালিসিসের সূচকে ওপেন-ওয়েট মডেলের মধ্যে এগিয়ে আছে শাওমির MiMo-V2.6-Pro, স্কোর ৪৬, তার পেছনে Z.ai-র GLM-5.3 আর মুনশটের Kimi K3। অ্যানথ্রপিকের Claude Opus 5.5 পেয়েছে ৫৮। ডিপসিকের নিজের প্রতিবেদন বলছে তারা মার্কিন সীমানা থেকে ৩ থেকে ৬ মাস পিছিয়ে, আর মার্কিন সরকারের পরীক্ষাকেন্দ্র বলছে প্রায় ৮।
২০২৬ সালের ৮ অক্টোবর আর্টিফিশিয়াল অ্যানালিসিসের ইন্টেলিজেন্স ইনডেক্সে সবচেয়ে ওপরে থাকা চীনা মডেল শাওমির MiMo-V2.6-Pro, স্কোর ৪৬, সামগ্রিক তালিকায় ১৮তম। একই তালিকার শীর্ষে অ্যানথ্রপিকের Claude Opus 5.5, ৫৮, আর ওপেনএআইয়ের GPT-6 Astra ও গুগলের Gemini 4 Argon-এর স্কোর ৫৩। ট্রেন্ডিং টপিকসের তথ্য অনুযায়ী, সূচকটি কোডিং, এজেন্ট, জ্ঞানভিত্তিক কাজ আর বিজ্ঞানের দশটি মূল্যায়ন মিলিয়ে একটি স্কোর তৈরি করে।
চারটি সূত্র এই দূরত্বকে মাসে রূপান্তর করার চেষ্টা করেছে, আর তাদের উত্তর ২ থেকে ৮ মাসের মধ্যে ছড়িয়ে আছে। তারা আলাদা পরীক্ষা ব্যবহার করে, আর মাপকাঠি হিসেবে ধরে আলাদা মার্কিন মডেল, যা ভিন্নমতের বেশির ভাগ কারণ।
নতুন মডেলগুলো, ল্যাবের নিজস্ব সংখ্যায়
এগুলো সবই মিক্সচার-অফ-এক্সপার্টস মডেল। প্রতিটি টোকেন পাঠানো হয় বিশেষজ্ঞ উপ-নেটওয়ার্কের ছোট একটা অংশে, তাই “সক্রিয়” প্যারামিটারের সংখ্যা, অর্থাৎ প্রতি টোকেনে আসলে যে সমন্বয়যোগ্য সংখ্যাগুলো ব্যবহার হয়, মোটের চেয়ে অনেক কম। টোকেন মানে একটা শব্দ বা শব্দের টুকরো।
| মডেল | মোট / সক্রিয় প্যারামিটার | কনটেক্সট উইন্ডো | লাইসেন্স |
|---|---|---|---|
| DeepSeek V4-Pro | ১.৬ ট্রিলিয়ন / ৪৯ বিলিয়ন | ১ মিলিয়ন টোকেন | MIT |
| DeepSeek V4.1 Flash | ৫৫২ বিলিয়ন / ১৬ বিলিয়ন | ১ মিলিয়ন টোকেন | MIT |
| Moonshot Kimi K3 | ২.৮ ট্রিলিয়ন / ১০৪ বিলিয়ন | ১ মিলিয়ন টোকেন | Kimi K3 License |
| Alibaba Qwen3.8-2.4T-A95B | ২.৪ ট্রিলিয়ন / ৯৫ বিলিয়ন | ২,৬২,১৪৪ টোকেন, বাড়িয়ে ১০,১০,০০০ পর্যন্ত নেওয়া যায় | Qwen3.8-Max License |
| Z.ai GLM-5.3 | ৭৫৩ বিলিয়ন / ৪০ বিলিয়ন | ১ মিলিয়ন টোকেন | GLM-5.3 License |
| Xiaomi MiMo-V2.6-Pro | ১.০ ট্রিলিয়ন / ৪২ বিলিয়ন | ১ মিলিয়ন টোকেন | MIT |
২০২৬ সালের ২৬ এপ্রিল arXiv-এ জমা দেওয়া DeepSeek V4-এর প্রযুক্তিগত প্রতিবেদন একটি প্রিভিউয়ের বর্ণনা দেয়। তাতে বলা আছে V4-Pro-কে আগে থেকে প্রশিক্ষণ দেওয়া হয়েছে ৩৩ ট্রিলিয়ন টোকেনে, আর ছোট V4-Flash-কে ৩২ ট্রিলিয়নে। প্রতিবেদন অনুযায়ী, এক মিলিয়ন টোকেনের কনটেক্সটে V4-Pro-র লাগে ডিপসিকের আগের V3.2-এর প্রতি টোকেন গণনার ২৭% আর মেমরি ক্যাশের ১০%। V4.1 Flash আর MiMo-র সারি এসেছে আর্টিফিশিয়াল অ্যানালিসিসের তালিকা ও Arena-র লাইসেন্স-চিহ্ন থেকে।
Kimi K3-র মডেল কার্ডে ৮৯৬টির মধ্যে ১৬টি এক্সপার্টের বিন্যাস আছে, কিন্তু প্রশিক্ষণের টোকেন সংখ্যা বা প্রশিক্ষণের হার্ডওয়্যারের উল্লেখ নেই। Qwen-এর খোলা চেকপয়েন্ট শুধু টেক্সটের, আর তার কার্ড বলছে থিংকিং মোড বন্ধ করা যায় না। হোস্ট করা Qwen3.8-Max-এ ছবি ইনপুট আর ডিফল্ট এক মিলিয়ন টোকেন যোগ হয়েছে। GLM-5.3 ব্যবহার করেছে GLM-5.2-এর বেস মডেলই, আর Z.ai-র কার্ড বলছে উন্নতি এসেছে পোস্ট-ট্রেনিং থেকে, অর্থাৎ তৈরি মডেলকে ফিডব্যাক দিয়ে ঠিকঠাক করার ধাপ থেকে।
এই কার্ডগুলোর বেঞ্চমার্ক সংখ্যা ল্যাবগুলোর নিজস্ব। ডিপসিকের কার্ডে কোডিং পরীক্ষা SWE-bench Verified-এ V4-Pro-Max-এর স্কোর ৮০.৬। NIST-এর CAISI একই পরীক্ষায় মেপেছে ৭৪, আর পার্থক্যের কারণ বলেছে সিস্টেম প্রম্পট, স্ক্যাফোল্ডিং আর টোকেনের বাজেট।
বাইরের পরীক্ষকেরা কী মেপেছেন
আর্টিফিশিয়াল অ্যানালিসিস তাদের সূচকের ৪.৩.২ সংস্করণে ওপেন-ওয়েট মডেলের এই স্কোরগুলো দিয়েছে: MiMo-V2.6-Pro ৪৬, GLM-5.3 ৪৫, Kimi K3 ৪৪, GLM-5.3-Flash ৪২, DeepSeek V4.1 Flash ৩৯, Qwen3.8 27B (২৭ বিলিয়ন প্যারামিটারের একটি মডেল) ৩৪ আর MiniMax-M3 ২৯। ট্রেন্ডিং টপিকস পুরো Qwen3.8 2.4T-এর জন্য ৩৯.৯ জানিয়েছে। আর্টিফিশিয়াল অ্যানালিসিসের তালিকায় সেরা মার্কিন ওপেন এন্ট্রি দুটি: থিংকিং মেশিনসের Inkling ২৫ আর এনভিডিয়ার Nemotron 3 Ultra ২৩।
ফ্রান্সের মিস্ট্রাল Large 4 প্রিভিউয়ের স্কোর ৩৮.৪, যা ওপেন মডেলের মধ্যে অষ্টম স্থানে আসত, যেমন tuput জানিয়েছিল মিস্ট্রাল Large 4 নিয়ে লেখায়। খরচে ফারাক বিস্তর। ট্রেন্ডিং টপিকস MiMo-V2.6-Pro-র জন্য সূচকের প্রতি কাজে ০.১৩ ডলার আর GLM-5.3, Kimi K3 ও Qwen3.8-এর জন্য প্রতিটিতে প্রায় ২ ডলার জানিয়েছে।
Arena-র টেক্সট লিডারবোর্ডে Kimi K3 (max) আছে ১৬তম, ১৪৮৮ নিয়ে, তুলনায় গুগলের Gemini 4 Argon ১৫২৫ (যাকে Arena প্রাথমিক বলে চিহ্নিত করেছে) আর Claude Opus 5.5 ১৫০৭। MiMo-V2.6-Pro ২৬তম, GLM-5.3 ২৭তম আর DeepSeek V4.1 Flash ৩৯তম। ইন্ডিয়াএআই মিশনের অর্থে তৈরি ভারতীয় মডেলগুলোর কোনোটাই tuput-এর পড়া আর্টিফিশিয়াল অ্যানালিসিসের ওপেন-ওয়েট তালিকায় নেই। কর্মসূচির বাজেট, জিপিইউ আর অর্থপ্রাপ্ত নির্মাতাদের কথা আছে ইন্ডিয়াএআই মিশনের লেখায়।
ওপেন ওয়েট, আর লাইসেন্স কী চায়
“ওপেন-ওয়েট” মানে যে কেউ প্রশিক্ষিত সংখ্যাগুলো ডাউনলোড করতে পারে, তবে ব্যবহারের শর্ত ল্যাবভেদে আলাদা। ডিপসিক আর শাওমি MIT লাইসেন্স ব্যবহার করে, যাতে প্রায় কোনো শর্ত নেই। ট্রেন্ডিং টপিকস জানিয়েছে, আর্টিফিশিয়াল অ্যানালিসিস GLM-5.3, Kimi K3 আর বড় Qwen3.8-কে বাণিজ্যিক ব্যবহারের জন্য সীমাবদ্ধ বলে শ্রেণিভুক্ত করে, যদিও tuput-এর পড়া লাইসেন্সের পাঠে সীমাগুলো আরও সংকীর্ণ।
Kimi K3-র লাইসেন্স অনুযায়ী, যে কোম্পানি হোস্ট করা মডেলের ব্যবসা চালায় এবং যেকোনো ১২ মাসে যার আয় ২০ মিলিয়ন ডলারের বেশি, তাকে মুনশটের সঙ্গে আলাদা চুক্তি করতে হবে। যে পণ্যের মাসিক ব্যবহারকারী ১০০ মিলিয়নের বেশি, বা মাসিক আয় ২০ মিলিয়ন ডলার, তাকে নিজের ইন্টারফেসে “Kimi K3” দেখাতে হবে। ভেতরের ব্যবহার এর বাইরে।
Qwen3.8-Max লাইসেন্সে একই প্রদর্শনের নিয়ম আছে, আর হোস্ট করা মডেল বা এআই কাজের সহকারীর ব্যবসার জন্য আলাদা লাইসেন্সের সীমা ধরা হয়েছে ১২ মাসে ৫০ মিলিয়ন ডলার। Z.ai-র GLM-5.3 লাইসেন্স বাণিজ্যিক ব্যবহার অনুমোদন করে, শুধু যে হোস্ট করা মডেলের ব্যবসার মোট আয় ১০ বিলিয়ন ডলারের বেশি তার জন্য Z.ai-র নিরাপত্তা পর্যালোচনা লাগে।
প্রশিক্ষণের খরচের দাবি, আর যা তাতে বাদ পড়ে
সবচেয়ে বেশি উদ্ধৃত অঙ্কটা DeepSeek-V3-এর জন্য ৫.৫৭৬ মিলিয়ন ডলার। V3-এর গবেষণাপত্র সেখানে পৌঁছেছে ২.৭৮৮ মিলিয়ন H800 জিপিইউ ঘণ্টাকে ঘণ্টায় ২ ডলার ভাড়া ধরে। পত্রটি স্পষ্ট করে বলেছে, মোট অঙ্কে শুধু সরকারি প্রশিক্ষণ-চালানোটা ধরা আছে, আগের গবেষণা আর অ্যাবলেশন পরীক্ষা, অর্থাৎ আর্কিটেকচার, অ্যালগরিদম আর ডেটা বেছে নিতে করা ছোট ছোট পরীক্ষা, তাতে বাদ।
V4-এর প্রতিবেদনে টোকেনের সংখ্যা আছে, কিন্তু tuput যে পাঠ খুঁজেছে তাতে ডলারের খরচ বা জিপিইউ ঘণ্টার মোট নেই। Kimi K3-র মডেল কার্ডে টোকেন সংখ্যা বা খরচ কিছুই বলা নেই।
ল্যাবগুলো কোন চিপ ব্যবহারের কথা বলে
ডিপসিকের প্রতিবেদন বলছে, তাদের ফিউজড এক্সপার্ট-কমিউনিকেশন কার্নেল এনভিডিয়া জিপিইউ আর হুয়াওয়ে অ্যাসেন্ড এনপিইউ, দুটোতেই যাচাই করা হয়েছে, সাধারণ ইনফারেন্সে গতি বেড়েছে ১.৫০ থেকে ১.৭৩ গুণ, আর রিইনফোর্সমেন্ট লার্নিং রোলআউটের মতো দেরি-সংবেদনশীল কাজে ১.৯৬ গুণ পর্যন্ত। কোন চিপে মডেলটি প্রশিক্ষিত হয়েছে তা এতে বলা নেই।
ChinaTalk-এর আইরিন ঝাং, আকিব জাকারিয়া আর জর্ডান শ্নাইডার ২৭ এপ্রিল লিখেছেন, V4 “এখনও এনভিডিয়া চিপেই প্রশিক্ষিত”, যা তাঁদের নিজেদের প্রমাণ-পাঠ, ডিপসিকের কোনো বক্তব্য নয়। একই লেখায় ডিপসিকের লঞ্চ ঘোষণার একটি পাদটীকা উদ্ধৃত হয়েছে: “উচ্চ-ক্ষমতার কম্পিউটের সীমাবদ্ধতার কারণে V4-Pro-র সার্ভিস থ্রুপুট এখন সীমিত।” লেখাটি যোগ করে, ২০২৬ সালের দ্বিতীয়ার্ধে হুয়াওয়ের অ্যাসেন্ড ৯৫০ সুপারনোড বড় পরিমাণে এলে ডিপসিক Pro-র দাম কমবে বলে আশা করছে।
GLM-5.3-র কার্ড বলছে অ্যাসেন্ডে ডিপ্লয়মেন্ট vLLM-Ascend, xLLM আর SGLang দিয়ে সমর্থিত, প্রশিক্ষণের হার্ডওয়্যার সম্পর্কে কিছু বলেনি। Kimi K3-র কার্ড বলছে তার কিছু মূল্যায়ন চলেছে এনভিডিয়া H20 জিপিইউতে।
মার্কিন দিক থেকে, দ্য নেক্সট ওয়েব ১৯ আগস্ট ফাইন্যান্সিয়াল টাইমসের সূত্রে জানিয়েছিল, বাইটড্যান্স আর টেনসেন্ট প্রতিটি প্রায় ১০,০০০ এনভিডিয়া H200 চিপ পেয়েছে। বেইজিং কোম্পানিগুলোকে সেগুলো মূল ভূখণ্ডের বাইরে রাখতে বলেছে, আর চালান যায় হংকং হয়ে। নেক্সট ওয়েব বলছে, জুলাইয়ে বাণিজ্য আন্ডার সেক্রেটারি জেফ্রি কেসলার কংগ্রেসকে বলেছিলেন, “খুব অল্পই” পৌঁছেছে। রপ্তানিতে নিয়ন্ত্রিত সার্ভার অন্য পথে সরিয়ে দেওয়ার বিষয়টি নিয়ে tuput-এর প্রতিবেদন আছে চীনে পাঠানো সার্ভার নিয়ে বিচার বিভাগের অভিযোগপত্রের লেখায়।
ব্যবধানের চারটি হিসাব
ডিপসিকের প্রতিবেদন বলছে V4-Pro-Max মানক যুক্তির পরীক্ষায় GPT-5.2 আর Gemini-3.0-Pro-কে হারায়, কিন্তু সামান্য ব্যবধানে GPT-5.4 আর Gemini-3.1-Pro-র পেছনে পড়ে। এর পাঠ হলো সীমানার থেকে মোটামুটি ৩ থেকে ৬ মাস পিছিয়ে থাকা।
NIST-এর সেন্টার ফর এআই স্ট্যান্ডার্ডস অ্যান্ড ইনোভেশন এপ্রিলে V4 Pro পরীক্ষা করে ১ মে প্রকাশ করেছে যে তার সক্ষমতা সীমানা থেকে প্রায় ৮ মাস পিছিয়ে। জনসমক্ষে না আসা দুটি সহ CAISI-র নয়টি বেঞ্চমার্কে V4 Pro-র ফল ছিল প্রায় ৮ মাস আগে প্রকাশিত GPT-5-এর মতো। ARC-AGI-2-এর আধা-ব্যক্তিগত সেটে সে পেয়েছে ৪৬%, আর GPT-5.5 পেয়েছে ৭৯%। CAISI বলছে, তাদের ব্যবধানের অঙ্ক এসেছে একটি পরিসংখ্যান মডেল থেকে যা সক্ষমতার আনুমানিক মান বের করে, সরাসরি মাপ নয়।
নাথান ল্যাম্বার্ট ২১ সেপ্টেম্বর লিখেছেন, কংগ্রেসের একটি ব্রিফিংয়ের জন্য তৈরি সাক্ষ্য থেকে বাড়ানো একটি লেখায়, চীনা ওপেন-ওয়েট মডেলগুলো বন্ধ মার্কিন সীমানা থেকে মোটামুটি ২ থেকে ৫ মাস পিছিয়ে। তাঁর মতে মার্কিন ওপেন মডেলগুলো ওপেনএআই আর অ্যানথ্রপিকের থেকে ৬ থেকে ৯ মাস পিছিয়ে। তিনি অনুমান করেন, ডিস্টিলেশন, অর্থাৎ একটি মডেলকে অন্য মডেলের আউটপুটে প্রশিক্ষণ দেওয়া, চীনা ব্যবধান ১ থেকে ২ মাস কমিয়ে আনে।
Epoch AI-র জ্যাক এডওয়ার্ডস আর লুক এমবারসন ২৯ মে জানিয়েছেন, ২০২৬ সালের জানুয়ারি থেকে সবচেয়ে সক্ষম ওপেন-ওয়েট মডেলগুলো Epoch ক্যাপাবিলিটিজ ইনডেক্সে বন্ধ সীমানার থেকে গড়ে চার মাস পিছিয়ে, আর আরও কড়া পরীক্ষায় ছয় মাস, গড় ব্যবধান ৮ ইনডেক্স পয়েন্ট। এটা সাধারণভাবে ওপেন মডেলগুলোর কথা, শুধু চীনাদের নয়। Epoch যোগ করেছে, ব্যক্তিগত বেঞ্চমার্কে ওপেন মডেলগুলো কম স্কোর পেতে থাকে, আর তাদের হিসাব প্রকৃত ব্যবধানকে কম করে দেখাতে পারে।
সূত্র ও আরও পড়ার জন্য
- arXiv: DeepSeek-V4, Towards Highly Efficient Million-Token Context Intelligence (technical report, submitted 26 April 2026)
- Hugging Face: DeepSeek-V4-Pro model card
- arXiv: DeepSeek-V3 Technical Report
- Hugging Face: Kimi K3 model card (Moonshot AI)
- Hugging Face: Kimi K3 licence text
- Hugging Face: Qwen3.8-2.4T-A95B model card (Alibaba)
- Hugging Face: Qwen3.8-Max licence text
- Hugging Face: GLM-5.3 model card (Z.ai)
- Hugging Face: GLM-5.3 licence text
- Artificial Analysis: top open-weights models
- Artificial Analysis: leaderboard of all models by Intelligence Index
- Trending Topics: Mistral Large 4 on Artificial Analysis, Eighth Among Open Models (6 October 2026)
- Arena: text leaderboard
- NIST CAISI: Evaluation of DeepSeek V4 Pro (1 May 2026)
- Epoch AI: Open models lag state-of-the-art closed models by 4 months (29 May 2026)
- Interconnects: The current balance of power in open models (Nathan Lambert, 21 September 2026)
- ChinaTalk: DeepSeek V4 (27 April 2026)
- The Next Web: Nvidia's H200 finally reaches Chinese buyers (19 August 2026)
এই লেখাটি AI সরঞ্জামের সহায়তায় গবেষণা ও রচনা করা হয়েছে এবং নির্ভুলতার জন্য সম্পাদনা করা হয়েছে। এটি কেবল সাধারণ তথ্য ও আলোচনার জন্য, পেশাদার পরামর্শ নয়। আমাদের সম্পাদকীয় মান ও দাবিত্যাগ দেখুন। কোনো ভুল চোখে পড়ল? আমাদের জানান।
ভালো লাগল? পরেরটিও পড়ুন।
একবারে একটি ভালো লেখা, সরাসরি আপনার ইনবক্সে। কোনো স্প্যাম নয়, যখন খুশি বন্ধ করতে পারেন।