வரைபடம்: tuput
தமிழ்
ஆர்டிஃபிஷியல் அனலிசிஸ் குறியீட்டில் திறந்த-எடை மாடல்களில் ஷாவ்மியின் MiMo-V2.6-Pro 46 உடன் முன்னிலையில் உள்ளது; Z.ai இன் GLM-5.3, மூன்ஷாட்டின் Kimi K3 ஆகியவை அடுத்து வருகின்றன. ஆன்த்ரோபிக்கின் Claude Opus 5.5 58 பெறுகிறது. அமெரிக்க முன்னணியை விட தாம் 3 முதல் 6 மாதங்கள் பின்தங்கியுள்ளதாக DeepSeek இன் சொந்த அறிக்கை கூறுகிறது; அமெரிக்க அரசின் சோதனை மையம் சுமார் 8 என்கிறது.
2026 அக்டோபர் 8 அன்று ஆர்டிஃபிஷியல் அனலிசிஸ் நுண்ணறிவுக் குறியீட்டில் அதிக இடம் பெற்ற சீன மாடல் ஷாவ்மியின் MiMo-V2.6-Pro; அது 46 பெற்று ஒட்டுமொத்தமாக 18 ஆவது இடத்தில் உள்ளது. அதே அட்டவணையில் ஆன்த்ரோபிக்கின் Claude Opus 5.5 58 உடன் முன்னிலையில் உள்ளது; OpenAI இன் GPT-6 Astra, கூகுளின் Gemini 4 Argon ஆகியவை 53 பெறுகின்றன. இந்தக் குறியீடு கோடிங், முகவர்கள், அறிவுசார் வேலை, அறிவியல் ஆகியவற்றில் பத்து மதிப்பீடுகளை ஒரே மதிப்பெண்ணாக இணைக்கிறது என்று ட்ரெண்டிங் டாபிக்ஸ் கூறுகிறது.
இந்தத் தூரத்தை மாதங்களாக மாற்ற நான்கு ஆதாரங்கள் முயன்றுள்ளன; அவற்றின் பதில்கள் 2 முதல் 8 வரை உள்ளன. அவை வெவ்வேறு சோதனைகளையும், அளவுகோலாக வெவ்வேறு அமெரிக்க மாடல்களையும் பயன்படுத்துகின்றன; அவை முரண்படுவதற்கு முக்கியக் காரணம் அதுதான்.
புதிய வெளியீடுகள், ஆய்வகங்களின் சொந்த எண்களில்
இவை அனைத்தும் நிபுணர்க் கலவை (mixture-of-experts) மாடல்கள். ஒவ்வொரு டோக்கனும் சிறப்பு உப-வலைப்பின்னல்களின் ஒரு சிறிய தொகுப்புக்கு அனுப்பப்படுகிறது; அதனால் “செயலில் உள்ள” அளவுருக்களின் எண்ணிக்கை, அதாவது ஒவ்வொரு டோக்கனுக்கும் உண்மையில் பயன்படுத்தப்படும் சரிசெய்யக்கூடிய எண்கள், மொத்தத்தை விட மிகவும் குறைவு. டோக்கன் என்பது ஒரு சொல் அல்லது சொல்லின் ஒரு துண்டு.
| மாடல் | மொத்த / செயலில் உள்ள அளவுருக்கள் | சூழல் சாளரம் | உரிமம் |
|---|---|---|---|
| DeepSeek V4-Pro | 1.6 டிரில்லியன் / 49 பில்லியன் | 1 மில்லியன் டோக்கன்கள் | MIT |
| DeepSeek V4.1 Flash | 552 பில்லியன் / 16 பில்லியன் | 1 மில்லியன் டோக்கன்கள் | MIT |
| Moonshot Kimi K3 | 2.8 டிரில்லியன் / 104 பில்லியன் | 1 மில்லியன் டோக்கன்கள் | Kimi K3 License |
| Alibaba Qwen3.8-2.4T-A95B | 2.4 டிரில்லியன் / 95 பில்லியன் | 262,144 டோக்கன்கள், 1,010,000 வரை நீட்டிக்கலாம் | Qwen3.8-Max License |
| Z.ai GLM-5.3 | 753 பில்லியன் / 40 பில்லியன் | 1 மில்லியன் டோக்கன்கள் | GLM-5.3 License |
| Xiaomi MiMo-V2.6-Pro | 1.0 டிரில்லியன் / 42 பில்லியன் | 1 மில்லியன் டோக்கன்கள் | MIT |
2026 ஏப்ரல் 26 அன்று arXiv இல் சமர்ப்பிக்கப்பட்ட DeepSeek V4 தொழில்நுட்ப அறிக்கை ஒரு முன்னோட்டத்தை விவரிக்கிறது. V4-Pro 33 டிரில்லியன் டோக்கன்களிலும், சிறிய V4-Flash 32 டிரில்லியன் டோக்கன்களிலும் முன்-பயிற்சி பெற்றன என்று அது கூறுகிறது. ஒரு மில்லியன் டோக்கன் சூழலில், DeepSeek இன் முந்தைய V3.2 ஐ விட V4-Pro க்கு ஒரு டோக்கனுக்கான கணக்கீடு 27 சதவீதமும், நினைவகக் கேஷ் 10 சதவீதமும் போதும் என்று அறிக்கை கூறுகிறது. V4.1 Flash, MiMo வரிசைகள் ஆர்டிஃபிஷியல் அனலிசிஸ் அட்டவணையையும் அரீனாவின் உரிமம் குறித்த குறிப்புகளையும் சார்ந்தவை.
Kimi K3 இன் மாடல் அட்டை 896 இல் 16 நிபுணர் அமைப்பைத் தருகிறது; ஆனால் பயிற்சி டோக்கன் எண்ணிக்கையையோ பயிற்சி வன்பொருளையோ தரவில்லை. Qwen இன் திறந்த செக்பாயின்ட் உரை மட்டுமே; சிந்தனைப் பயன்முறையை அணைக்க முடியாது என்று அதன் அட்டை கூறுகிறது. இணையத்தில் இயங்கும் Qwen3.8-Max படவுள்ளீட்டையும், ஒரு மில்லியன் டோக்கன் இயல்புநிலையையும் சேர்க்கிறது. GLM-5.3, GLM-5.2 இன் அடிப்படை மாடலையே மீண்டும் பயன்படுத்துகிறது; முன்னேற்றம் பின்-பயிற்சியிலிருந்து, அதாவது முடிந்த மாடலுக்குக் கருத்துகள் மூலம் மெருகூட்டும் கட்டத்திலிருந்து, வருகிறது என்று Z.ai இன் அட்டை கூறுகிறது.
இந்த அட்டைகளில் உள்ள பெஞ்ச்மார்க் எண்கள் ஆய்வகங்களின் சொந்தவை. கோடிங் சோதனையான SWE-bench Verified இல் V4-Pro-Max க்கு 80.6 என்று DeepSeek இன் அட்டை பட்டியலிடுகிறது. அதே சோதனையில் NIST இன் CAISI 74 ஐ அளந்தது; வேறுபாட்டுக்குக் காரணம் சிஸ்டம் ப்ராம்ப்ட்கள், ஸ்காஃபோல்டிங், டோக்கன் வரம்புகள் என்று அது கூறுகிறது.
வெளியாட்கள் அளந்தது என்ன
தனது குறியீட்டின் 4.3.2 பதிப்பில் ஆர்டிஃபிஷியல் அனலிசிஸ் இந்தத் திறந்த-எடை மதிப்பெண்களைப் பட்டியலிடுகிறது: MiMo-V2.6-Pro 46, GLM-5.3 45, Kimi K3 44, GLM-5.3-Flash 42, DeepSeek V4.1 Flash 39, Qwen3.8 27B (27 பில்லியன் அளவுருக்கள் கொண்ட மாடல்) 34, MiniMax-M3 29. முழு Qwen3.8 2.4T க்கு 39.9 என்று ட்ரெண்டிங் டாபிக்ஸ் தெரிவிக்கிறது. ஆர்டிஃபிஷியல் அனலிசிஸ் அட்டவணையில் உள்ள சிறந்த அமெரிக்கத் திறந்த பதிவுகள் திங்கிங் மெஷின்ஸின் Inkling (25), என்விடியாவின் Nemotron 3 Ultra (23).
பிரான்சின் Mistral Large 4 முன்னோட்டம் 38.4 பெற்றது; அது திறந்த மாடல்களில் எட்டாவது இடம் பெறும் என்று Mistral Large 4 கட்டுரையில் tuput தெரிவித்தது. செலவு கடுமையாக மாறுபடுகிறது. MiMo-V2.6-Pro க்கு குறியீட்டின் ஒரு பணிக்கு $0.13 என்றும், GLM-5.3, Kimi K3, Qwen3.8 ஒவ்வொன்றுக்கும் சுமார் $2 என்றும் ட்ரெண்டிங் டாபிக்ஸ் தருகிறது.
அரீனாவின் உரைத் தரவரிசையில், கூகுளின் Gemini 4 Argon க்கு 1525 (அதை அரீனா தற்காலிகம் என்று குறிக்கிறது), Claude Opus 5.5 க்கு 1507 என்பதற்கு எதிராக, Kimi K3 (max) 1488 உடன் 16 ஆவது இடத்தில் பட்டியலிடப்பட்டுள்ளது. MiMo-V2.6-Pro 26 ஆவது, GLM-5.3 27 ஆவது, DeepSeek V4.1 Flash 39 ஆவது. IndiaAI மிஷனின் கீழ் நிதியளிக்கப்பட்ட இந்திய மாடல்களில் எதுவும் tuput படித்த ஆர்டிஃபிஷியல் அனலிசிஸ் திறந்த-எடை அட்டவணையில் இல்லை. திட்டத்தின் நிதி, GPU-க்கள், நிதி பெற்ற உருவாக்குநர்கள் ஆகியவை IndiaAI மிஷன் கட்டுரையில் விவரிக்கப்பட்டுள்ளன.
திறந்த எடைகள், உரிமங்கள் கோருவது என்ன
“திறந்த-எடை” என்றால், பயிற்சி பெற்ற எண்களை யார் வேண்டுமானாலும் பதிவிறக்கலாம் என்று பொருள்; பயன்பாட்டு விதிமுறைகள் ஆய்வகத்துக்கு ஆய்வகம் வேறுபடுகின்றன. DeepSeek, ஷாவ்மி ஆகியவை MIT உரிமத்தைப் பயன்படுத்துகின்றன; அதில் நிபந்தனைகள் கிட்டத்தட்ட இல்லை. GLM-5.3, Kimi K3, பெரிய Qwen3.8 ஆகியவற்றை வணிகப் பயன்பாட்டுக்குக் கட்டுப்பாடு உள்ளவை என்று ஆர்டிஃபிஷியல் அனலிசிஸ் வகைப்படுத்துகிறது என்று ட்ரெண்டிங் டாபிக்ஸ் கூறுகிறது; ஆனால் tuput படித்த உரிமப் பிரதிகள் அதைவிடக் குறுகிய வரம்புகளையே விதிக்கின்றன.
எந்த 12 மாதத்திலும் 20 மில்லியன் டாலருக்கு மேல் வருவாய் உள்ள, இணையத்தில் மாடலை இயக்கும் தொழிலை நடத்தும் நிறுவனம் மூன்ஷாட்டுடன் தனி ஒப்பந்தம் கையெழுத்திட வேண்டும் என்று Kimi K3 இன் உரிமம் கோருகிறது. 100 மில்லியனுக்கு மேல் மாதாந்திரப் பயனர்கள் அல்லது மாதம் 20 மில்லியன் டாலர் வருவாய் உள்ள தயாரிப்பு, தன் இடைமுகத்தில் “Kimi K3” என்று காட்ட வேண்டும். உள்நிலைப் பயன்பாட்டுக்கு விலக்கு உண்டு.
Qwen3.8-Max உரிமத்தில் அதே காட்சி விதி உள்ளது; இணைய மாடல் அல்லது AI வேலை உதவியாளர் தொழில்களுக்குத் தனி உரிமத்துக்கான வரம்பை 12 மாதங்களில் 50 மில்லியன் டாலர் என்று அது நிர்ணயிக்கிறது. Z.ai இன் GLM-5.3 உரிமம் வணிகப் பயன்பாட்டை அனுமதிக்கிறது; ஒருங்கிணைந்த வருவாய் 10 பில்லியன் டாலரைத் தாண்டும் இணைய மாடல் தொழில்களுக்கு மட்டும் Z.ai இன் பாதுகாப்பு மறுஆய்வு தேவை.
பயிற்சிச் செலவு கூற்றுகளும் அவை விட்டுவிடுவதும்
அடிக்கடி மேற்கோள் காட்டப்படும் எண் DeepSeek-V3 க்கான $5.576 மில்லியன். ஒரு மணி நேரத்துக்கு $2 என்ற கற்பனை வாடகை விலையில் 2.788 மில்லியன் H800 GPU மணி நேரங்களிலிருந்து V3 ஆய்வறிக்கை அதை அடைகிறது. அந்தத் தொகை அதிகாரப்பூர்வப் பயிற்சி ஓட்டத்தை மட்டுமே உள்ளடக்குகிறது என்றும், முன் ஆராய்ச்சி, கட்டமைப்பு, வழிமுறைகள், தரவைத் தேர்ந்தெடுக்கப் பயன்படும் சிறு சோதனைகளான அப்லேஷன் சோதனைகள் ஆகியவற்றை விலக்குகிறது என்றும் ஆய்வறிக்கை கூறுகிறது.
V4 அறிக்கை டோக்கன் எண்ணிக்கைகளைக் கூறுகிறது; ஆனால் tuput தேடிய உரையில் டாலர் செலவோ மொத்த GPU-மணி நேரமோ இல்லை. Kimi K3 இன் மாடல் அட்டை டோக்கன் எண்ணிக்கையையும் செலவையும் தரவில்லை.
ஆய்வகங்கள் எந்தச் சிப்களைப் பயன்படுத்துவதாகக் கூறுகின்றன
தனது இணைக்கப்பட்ட நிபுணர்-தகவல்தொடர்பு கர்னல் என்விடியா GPU-க்களிலும் ஹுவாவே Ascend NPU-க்களிலும் சரிபார்க்கப்பட்டது என்றும், பொது அனுமானத்தில் 1.50 முதல் 1.73 மடங்கும், வலுவூட்டல் கற்றல் ரோல்அவுட்கள் போன்ற தாமதம் உணர்திறன் வேலைகளில் 1.96 மடங்கு வரையிலும் வேகம் கிடைத்தது என்றும் DeepSeek இன் அறிக்கை கூறுகிறது. மாடலைப் பயிற்றுவித்தது எந்தச் சிப்புகள் என்பதை அது கூறவில்லை.
V4 “இன்னும் என்விடியா சிப்புகளில் பயிற்றுவிக்கப்பட்டது” என்று ChinaTalk இன் ஐரீன் ஜாங், அகிப் ஜகாரியா, ஜோர்டன் ஷ்னைடர் ஏப்ரல் 27 அன்று எழுதினர்; அது அவர்களின் சான்றுகள் குறித்த வாசிப்பு, DeepSeek இன் கூற்று அல்ல. DeepSeek இன் அறிமுக அறிவிப்பில் உள்ள ஒரு அடிக்குறிப்பையும் அதே கட்டுரை மேற்கோள் காட்டுகிறது: “உயர்தரக் கணக்கீட்டு வளக் கட்டுப்பாடுகள் காரணமாக, V4-Pro இன் சேவைத் திறன் தற்போது வரையறுக்கப்பட்டுள்ளது.” 2026 இரண்டாம் பாதியில் ஹுவாவேயின் Ascend 950 சூப்பர்நோட்கள் அதிக அளவில் அனுப்பப்படும்போது Pro இன் விலை குறையும் என்று DeepSeek எதிர்பார்க்கிறது என்றும் அது சேர்க்கிறது.
Ascend இல் வரிசைப்படுத்தல் vLLM-Ascend, xLLM, SGLang வழியாக ஆதரிக்கப்படுகிறது என்று GLM-5.3 அட்டை கூறுகிறது; பயிற்சி வன்பொருளைத் தரவில்லை. தன் சில மதிப்பீடுகள் என்விடியா H20 GPU-க்களில் ஓடின என்று Kimi K3 இன் அட்டை கூறுகிறது.
அமெரிக்கப் பக்கத்தில், பைனான்ஷியல் டைம்ஸை மேற்கோள் காட்டி, பைட்டான்ஸும் டென்சென்ட்டும் ஒவ்வொன்றும் சுமார் 10,000 என்விடியா H200 சிப்புகளைப் பெற்றதாக ஆகஸ்ட் 19 அன்று தி நெக்ஸ்ட் வெப் தெரிவித்தது. அவற்றை நிலப்பகுதிக்கு வெளியே வைத்திருக்குமாறு பெய்ஜிங் நிறுவனங்களிடம் கூறியுள்ளது; ஏற்றுமதிகள் ஹாங்காங் வழியாகச் செல்கின்றன. ஜூலையில், “மிகச் சிலவே” வந்துள்ளன என்று வர்த்தகத் துணைச் செயலாளர் ஜெஃப்ரி கெஸ்லர் காங்கிரஸிடம் கூறினார் என்று தி நெக்ஸ்ட் வெப் சொல்கிறது. கட்டுப்படுத்தப்பட்ட சர்வர்கள் திசைதிருப்பப்படுவது tuput இன் சீனாவுக்கு அனுப்பப்பட்ட சர்வர்கள் தொடர்பான நீதித்துறைக் குற்றப்பத்திரிகை அறிக்கையின் பொருள்.
இடைவெளி பற்றி நான்கு மதிப்பீடுகள்
நிலையான பகுத்தறிவுச் சோதனைகளில் V4-Pro-Max, GPT-5.2 மற்றும் Gemini-3.0-Pro ஐ விஞ்சுகிறது; ஆனால் GPT-5.4 மற்றும் Gemini-3.1-Pro வை விட சிறிதளவு பின்தங்குகிறது என்று DeepSeek இன் அறிக்கை கூறுகிறது. முன்னணியைவிட ஏறக்குறைய 3 முதல் 6 மாதங்கள் பின்தங்கல் என்று அது அதை வாசிக்கிறது.
அமெரிக்க NIST இன் AI தரநிலைகள் மற்றும் புதுமை மையம் (CAISI) V4 Pro வை ஏப்ரலில் சோதித்து, அதன் திறன்கள் முன்னணியை விட ஏறக்குறைய 8 மாதங்கள் பின்தங்கியுள்ளன என்று மே 1 அன்று வெளியிட்டது. பொதுவெளியில் வெளியிடப்படாத இரண்டு உட்பட CAISI இன் ஒன்பது பெஞ்ச்மார்க்குகளில், ஏறக்குறைய 8 மாதங்களுக்கு முன் வெளியான GPT-5 க்கு ஒத்தபடி V4 Pro செயல்பட்டது. ARC-AGI-2 இன் அரை-தனியார் தொகுப்பில் GPT-5.5 இன் 79 சதவீதத்துக்கு எதிராக அது 46 சதவீதம் பெற்றது. தன் பின்தங்கல் எண், திறனை தோராயமாக மதிப்பிடும் ஒரு புள்ளிவிவர மாதிரியிலிருந்து வருகிறது, நேரடி அளவீடு அல்ல என்று CAISI கூறுகிறது.
சீனத் திறந்த-எடை மாடல்கள் மூடிய அமெரிக்க முன்னணியை விட ஏறக்குறைய 2 முதல் 5 மாதங்கள் பின்தங்கியுள்ளன என்று, காங்கிரஸ் விளக்கக் கூட்டத்துக்காகத் தயாரிக்கப்பட்ட சாட்சியத்திலிருந்து விரிவுபடுத்தப்பட்ட ஒரு கட்டுரையில் செப்டம்பர் 21 அன்று நாதன் லாம்பர்ட் எழுதினார். அமெரிக்கத் திறந்த மாடல்கள் OpenAI, ஆன்த்ரோபிக்கை விட 6 முதல் 9 மாதங்கள் பின்தங்கியுள்ளன என்கிறார் அவர். டிஸ்டிலேஷன், அதாவது ஒரு மாடலை இன்னொரு மாடலின் வெளியீடுகளில் பயிற்றுவிப்பது, சீன இடைவெளியை 1 முதல் 2 மாதங்கள் குறைக்கிறது என்று அவர் மதிப்பிடுகிறார்.
2026 ஜனவரி முதல் மிகத் திறன் வாய்ந்த திறந்த-எடை மாடல்கள் எபோக் திறன் குறியீட்டில் மூடிய முன்னணியை விடச் சராசரியாக நான்கு மாதங்கள் பின்தங்கியுள்ளன, கடுமையான சோதனையில் ஆறு மாதங்கள், அதாவது சராசரியாக 8 குறியீட்டுப் புள்ளிகள் இடைவெளி என்று எபோக் AI இன் ஜாக் எட்வர்ட்ஸ், லூக் எம்பர்சன் மே 29 அன்று தெரிவித்தனர். அது சீன மாடல்களை மட்டுமல்ல, திறந்த மாடல்களை பொதுவாக உள்ளடக்குகிறது. தனியார் பெஞ்ச்மார்க்குகளில் திறந்த மாடல்கள் மோசமாக மதிப்பெண் பெறுகின்றன என்றும், தங்கள் மதிப்பீடு உண்மையான இடைவெளியைக் குறைத்துக் காட்டக்கூடும் என்றும் எபோக் சேர்க்கிறது.
ஆதாரங்களும் மேலும் வாசிக்கவும்
- arXiv: DeepSeek-V4, Towards Highly Efficient Million-Token Context Intelligence (technical report, submitted 26 April 2026)
- Hugging Face: DeepSeek-V4-Pro model card
- arXiv: DeepSeek-V3 Technical Report
- Hugging Face: Kimi K3 model card (Moonshot AI)
- Hugging Face: Kimi K3 licence text
- Hugging Face: Qwen3.8-2.4T-A95B model card (Alibaba)
- Hugging Face: Qwen3.8-Max licence text
- Hugging Face: GLM-5.3 model card (Z.ai)
- Hugging Face: GLM-5.3 licence text
- Artificial Analysis: top open-weights models
- Artificial Analysis: leaderboard of all models by Intelligence Index
- Trending Topics: Mistral Large 4 on Artificial Analysis, Eighth Among Open Models (6 October 2026)
- Arena: text leaderboard
- NIST CAISI: Evaluation of DeepSeek V4 Pro (1 May 2026)
- Epoch AI: Open models lag state-of-the-art closed models by 4 months (29 May 2026)
- Interconnects: The current balance of power in open models (Nathan Lambert, 21 September 2026)
- ChinaTalk: DeepSeek V4 (27 April 2026)
- The Next Web: Nvidia's H200 finally reaches Chinese buyers (19 August 2026)
இந்தக் கட்டுரை AI கருவிகளின் உதவியுடன் ஆராயப்பட்டு எழுதப்பட்டு, துல்லியத்திற்காகத் திருத்தப்பட்டது. இது பொதுத் தகவலுக்கும் விவாதத்திற்கும் மட்டுமே, தொழில்முறை ஆலோசனை அல்ல. எங்கள் ஆசிரியர் தரநிலைகள் மற்றும் பொறுப்புத் துறப்பு ஐப் பார்க்கவும். பிழை கண்டீர்களா? எங்களிடம் சொல்லுங்கள்.
பிடித்ததா? அடுத்ததைப் பெறுங்கள்.
ஒரு நேரத்தில் ஒரு நல்ல கட்டுரை, நேரடியாக உங்கள் இன்பாக்ஸுக்கு. ஸ்பேம் இல்லை, எப்போது வேண்டுமானாலும் நிறுத்தலாம்.