Skip to content
22 இந்திய மொழிகளில் சுமார் 19% சொல் பிழை என்று சர்வம் கூறுகிறது, மெட்டா 1,600 மொழிகளை உள்ளடக்குகிறது; ஆனால் வெளியிடப்பட்ட பெரும்பாலான பேச்சு மதிப்பெண்கள் உருவாக்கியவர்களிடமிருந்தே வருகின்றன
செயற்கை நுண்ணறிவு

22 இந்திய மொழிகளில் சுமார் 19% சொல் பிழை என்று சர்வம் கூறுகிறது, மெட்டா 1,600 மொழிகளை உள்ளடக்குகிறது; ஆனால் வெளியிடப்பட்ட பெரும்பாலான பேச்சு மதிப்பெண்கள் உருவாக்கியவர்களிடமிருந்தே வருகின்றன

வரைபடம்: tuput

தமிழ்

2026 பிப்ரவரியில் IndicVoices சோதனையில் சர்வத்தின் Saaras V3 சுமார் 19% சொல் பிழை பெற்றது; இந்திக்கு 3.6 எழுத்துப் பிழை விகிதத்தை மெட்டாவின் திறந்த மாதிரி பட்டியலிடுகிறது. இந்தியத் தொலைபேசி அழைப்புகளை அடிப்படையாகக் கொண்ட ஒரே அளவுகோல் தன் சோதனைத் தொகுப்பை தனிப்பட்டதாக வைத்திருக்கிறது; கூகுளும் ஓபன்ஏஐயும் தங்கள் புதிய பேச்சுத் தயாரிப்புகளுக்கான பக்கங்களில் மொழிகளின் எண்ணிக்கையைத் தருகின்றன, ஆனால் இந்திய மொழிகளுக்கான பிழை விகிதங்களைத் தரவில்லை.

· · 6 நிமிட வாசிப்பு

சர்வம் AI இன் Saaras V3 பேச்சு மாதிரி IndicVoices அளவுகோலில் சுமார் 19% சொல் பிழை பெற்றது என்று சர்வத்தின் சொந்த 2026 பிப்ரவரி 11 பதிவு கூறுகிறது. 2025 நவம்பர் 10 அன்று வெளியான மெட்டாவின் திறந்த Omnilingual ASR மாதிரி, தன் முடிவு அட்டவணையில் இந்திக்கு 3.6 எழுத்துப் பிழை விகிதத்தைப் பட்டியலிடுகிறது. இந்த இரண்டு எண்களும் வெவ்வேறு ஒலிப்பதிவுகளில் வெவ்வேறு விஷயங்களை அளக்கின்றன; வெளியிடப்பட்ட மற்ற மதிப்பெண்களில் பெரும்பாலானவற்றையும் ஒரே வரிசையில் வைப்பது அதே அளவு கடினம்.

சொல் பிழை விகிதம் (WER) என்பது மனிதர் எழுதிய படியெடுப்புடன் ஒப்பிடும்போது ஒரு அமைப்பு தவறாகப் பெறும் சொற்களின் பங்கு. எழுத்துப் பிழை விகிதம் (CER) அதற்குப் பதிலாகத் தவறான எழுத்துகளை எண்ணுகிறது. இந்திய மொழிகள் இன்னொரு சிக்கலையும் சேர்க்கின்றன. நெகிழ்வான எழுத்துக்கூட்டலும், சொற்களைப் பிரிப்பதோ சேர்ப்பதோ விருப்பத்தின்படி என்பதும் எளிய WER அமைப்புகளை, பயனர்கள் காண்பதைவிட மோசமாக மதிப்பிடுகின்றன என்று சென்னை ஐஐடியின் மொழித் தொழில்நுட்ப ஆய்வகமான AI4Bharat ஆய்வாளர்கள் 2026 மார்ச் 1 ஆம் தேதிய ஒரு முன்பதிப்பில் எழுதினர்.

சர்வத்தின் 22 மொழி மாதிரிகள்

Saaras V3 இந்தியாவின் 22 அதிகாரபூர்வ மொழிகளையும் ஆங்கிலத்தையும் ஒரே மாதிரியில் கையாளுகிறது. எல்லா மொழிகளுக்கும் IndicVoices இல் சுமார் 19% WER, அதிகம் பேசப்படும் பத்து மொழிகளுக்கு 19.31% என்று சர்வத்தின் பதிவு தருகிறது. 11 மொழிகளை உள்ளடக்கிய முந்தைய Saaras V2.5 அதே தொகுப்பில் சுமார் 22% பெற்றது என்று அது கூறுகிறது.

IndicVoices என்பது AI4Bharat இன் தரவுத்தொகுப்பு. அதன் 2024 கட்டுரை, 22 மொழிகளில் 145 மாவட்டங்களைச் சேர்ந்த 16,237 பேச்சாளர்களிடமிருந்து 7,348 மணி நேரப் பேச்சை விவரிக்கிறது; அவற்றில் 1,639 மணி நேரம் அப்போது படியெடுக்கப்பட்டிருந்தது. GPT-4o Transcribe, Gemini 3 Pro, Deepgram Nova3, ElevenLabs Scribe v2 ஆகியவற்றைத் தான் வெல்லும் போட்டியாளர்களாகச் சர்வத்தின் பதிவு பெயரிடுகிறது, ஆனால் அவற்றுக்கு மதிப்பெண்களை அச்சிடவில்லை. வெளி மதிப்பீட்டாளர் ஒருவரை அந்தப் பதிவு பெயரிடவில்லை.

2026 செப்டம்பர் 25 அன்று Saaras V4 வந்தது. பயனர் முக்கியச் சொற்களை வழங்கும் AI4Bharat சோதனையான IndicContextEval இல் 16.03% WER என்றும், மொழி அடையாளப் பிழை 22 மொழிகளிலும் 5.22% என்றும், முதல் பத்து மொழிகளில் 2.9% என்றும் சர்வம் தெரிவிக்கிறது. V4 இன் துல்லிய முடிவுகளில் பெரும்பாலானவை வரைபடங்களாக மட்டுமே வருகின்றன. ஒத்திசைவான API 30 விநாடிக்குக் குறைவான ஒலியை எடுத்துக்கொள்கிறது; தொகுப்பு வேலைகள் இரண்டு மணி நேரம் வரையிலான கோப்புகளை எடுத்துக்கொள்கின்றன.

2026 பிப்ரவரி 3 அன்று அறிவிக்கப்பட்ட Sarvam Audio ஒரு தனி மாதிரி; சர்வத்தின் 3 பில்லியன் அளவுரு மொழி மாதிரியின் ஒலி நீட்டிப்பு. IndicVoices இல் GPT-4o Transcribe, Gemini 3 Flash ஆகியவற்றுடன் அதை அந்தப் பதிவு ஒப்பிடுகிறது, எண்கள் தரவில்லை; அது இன்னும் பொதுவாகக் கிடைக்கவில்லை என்றும் கூறுகிறது.

சர்வத்தின் ஆய்வாளர் ஒருவரை எழுத்தாளர்களில் ஒருவராகக் கொண்ட, சக மதிப்பாய்வு செய்யப்படாத 2026 மார்ச் AI4Bharat முன்பதிப்பு, எழுத்துக்கூட்டல் மாறுபாடுகள் மதிப்பெண்களை எவ்வளவு சிதைக்கின்றன என்பதை அளந்தது. அதன் எழுத்துக்கூட்டல் அறிந்த WER (OIWER), ஒரு சொல்லின் பட்டியலிடப்பட்ட எந்த எழுத்துக்கூட்டலையும் ஏற்கிறது. ஒரு மாதிரிக்கு அது சராசரியாக 6.3 புள்ளிகள் குறைவாக வந்தது; சராசரி இடைவெளி தமிழுக்கு 14.4 புள்ளிகள், மலையாளத்துக்கு 13.9 புள்ளிகள், மராத்தி, குஜராத்திக்கு சுமார் 5.3.

மெட்டாவின் 1,600 மொழிகள்

Omnilingual ASR 1,600க்கும் மேற்பட்ட மொழிகளை உள்ளடக்குகிறது; அவற்றில் 500க்கும் மேற்பட்டவை இதற்கு முன் AI ஆல் படியெடுக்கப்படவே இல்லை என்று மெட்டா கூறுகிறது. மாதிரிகள் 300 மில்லியனிலிருந்து 7 பில்லியன் அளவுருக்கள் வரை உள்ளன. குறியீடும் மாதிரிகளும் Apache 2.0 உரிமத்தின் கீழ் உள்ளன; கட்டுரையின் டிகோடர் பெரிய மொழி மாதிரிகளிடமிருந்து கடன் வாங்குகிறது. 7 பில்லியன் அளவுரு மாதிரியுடன் 78% மொழிகளுக்கு 10 க்குக் கீழ் CER என்பதே மெட்டாவின் சொந்தத் தலைப்புச் செய்தி.

GitHub இல் உள்ள திட்டத்தின் முடிவு அட்டவணை இந்தியப் படத்தைத் தருகிறது. இந்தி 236.7 மணி நேரப் பயிற்சி ஒலிக்குப் பிறகு 3.6 CER பெறுகிறது; தமிழ் 379.3 மணி நேரத்துக்குப் பிறகு 5.2; வங்காளம் 2.8, ஒடியா 51.8 மணி நேரத்துக்குப் பிறகு 5.8. போஜ்புரிக்கு 5.5 பயிற்சி மணி நேரமும் 16.5 CER உம் உள்ளன. சந்தாலி 0.4 மணி நேரத்தில் 4.9 இல் உள்ளது. சோதனை ஒலிப்பதிவைப் பெயரிடும் நெடுவரிசை அட்டவணையில் இல்லை.

பதிவில் இரண்டு வரம்புகள் உள்ளன. சில எடுத்துக்காட்டுகளிலிருந்து மாதிரிக்குப் புதிய மொழியைக் கற்பிப்பது முழுப் பயிற்சியைவிடத் துல்லியம் குறைவு என்று மெட்டா கூறுகிறது. மேலும் பெரும்பாலான சோதனைச் சேமிப்புப் புள்ளிகள் 40 விநாடி அல்லது அதற்கு மேற்பட்ட துணுக்குகளை நிராகரிக்கின்றன என்று GitHub பக்கம் கூறுகிறது; என்றாலும் 2025 டிசம்பர் புதுப்பிப்பு நீண்ட ஒலிக்கு “Unlimited” வகைகளைச் சேர்த்தது.

மொழிபெயர்ப்புக்கு, 1,600க்கும் மேற்பட்ட மொழிகளை ஆதரிக்கும் முதல் அமைப்பு என்று ஆசிரியர்கள் அழைப்பதை மெட்டாவின் 2026 மார்ச் 17 ஆம் தேதிய Omnilingual MT கட்டுரை விவரிக்கிறது. அதன் 1 பில்லியன் முதல் 8 பில்லியன் அளவுரு மாதிரிகள் 70 பில்லியன் அளவுரு அடிப்படை மாதிரிக்கு இணையாக அல்லது அதைவிட நன்றாகச் செயல்படுகின்றன என்று ஆசிரியர்கள் கூறுகின்றனர். குறைந்த வளமுள்ள மொழியை அடிப்படை மாதிரிகள் அடிக்கடி புரிந்துகொண்டாலும் அதை மோசமாக உருவாக்குகின்றன என்றும் அவர்கள் தெரிவிக்கின்றனர். சுருக்கத்திலும் தான் திறந்த பக்கங்களிலும் மொழிவாரியான இந்திய மதிப்பெண்கள் எதையும் tuput காணவில்லை.

இந்தியத் தொலைபேசி அழைப்புகளை அடிப்படையாகக் கொண்ட ஒரே சோதனை

AI4Bharat உடன் இணைந்து Josh Talks நடத்தும், Interspeech 2026 இல் ஏற்கப்பட்ட Voice of India, 15 மொழிகளில் 36,691 பேச்சாளர்களின் 536 மணி நேர எழுதப்படாத தொலைபேசிப் பேச்சைப் பயன்படுத்துகிறது. செல்லுபடியாகும் எழுத்துக்கூட்டல்களின் ஒரு வலைப்பின்னலான OI-WER மூலம் அது மதிப்பிடுகிறது. முக்கியச் சோதனைத் தொகுப்பு தனிப்பட்டது, எனவே வெளியாட்கள் முடிவுகளை மீண்டும் உருவாக்க முடியாது; ஒரு சிறிய பொது மாதிரி மட்டுமே திட்டமிடப்பட்டுள்ளது.

Josh Talks இன் 2026 ஏப்ரல் விவரிப்பு தன் அட்டவணையில் 15 அமைப்புகளை மதிப்பிடுகிறது. இவை OI-WER சதவீதங்கள்; குறைவாக இருப்பது நல்லது.

மாதிரிஇந்திவங்காளம்தமிழ்
Sarvam Audio5.06.014.2
Gemini 3 Pro6.08.515.7
ElevenLabs Scribe v27.710.020.4
IndicConformer (AI4Bharat)8.210.719.9
OmniASR LLM 7B (Meta)13.722.843.1
GPT-4o Transcribe34.044.864.2

சர்வத்தின் தயாரிப்பான Sarvam Audio மூன்றிலும் முதலிடத்தில் உள்ளது. GPT-4o Transcribe என்பது 2025 மார்ச்சில் வந்த ஓபன்ஏஐ மாதிரி. அது வெளியானபோது, ஓபன்ஏஐயின் உள் அளவுகோலை மேற்கோள் காட்டி, தமிழ், தெலுங்கு, மலையாளம், கன்னடத்துக்கு 30% ஐ நெருங்கும் சொல் பிழை விகிதத்தை TechCrunch தெரிவித்தது. அது Voice of India வின் சோதனையிலிருந்து வேறுபட்ட சோதனை.

அந்த விவரிப்பு தனது சொந்த வரம்புகளைப் பட்டியலிடுகிறது. மதிப்பீட்டு வலைப்பின்னல்களுக்குப் பின்னால் உள்ள அனுமானங்கள் அடையாளம் காணும் மாதிரிகளின் ஓர் உள் கூட்டமைப்பிலிருந்து வருகின்றன. பெயர்க்கூறுகள், துறைச் சொற்கள், எண்கள் இன்னும் சோதிக்கப்படவில்லை. பெண் பேச்சாளர்களுடன் ஒப்பிடும்போது ஆண் பேச்சாளர்களுக்கு சுமார் 19 முதல் 21% சார்பு பிழை அபராதம் தெரிகிறது.

Bodhan இன் செப்டம்பர் வெளியீடும் பொருந்தாத எண்களும்

AI4Bharat, NVIDIA ஆகியவற்றுடன் இணைந்து பணியாற்றும், சென்னை ஐஐடியால் அடைகாக்கப்பட்ட குழுவான Bodhan AI, 2026 செப்டம்பரில் பேச்சு அறிதலுக்கான திறந்த மாதிரிகளான Indic-Transcribe ஐ வெளியிட்டது. Voice of India வில் சராசரி OIWER 8.7 என்று Core மாதிரியின் அட்டை தெரிவிக்கிறது; Saaras V3 க்கு 10.7, IndicConformer க்கு 17.8, Gemini 3 Pro வுக்கு 21.1. அது 25 மொழிகளை உள்ளடக்குகிறது: ஆங்கிலம், 22 அட்டவணை மொழிகள், போஜ்புரி, பிலி. மதிப்பீட்டை யார் நடத்தினார்கள் என்பதை அந்த அட்டை சொல்லவில்லை.

அட்டை தன் வரம்புகளைப் பட்டியலிடுகிறது. இது 30 விநாடி வரையிலான துணுக்குகளில் பயிற்சி பெற்றது, அந்தந்த மொழியின் சொந்த எழுத்தில் மட்டும் வெளியிடுகிறது, ஒரே பேச்சாளர் என்று கருதுகிறது. தானியங்கி மொழி அடையாளம் சீராக இல்லை; போஜ்புரி, மைதிலி, உருது அடிக்கடி இந்தியில் உறிஞ்சப்படுகின்றன.

அதே மாதிரிகள் குறித்து Bodhan அட்டையும் Josh Talks பக்கமும் வேறுபடுகின்றன. Josh Talks அட்டவணையில் 6.0 மற்றும் 13.7 இருக்கும் இடத்தில், இந்திக்கு Gemini 3 Pro வுக்கு 9.3 உம் OmniASR LLM 7B க்கு 9.6 உம் அட்டை தருகிறது. வேறுபாட்டை எந்தப் பக்கமும் விளக்கவில்லை, எனவே இரண்டிலிருந்தும் வரும் மதிப்பெண்களை ஒன்றாகச் சேர்க்க முடியாது.

கூகுளும் ஓபன்ஏஐயும் மொழி எண்ணிக்கைகளை வெளியிடுகின்றன

2026 அக்டோபர் 7 அன்று புதுப்பிக்கப்பட்ட கூகுளின் Chirp 3 ஆவணங்கள், இந்தியையும் இந்திய ஆங்கிலத்தையும் பொதுவாகக் கிடைப்பவையாகப் பட்டியலிடுகின்றன. மேலும் பத்து இந்திய மொழிகள் முன்னோட்டத்தில் உள்ளன: அசாமியம், வங்காளம், குஜராத்தி, கன்னடம், மலையாளம், மராத்தி, ஒடியா, பஞ்சாபி, தமிழ், தெலுங்கு. உருது தோன்றவில்லை. பக்கம் எந்தப் பிழை விகிதங்களையும் தரவில்லை.

2026 ஜூன் 9 அன்று அறிவிக்கப்பட்ட கூகுளின் Gemini 3.5 Live Translate, 70 அல்லது அதற்கு மேற்பட்ட மொழிகளிலிருந்து பேச்சை மொழிபெயர்க்கிறது; பேச்சாளரின் வேகத்தையும் சுருதியையும் தக்கவைக்க முயல்கிறது. கூகுள் மீட்டின் பேச்சு மொழிபெயர்ப்பு ஐந்து மொழிகளிலிருந்து 70 அல்லது அதற்கு மேற்பட்டவையாக வளர்கிறது; ஆங்கிலம் மட்டுமுள்ள இணைகளிலிருந்து ஒரே கூட்டத்தில் 2,000க்கும் மேற்பட்ட மொழிச் சேர்க்கைகளுக்கு விரிகிறது. மொழிபெயர்ப்பு பேச்சாளரைவிட சில விநாடிகள் பின்தங்கியே இருக்கும் என்று பதிவு கூறுகிறது; எந்த அளவுகோல் எண்ணையோ இந்திய மொழிப் பெயர்களையோ அது அச்சிடவில்லை.

2026 மே மாதம் செய்தியாக வந்த ஓபன்ஏஐயின் gpt-realtime-translate, 70க்கும் மேற்பட்ட மொழிகளில் பேச்சை ஏற்கிறது; அதன் Cookbook பட்டியலில் இந்தி, வங்காளம், குஜராத்தி, மலையாளம், பஞ்சாபி, தெலுங்கு உள்ளன. பேச்சு வெளியீடு 13 மொழிகளில் வருகிறது, அவற்றில் இந்தி மட்டுமே இந்திய மொழி. மாதிரி தவறான பெயர்களையோ பொருள்களையோ மாற்றி இடலாம் என்று ஓபன்ஏஐயின் Cookbook எச்சரிக்கிறது; தாமதக் கணக்குகளை அது தரவில்லை.

இந்தியா தன் சொந்த மொழிகளில் AI கட்டமைக்கும் முயற்சியில் விவரிக்கப்பட்ட அரசு தளமான பாஷினியும் பேச்சுச் சேவைகளை வழங்குகிறது. அதன் மாதிரிகளுக்கு வெளியிடப்பட்ட பிழை விகிதங்கள் எதையும் tuput காணவில்லை, எனவே இங்கே அது மதிப்பிடப்படவில்லை. படியெடுப்புக்கும் மொழிபெயர்ப்புக்கும் உச்ச நீதிமன்றம் தானே AI ஐப் பயன்படுத்துவது இந்திய நீதிமன்றங்களில் AI கட்டுரையில் விவரிக்கப்பட்டுள்ளது.

பெயர்க்கூறு, துறை சார்ந்த, எண் மதிப்பீடுகளை எதிர்காலப் பணியாக Josh Talks விவரிப்பு பட்டியலிடுகிறது; எனவே மேலே உள்ள எந்த மதிப்பெண்ணும் பெயர்கள், துறைச் சொற்கள், இலக்கங்களை உள்ளடக்கவில்லை.

Share
Copied!

ஆதாரங்களும் மேலும் வாசிக்கவும்

  1. Meta AI: Omnilingual ASR, advancing automatic speech recognition (10 November 2025)
  2. arXiv: Omnilingual ASR, Open-Source Multilingual Speech Recognition for 1600+ Languages (12 November 2025)
  3. GitHub: facebookresearch/omnilingual-asr, code, model list and 7B per-language results table
  4. arXiv: Omnilingual MT, Machine Translation for 1,600 Languages (17 March 2026)
  5. Sarvam AI: Saaras V3 speech recognition (11 February 2026)
  6. Sarvam AI: Introducing Saaras V4 (25 September 2026)
  7. Sarvam AI: Sarvam Audio (3 February 2026)
  8. arXiv: IndicVoices, Towards building an Inclusive Multilingual Speech Dataset for Indian Languages (4 March 2024)
  9. arXiv: Towards Orthographically-Informed Evaluation of Speech Recognition Systems for Indian Languages (1 March 2026)
  10. arXiv: Voice of India, A Large-Scale Benchmark for Real-World Speech Recognition in India (21 April 2026)
  11. Josh Talks AI: Voice of India, Building India's National ASR Benchmark (April 2026)
  12. Hugging Face: Bodhan AI Indic-Transcribe-core model card (September 2026)
  13. DT Next: IIT-M-incubated Bodhan AI unveils open models for Indian languages (12 September 2026)
  14. Google Cloud: Chirp 3 transcription model documentation (last updated 7 October 2026)
  15. Google: Fluid, natural voice translation with Gemini 3.5 Live Translate (9 June 2026)
  16. OpenAI Cookbook: Build Live Translation Apps with gpt-realtime-translate
  17. Quantum Zeitgeist: OpenAI's New Model Translates 70+ Languages in Realtime (11 May 2026)
  18. TechCrunch: OpenAI upgrades its transcription and voice-generating AI models (20 March 2025)

இந்தக் கட்டுரை AI கருவிகளின் உதவியுடன் ஆராயப்பட்டு எழுதப்பட்டு, துல்லியத்திற்காகத் திருத்தப்பட்டது. இது பொதுத் தகவலுக்கும் விவாதத்திற்கும் மட்டுமே, தொழில்முறை ஆலோசனை அல்ல. எங்கள் ஆசிரியர் தரநிலைகள் மற்றும் பொறுப்புத் துறப்பு ஐப் பார்க்கவும். பிழை கண்டீர்களா? எங்களிடம் சொல்லுங்கள்.

#speech recognition#machine translation#indic languages#sarvam ai#omnilingual asr#voice of india#ai4bharat#live translation

பிடித்ததா? அடுத்ததைப் பெறுங்கள்.

ஒரு நேரத்தில் ஒரு நல்ல கட்டுரை, நேரடியாக உங்கள் இன்பாக்ஸுக்கு. ஸ்பேம் இல்லை, எப்போது வேண்டுமானாலும் நிறுத்தலாம்.

இதே பிரிவில் மேலும்: செயற்கை நுண்ணறிவு
IndiaAI திட்டத்திடம் மணிக்கு ₹65 வாடகையில் 38,000க்கும் மேற்பட்ட GPUக்களும், நிதி பெற்ற 12 மாதிரி உருவாக்குநர்களும் உள்ளன, ஆனால் அதன் 2025-26 பட்ஜெட் ₹2,000 கோடியிலிருந்து ₹800 கோடியாகக் குறைத்து திருத்தப்பட்டது
கம்ப்யூட் மலிவாக உள்ளது, முதல் மாதிரிகள் வெளிவந்துவிட்டன, பட்ஜெட் வரி சிறியது. திட்டத்தின் ஒவ்வொரு தூணையும் பற்றி அரசின் சொந்த ஆவணங்கள் என்ன சொல்கின்றன, Carnegie India, Takshashila மற்றும் IISc தொடர்புடைய ஒரு ஆராய்ச்சித் தலைவர் எங்கே மறுக்கிறார்கள்.
உலகம் முதலில் ஆங்கிலத்தில் AI-யை உருவாக்கியது. இந்தியா இப்போதுதான் தன் சொந்த மொழிகளில் ஒன்றை உருவாக்க 1.25 பில்லியன் டாலர் செலவழித்தது
ஒரு அரசு திட்டம் சந்தை விலையில் ஒரு பகுதிக்கு கிட்டத்தட்ட அறுபதாயிரம் GPUக்களை இந்திய ஸ்டார்ட்அப்களுக்கு வாடகைக்கு விடுகிறது, மேலும் ChatGPT இன்னும் தடுமாறும் மொழிகளில் ஒரு மொழிபெயர்ப்பு தளம் தினமும் கோடிக்கணக்கான கோரிக்கைகளைக் கையாள்கிறது. ஒவ்வொரு பந்தயமும் இன்னும் பலனளிக்கவில்லை.
Scale நிறுவனத்தின் SWE-Bench Pro பட்டியல் சிறந்த கோடிங் ஏஜெண்டை 61.5%இல் வைக்கிறது; சோதனைகளில் தேறும் பல திருத்தங்களைப் பராமரிப்பாளர்கள் நிராகரிக்கின்றனர்; ஏஜெண்டுகள் எவ்வளவு நேரத்தைச் சேமிக்கின்றன என்பதைத் தனது சமீபத்திய சோதனையால் காட்ட முடியவில்லை என்று METR கூறுகிறது
பென்ச்மார்க்குகள் ஏஜெண்டுகள் வலிமையானவை என்கின்றன. பராமரிப்பாளர்களும், ஒரு சீரற்ற சோதனையும், ஒரு குவியல் சம்பவ அறிக்கைகளும் படம் குறுகியது என்கின்றன. ஒவ்வொரு எண்ணும் உண்மையில் எதை அளக்கிறது என்பது இங்கே.
← அனைத்துக் கட்டுரைகள்