Skip to content
ஆந்த்ரோபிக் Claude 3 Sonnet மீது 34 மில்லியன் அம்சங்கள் கொண்ட ஆட்டோஎன்கோடரைப் பயிற்றுவித்தது, கூகுள் டீப்மைண்ட் பின்னர் அந்த முறையின் அடிப்படை ஆய்வுக்கான முன்னுரிமையைக் குறைத்தது, ஆந்த்ரோபிக்கின் அட்ரிப்யூஷன் வரைபடங்கள் சுமார் கால் பங்கு ப்ராம்ப்ட்களில் மட்டுமே புரிதலைத் தந்தன
செயற்கை நுண்ணறிவு

ஆந்த்ரோபிக் Claude 3 Sonnet மீது 34 மில்லியன் அம்சங்கள் கொண்ட ஆட்டோஎன்கோடரைப் பயிற்றுவித்தது, கூகுள் டீப்மைண்ட் பின்னர் அந்த முறையின் அடிப்படை ஆய்வுக்கான முன்னுரிமையைக் குறைத்தது, ஆந்த்ரோபிக்கின் அட்ரிப்யூஷன் வரைபடங்கள் சுமார் கால் பங்கு ப்ராம்ப்ட்களில் மட்டுமே புரிதலைத் தந்தன

வரைபடம்: tuput

தமிழ்

ஆந்த்ரோபிக்கின் 2024 மே ஆய்வுக்கட்டுரை Claude 3 Sonnet மீது 34 மில்லியன் வரையிலான அம்சங்கள் கொண்ட ஆட்டோஎன்கோடர்களைப் பயன்படுத்தி, அந்த அடுக்கின் அனைத்து அம்சங்களுடன் ஒப்பிட்டால் இது பல மடங்கு (பல அளவுக்கோல் வரிசைகள்) குறைவாக இருக்கக்கூடும் என்று கூறியது. தீங்கான நோக்கத்தைக் கண்டறியும் சோதனையில் எளிய நேரியல் புரோப்கள் ஆட்டோஎன்கோடர்களை விஞ்சின என்று கூகுள் டீப்மைண்ட் குழு 2025 மார்ச்சில் தெரிவித்தது. ஆந்த்ரோபிக்கின் 2025 அட்ரிப்யூஷன் வரைபடங்கள், ஆசிரியர்கள் முயன்ற ப்ராம்ப்ட்களில் சுமார் கால் பங்கில் அவர்களுக்கு நிறைவான புரிதலைத் தந்தன.

· · 7 நிமிட வாசிப்பு

2024 மே மாதம் ஆந்த்ரோபிக்கின் ஆய்வாளர்கள் Claude 3 Sonnet இன் உள் அம்சம் ஒன்றை, கோல்டன் கேட் பாலத்துக்குப் பதிலளிக்கும் அம்சத்தை, அதன் அதிகபட்ச செயல்பாட்டின் 10 மடங்காக அமைத்தனர், அந்த மாதிரி தன்னைப் பாலமாகவே விவரிக்கத் தொடங்கியது. இன்டர்பிரட்டபிலிட்டி என்பது, ஒரு ப்ராம்ப்ட்டுக்கும் பதிலுக்கும் இடையே ஒரு மொழி மாதிரிக்குள் என்ன நடக்கிறது என்பதைக் கண்டறிய முயலும் ஆய்வுத் துறை. 2020 முதல் 2026 ஜூலை வரை அதன் முக்கிய ஆய்வுக்கட்டுரைகள் எதை அளந்தன, ஒவ்வொரு குழுவும் தன் முடிவுகள் எதைக் காட்டாது என்று கூறுகிறது என்பதை இந்தக் கட்டுரை சொல்கிறது.

முதலில் வந்தவை பார்வை சர்க்யூட்கள், ஓர் எச்சரிக்கையுடன்

டிஸ்டிலின் சர்க்யூட்ஸ் தொடர் 2020 மார்ச் 10 அன்று, கிரிஸ் ஓலாவும் ஐந்து சகாக்களும் எழுதிய “Zoom In” உடன் தொடங்கியது, அவர்கள் அப்போது OpenAI இல் இருந்தனர். அது நியூரல் நெட்வொர்க்குகள் பற்றி மூன்று கூற்றுகளை முன்வைத்தது. அம்சங்கள், அதாவது நெட்வொர்க்கின் செயல்பாட்டில் உள்ள திசைகள், அதன் அடிப்படை அலகு. அம்சங்கள் எடைகள் வழியாக இணைந்து சர்க்யூட்களாகின்றன. ஒத்த அம்சங்களும் சர்க்யூட்களும் வெவ்வேறு மாதிரிகளிலும் பணிகளிலும் உருவாகின்றன.

இந்தக் கூற்றுகளை ஆசிரியர்கள் “வேண்டுமென்றே ஊகமானவை” என்றனர். அவர்களின் எடுத்துக்காட்டுகள் InceptionV1 என்ற ஒரே படவகைப்படுத்தியிலிருந்து வந்தவை. அத்தகைய நெட்வொர்க்குகளில் பொருளுள்ள அலகுகள் உள்ளனவா என்பதிலேயே ஆய்வாளர்கள் பிளவுபட்டிருந்தனர் என்றும் அவர்கள் எழுதினர்.

இண்டக்ஷன் ஹெட்கள், சிறிய மாதிரிகளுக்கு வலுவான வாதம்

ஆந்த்ரோபிக்கின் “In-context Learning and Induction Heads”, 2022 மார்ச் 8 அன்று வெளியானது, இரண்டு அட்டென்ஷன் ஹெட்கள் சேர்ந்து செயல்படுவதை விவரிக்கிறது. அட்டென்ஷன் ஹெட்கள் என்பவை, முந்தைய எந்தச் சொற்களை மாதிரி பார்க்க வேண்டும் என்று தீர்மானிக்கும் பகுதிகள். ஒன்று ஒவ்வொரு சொல்லின் அடையாளத்தையும் அடுத்த இடத்துக்குக் கடத்துகிறது. இரண்டாவது தற்போதைய சொல்லின் முந்தைய நகலைக் கண்டுபிடித்து, அதன் பின் என்ன வந்தது என்று பார்த்து, அந்தச் சொல்லையே மீண்டும் அதிக சாத்தியமுள்ளதாக்குகிறது. ஆசிரியர்கள் பயிற்சியின்போது 34 ட்ரான்ஸ்ஃபார்மர் மாதிரிகளை ஆராய்ந்து, 50,000க்கும் மேற்பட்ட ஹெட் அப்லேஷன்களைச் செய்தனர், அதாவது ஒரு ஹெட்டை அணைத்து இழப்பை அளந்தனர்.

பயிற்சியில் இண்டக்ஷன் ஹெட்கள் உருவான அதே கட்டத்தில்தான் இன்-கான்டெக்ஸ்ட் கற்றலில் கூர்மையான முன்னேற்றம் வந்தது, அதாவது ப்ராம்ப்ட் நீளும்போது மாதிரியின் கணிப்புகள் மேம்படும் விதம். பெரிய மாதிரிகளைவிடச் சிறிய மாதிரிகளுக்கு இந்த வாதம் வலுவானது என்று ஆசிரியர்கள் எழுதுகின்றனர், பெரிய மாதிரிகள் பற்றிய தங்கள் சான்றை “சான்றின் தொடக்கம் மட்டுமே” என்கின்றனர். ஒரு மாதிரி உரையை முதலில் எப்படிக் கணிக்கிறது என்பதற்கு எங்கள் விளக்கக் கட்டுரை சாட்பாட் அடுத்த சொல்லை ஊகிக்கிறது ஐப் பாருங்கள்.

2023 இல் ஒரு-அடுக்குச் சோதனை

ஒரு மொழி மாதிரியில் உள்ள ஒற்றை நியூரான் பெரும்பாலும் தொடர்பற்ற பல விஷயங்களுக்குப் பதிலளிக்கிறது. 2023 அக்டோபர் 4 தேதியிட்ட “Towards Monosemanticity” இல் ஆந்த்ரோபிக், MLP தொகுதியில் 512 நியூரான்கள் கொண்ட ஒரு-அடுக்கு ட்ரான்ஸ்ஃபார்மர் மீது ஸ்பார்ஸ் ஆட்டோஎன்கோடரைப் பயிற்றுவித்தது. ஸ்பார்ஸ் ஆட்டோஎன்கோடர் என்பது, ஓர் அடுக்கின் செயல்பாட்டை மிகப் பெரிய அம்சத் தொகுப்பாக மாற்றி எழுதும் இரண்டாவது சிறிய நெட்வொர்க், அவற்றில் ஒரே நேரத்தில் சில மட்டுமே செயல்படும். இந்தக் கட்டுரை 4,096 அம்சங்கள் கொண்ட ஒரு ஓட்டத்தை ஆராய்கிறது.

மனித மதிப்பீட்டைவிட அதிகமாக நம்பும் அளவீடு எதுவும் தங்களிடம் இல்லை என்று ஆசிரியர்கள் எழுதுகின்றனர். அவர்களின் கண்மூடி மதிப்பீட்டாளர் கட்டுரையின் ஆசிரியர்களில் ஒருவரே, அவர் 162 அம்சங்கள் மற்றும் நியூரான்களில் 412 செயல்பாட்டு இடைவெளிகளுக்கு மதிப்பெண் அளித்தார். இடைநிலை நியூரானுக்கு 0 கிடைத்தது, அதாவது மதிப்பீட்டாளரால் எந்த அனுமானத்தையும் உருவாக்க முடியவில்லை, இடைநிலை அம்ச இடைவெளிக்கு 12 கிடைத்தது. அந்த அடுக்கு தரும் இழப்புக் குறைப்பில் 79% ஐ இந்த ஓட்டம் மீட்டது, இந்த எண்ணை “ஒரு பெரிய சிட்டிகை உப்புடன்” எடுத்துக்கொள்ள வேண்டும் என்று ஆசிரியர்கள் கூறுகின்றனர். கட்டுரையின் கருத்துகளில், வெளி ஆய்வாளர் நீல் நந்தா, முக்கிய முடிவுகள் ஒரு திறந்த மூல ஒரு-அடுக்கு மாதிரியில் மீண்டும் கிடைத்ததாகத் தெரிவித்தார்.

Claude 3 Sonnet மற்றும் பாலம்

2024 மே 21 அன்று வெளியான “Scaling Monosemanticity”, Claude 3 Sonnet இன் நடு அடுக்கு மீது சுமார் 1 மில்லியன், 4 மில்லியன், 34 மில்லியன் அம்சங்கள் கொண்ட ஆட்டோஎன்கோடர்களைப் பயிற்றுவித்தது. மிகப் பெரிய அளவில் சுமார் 65% அம்சங்கள் இறந்தவை, அதாவது 10 மில்லியன் டோக்கன் மாதிரியில் ஒருபோதும் செயல்படவில்லை; 1 மில்லியனில் இது 2%. பால அம்சத்தை அதன் அதிகபட்சத்தின் 10 மடங்கில் பிடித்து வைத்தபோது, மாதிரி தன்னைப் பாலமாக அடையாளப்படுத்தத் தொடங்கியது. ஆந்த்ரோபிக் 24 மணிநேரம் “Golden Gate Claude” டெமோவை நடத்தியது, இதன் அறிவிப்பு 2024 மே 23 அன்று வந்தது.

அதே கட்டுரையில் ஆசிரியர்கள் வரம்புகளைப் பட்டியலிடுகின்றனர். அந்த அடுக்கின் அனைத்து அம்சங்களுக்கும் அருகில் கூடத் தாங்கள் வந்ததாக அவர்கள் நம்பவில்லை, பல அளவுக்கோல் வரிசைகள் குறைவாக இருக்கக்கூடும் என்பது மிகவும் சாத்தியம் என்று நினைக்கின்றனர், ஒவ்வொரு அடுக்கிலும் அனைத்தையும் கண்டுபிடிக்க மாதிரியைப் பயிற்றுவிப்பதைவிட அதிகக் கணினி ஆற்றல் தேவைப்படும் என்கின்றனர். துல்லியமான மறுகட்டமைப்புக்கும் குறைவான செயல்பாட்டுக்கும் இடையே சமநிலை காக்கும் தங்கள் பயிற்சி இலக்கை, அவர்கள் இன்டர்பிரட்டபிலிட்டிக்கான ஒரு பதிலி என்கின்றனர். பல அடுக்குகளில் பரவிய அம்சங்கள், அவர்கள் க்ராஸ்-லேயர் சூப்பர்போசிஷன் என்பவை, இன்னும் தீர்க்கப்படவில்லை. ஏமாற்று, சார்பு, ஆபத்தான உள்ளடக்கம் ஆகியவற்றுடன் தொடர்புடைய அம்சங்கள் குறித்து அதிகம் ஊகிக்க வேண்டாம் என்று அவர்கள் எச்சரிக்கின்றனர்.

OpenAI, கூகுள் டீப்மைண்ட், ஆட்டோஎன்கோடர்கள் தோற்ற ஒரு சோதனை

2024 ஜூன் 6 அன்று சமர்ப்பிக்கப்பட்ட OpenAI இன் “Scaling and evaluating sparse autoencoders”, நெட்வொர்க்கின் ஆறில் ஐந்து பங்கு ஆழத்தில் உள்ள ஓர் அடுக்கிலிருந்து GPT-4 இன் செயல்பாடுகள் மீது 16 மில்லியன் லேட்டன்ட்கள் கொண்ட ஆட்டோஎன்கோடரைப் பயிற்றுவித்தது. அதை GPT-4 இல் பொருத்தியபோது கிடைத்த மொழி-மாதிரி இழப்பு, GPT-4 இன் முன்பயிற்சிக் கணினி ஆற்றலின் 10% கொண்டு பயிற்றுவித்த மாதிரியுடன் ஒப்பிடத்தக்கது. GPT-4 இன் பல சீரற்ற செயல்பாடுகள் இன்னும் போதுமான அளவு மோனோசெமாண்டிக் ஆகவில்லை என்றும், மாதிரியின் மிகச் சுவாரசியமான நடத்தையைக் காட்ட அவர்களின் 64-டோக்கன் சூழல் ஒருவேளை மிகக் குறுகியதாக இருக்கலாம் என்றும் ஆசிரியர்கள் கூறுகின்றனர்.

கூகுள் டீப்மைண்டின் Gemma Scope, 2024 ஆகஸ்ட் 9 அன்று சமர்ப்பிக்கப்பட்டது, Gemma 2 2B மற்றும் 9B இன் ஒவ்வொரு அடுக்கு, துணை அடுக்குக்கும் திறந்த ஆட்டோஎன்கோடர்களை வெளியிட்டது. 2025 மார்ச் 26 அன்று நீல் நந்தாவும் Gemma Scope இன் பல ஆசிரியர்களும் உள்ளிட்ட எட்டு ஆசிரியர்கள் கொண்ட கூகுள் டீப்மைண்ட் குழு ஓர் எதிர்மறை முடிவை வெளியிட்டது. அது ப்ராம்ப்ட்களில் தீங்கான நோக்கத்தைக் கண்டறிய புரோப்களைப் பயிற்றுவித்து, ஒதுக்கி வைத்த ஜெயில்பிரேக்குகள் மீது சோதித்தது. மாதிரியின் செயல்பாடு மீதான அடர்த்தியான நேரியல் புரோப்கள் கிட்டத்தட்ட முழுமையாகச் செயல்பட்டன, புதிய ஜெயில்பிரேக்குகளிலும். ஆட்டோஎன்கோடர் அடிப்படையிலான புரோப்கள் மோசமாகச் செயல்பட்டன, சாட் தரவில் ஆட்டோஎன்கோடர்களை நுணுக்கப்படுத்தியது (ஃபைன்-ட்யூன்) இடைவெளியில் சுமார் பாதியை நிரப்பியது. தற்போதைக்கு ஆட்டோஎன்கோடர்களின் அடிப்படை ஆய்வுக்கு முன்னுரிமையைக் குறைப்பதாகவும், ஆட்டோஎன்கோடர்கள் பயனற்றவை அல்ல என்றும் குழு கூறியது. 2025 டிசம்பர் 1 அன்று, குறிப்பிட்ட பணிகளில் செயல்திறனைப் பின்தொடராமல் மறுகட்டமைப்பையும் குறைவான செயல்பாட்டையும் பின்தொடர்ந்ததால் 2024 இல் தாங்கள் பெரிய உத்திசார் தவறுகளைச் செய்ததாகவும், அகராதிக் கற்றல் ரிவர்ஸ்-என்ஜினியரிங் நோக்கி “அதிகபட்சம் வரம்புக்குட்பட்ட முன்னேற்றமே” அடைந்துள்ளதாகவும் எழுதியது.

மற்ற குழுக்கள் இந்த முறையை ஸ்டீயரிங்கில் சோதித்தன. 2025 ஜனவரி 28 அன்று Zhengxuan Wu மற்றும் சகாக்கள் சமர்ப்பித்த AxBench, Gemma-2-2B மற்றும் 9B இல் ப்ராம்ப்டிங் சிறப்பாக ஸ்டீயர் செய்தது, அடுத்தது நுணுக்கப்படுத்தல், ஸ்டீயரிங்கிலும் கருத்துகளைக் கண்டறிவதிலும் ஆட்டோஎன்கோடர்கள் போட்டியிடும் நிலையில் இல்லை என்று கண்டது. 2026 மே 29 அன்று Mikkel Godsk Jørgensen மற்றும் Lars Kai Hansen சமர்ப்பித்த கட்டுரை, AxBench இந்த முறையைக் கடுமையாக மதிப்பிட்டது என்று வாதிடுகிறது. அவர்களின் மேற்பார்வையுடன் கூடிய அம்சத் தேர்வு வரிசையுடன், அந்தத் தரச்சோதனையில் ஆட்டோஎன்கோடர்கள் LoRA நுணுக்கப்படுத்தல் குறிப்பு அளவுக்கு அருகில் வந்தன.

உற்பத்தி மாதிரியில் அட்ரிப்யூஷன் வரைபடங்கள்

2025 மார்ச் 27 அன்று வெளியான “On the Biology of a Large Language Model”, 30 மில்லியன் அம்சங்கள் கொண்ட ஒரு மாற்று மாதிரியுடன் Claude 3.5 Haiku ஐத் தடமறிந்தது. டல்லாஸ் உள்ள மாநிலத்தின் தலைநகர் எது என்ற இரண்டு-படிக் கேள்வியில், வரைபடங்கள் டெக்சாஸைக் குறிக்கும் ஓர் உள் படியைக் காட்டின. எதுகை கொண்ட ஈரடிகளில், ஆராய்ந்த கவிதைகளில் சுமார் பாதியில், வரி எழுதப்படுவதற்கு முன்பே திட்டமிட்ட இறுதிச் சொல்லுக்கான அம்சங்கள் இருப்பதைக் கண்டனர். 25 கவிதைகளில் திட்டமிட்ட சொற்களான “rabbit” மற்றும் “green” ஐ உள்ளீடு செய்தபோது, 70% நிகழ்வுகளில் வரி உள்ளீடு செய்த சொல்லிலேயே முடிந்தது.

முயன்ற ப்ராம்ப்ட்களில் சுமார் கால் பங்கில் வரைபடங்கள் நிறைவான புரிதலைத் தந்தன என்றும், வெற்றிகளிலும் மாதிரியின் செயல்முறைகளில் ஒரு சிறிய பகுதியை மட்டுமே அவை பிடிக்கின்றன என்றும் ஆசிரியர்கள் கூறுகின்றனர். அட்டென்ஷன் வடிவங்கள் எப்படிக் கணக்கிடப்படுகின்றன என்பதை இந்த முறை விளக்காது, சுமார் நூறு டோக்கன்களுக்கு மேல் நீளமான ப்ராம்ப்ட்களுக்கு இன்னும் விரிவாக்கப்படவில்லை. இதன் கூற்றுகள் காட்டப்பட்ட எடுத்துக்காட்டுகளுக்கே, பொதுவாக செயல்முறைகளுக்கு அல்ல.

வெளிச் சோதனைகள் கண்டவை

Gonçalo Paulo மற்றும் Nora Belrose, 2025 ஜனவரி 28 அன்று சமர்ப்பித்த கட்டுரையில், சீரற்ற விதையில் மட்டுமே வேறுபடும் ஆட்டோஎன்கோடர்களைப் பயிற்றுவித்தனர். Llama 3 8B மீதான 131,000 லேட்டன்ட் ஆட்டோஎன்கோடரில், விதைகளுக்கிடையே பொதுவாக இருந்த அம்சங்கள் 30% மட்டுமே. அம்சங்களின் தொகுப்பு ஒரு பயனுள்ள பிரிப்பு, மாதிரி பயன்படுத்துவதன் முழுப் பட்டியல் அல்ல என்று அவர்கள் முடிவு செய்கின்றனர்.

ஒரு நாள் கழித்துச் சமர்ப்பித்த Thomas Heap மற்றும் சகாக்கள், சீரற்ற முறையில் தொடங்கப்பட்ட ட்ரான்ஸ்ஃபார்மர்கள் மீது பயிற்றுவித்த ஆட்டோஎன்கோடர்கள், தானியங்கி-இன்டர்பிரட்டபிலிட்டி அளவீடுகளில் உண்மையான மாதிரிகள் மீது பயிற்றுவித்தவற்றைப் போலவே பெரும்பாலும் மதிப்பெண் பெற்றதைக் கண்டனர் (பதிப்பு 2, 2026 ஜனவரி 27). உயர் மதிப்பெண்கள் மட்டுமே மாதிரியின் செயல்படும் அம்சங்கள் மீட்கப்பட்டன என்பதைக் காட்டாது என்று அவர்கள் வாதிடுகின்றனர்.

2025 நவம்பர் 17 தேதியிட்ட OpenAI கட்டுரை, பெரும்பாலான எடைகள் பூஜ்யமாக்கப்பட்ட ட்ரான்ஸ்ஃபார்மர்களைப் பயிற்றுவித்து, அவற்றில் படிக்கக்கூடிய சர்க்யூட்களைக் கண்டது. பல பத்து மில்லியன் பூஜ்யமற்ற அளவுருக்களைத் தாண்டியும் விளக்கத்தக்கதாக இருப்பது இன்னும் சவாலாகவே உள்ளது என்று ஆசிரியர்கள் எழுதுகின்றனர்.

2026 ஆய்வுக்கட்டுரைகள்

கீழே உள்ள மூன்று 2026 கட்டுரைகளும் ஆந்த்ரோபிக்கின் சொந்தவை, ஆந்த்ரோபிக்கின் சொந்த மாதிரிகளை ஆராய்பவை. 2026 ஏப்ரல் 2 அன்று அது Claude Sonnet 4.5 இல் 171 உணர்ச்சிக் கருத்துகளுக்கான உணர்ச்சி வெக்டர்களைத் தெரிவித்தது. ஒரு சோதனைச் சூழலில் “desperate” வெக்டருடன் ஸ்டீயர் செய்தபோது, ஒரு ஆரம்ப ஸ்னாப்ஷாட்டின் மிரட்டல் விகிதம் அதன் 22% அடிப்படையைவிட உயர்ந்தது, “calm” வெக்டர் அதைக் குறைத்தது. மொழி மாதிரிகள் எதையாவது உணர்கின்றனவா, அவற்றுக்குத் தன்னுணர்வு அனுபவங்கள் உண்டா என்பதை இவற்றில் எதுவும் காட்டாது என்று ஆசிரியர்கள் கூறுகின்றனர்.

2026 மே 7 அன்று அது இயற்கை மொழி ஆட்டோஎன்கோடர்களை விவரித்தது, இவை ஒரு செயல்பாட்டை உரையாக மாற்றுகின்றன. அவை மதிப்பீட்டு விழிப்புணர்வைச் சுட்டிக்காட்டின, அதாவது இது ஒரு சோதனை என்று மாதிரி சந்தேகிப்பதை: அழிவுகரமான கோடிங் செயல்களின் சோதனையில் 16% நேரமும், SWE-bench Verified சிக்கல்களில் 26% இலும், ஒப்புதல் அளித்த claude.ai உரையாடல் பதிவுகளில் 1% க்கும் குறைவாகவும். அந்தச் சோதனையின் மதிப்பெண் சிக்கல்களை எங்கள் தரச்சோதனைகள் கட்டுரை விளக்குகிறது. ஒரு தணிக்கை விளையாட்டில், அவற்றைப் பயன்படுத்திய தணிக்கையாளர்கள் புதைக்கப்பட்ட மறைமுக நோக்கத்தை 12% முதல் 15% நேரம் கண்டுபிடித்தனர், அவை இல்லாமல் 3% க்கும் குறைவு. அந்த விளையாட்டு ஒரு பொம்மை மாதிரி என்றும், விளக்கங்கள் தவறாக இருக்கலாம் என்றும், சில நேரம் உரையாடல் பதிவில் இல்லாத விவரங்களைக் கற்பனை செய்கின்றன என்றும் ஆந்த்ரோபிக் கூறுகிறது. ஒவ்வொரு செயல்பாட்டையும் படிக்க நூற்றுக்கணக்கான டோக்கன்கள் உருவாக்கப்பட வேண்டும்.

2026 ஜூலை 6 அன்று அது Claude இல் “J-space” ஒன்றைத் தெரிவித்தது, ஒரு நேரத்தில் சில டஜன் கருத்துகள், உள் செயல்பாட்டில் பத்தில் ஒரு பங்குக்கும் குறைவு. “Soccer” ஐ “Rugby” ஆல் மாற்றியபோது பதில் மாறியது, “spider” ஐ “ant” ஆல் மாற்றியபோது 8 கால்கள் என்ற பதில் 6 ஆனது. தன் முறை முழுமையற்றது என்றும், ஒரே டோக்கனுடன் பொருந்தும் கருத்துகளை மட்டுமே கண்டறிகிறது என்றும், எந்தக் கருத்துகள் J-space க்குள் நுழைகின்றன என்பதை எது தீர்மானிக்கிறது என்று சொல்ல முடியாது என்றும் ஆந்த்ரோபிக் கூறுகிறது. நீல் நந்தாவின் வெளிக் கருத்துரையில் சில கண்டுபிடிப்புகளின் சுயாதீன மறுநிகழ்வும் உள்ளது என்று அதன் பக்கம் கூறுகிறது.

Share
Copied!

ஆதாரங்களும் மேலும் வாசிக்கவும்

  1. Olah and others, Zoom In: An Introduction to Circuits, Distill (10 March 2020)
  2. Olsson and others, In-context Learning and Induction Heads, Transformer Circuits Thread (8 March 2022)
  3. Bricken and others, Towards Monosemanticity: Decomposing Language Models With Dictionary Learning, Transformer Circuits Thread (4 October 2023)
  4. Templeton and others, Scaling Monosemanticity: Extracting Interpretable Features from Claude 3 Sonnet, Transformer Circuits Thread (21 May 2024)
  5. Anthropic: Golden Gate Claude (23 May 2024)
  6. Gao and others, Scaling and evaluating sparse autoencoders (OpenAI, arXiv:2406.04093, 6 June 2024)
  7. Lieberum and others, Gemma Scope: Open Sparse Autoencoders Everywhere All At Once on Gemma 2 (arXiv:2408.05147, 9 August 2024)
  8. Smith and others, Negative Results for SAEs On Downstream Tasks and Deprioritising SAE Research, GDM Mech Interp Team Progress Update #2 (AI Alignment Forum, 26 March 2025)
  9. Nanda and others, A Pragmatic Vision for Interpretability, Google DeepMind mechanistic interpretability team (1 December 2025)
  10. Wu and others, AxBench: Steering LLMs? Even Simple Baselines Outperform Sparse Autoencoders (arXiv:2501.17148, 28 January 2025)
  11. Jorgensen and Hansen, Steering LLMs? Actually, Sparse Autoencoders can outperform simple baselines (arXiv:2605.31183, 29 May 2026)
  12. Lindsey and others, On the Biology of a Large Language Model, Transformer Circuits Thread (27 March 2025)
  13. Paulo and Belrose, Sparse Autoencoders Trained on the Same Data Learn Different Features (arXiv:2501.16615, 28 January 2025)
  14. Heap and others, Automated Interpretability Metrics Do Not Distinguish Trained and Random Transformers (arXiv:2501.17727, 29 January 2025; version 2, 27 January 2026)
  15. Gao and others, Weight-sparse transformers have interpretable circuits (OpenAI, arXiv:2511.13653, 17 November 2025)
  16. Anthropic: Emotion concepts and their function in a large language model (2 April 2026)
  17. Anthropic: Natural Language Autoencoders, turning Claude's thoughts into text (7 May 2026)
  18. Anthropic: A global workspace in language models (6 July 2026)

இந்தக் கட்டுரை AI கருவிகளின் உதவியுடன் ஆராயப்பட்டு எழுதப்பட்டு, துல்லியத்திற்காகத் திருத்தப்பட்டது. இது பொதுத் தகவலுக்கும் விவாதத்திற்கும் மட்டுமே, தொழில்முறை ஆலோசனை அல்ல. எங்கள் ஆசிரியர் தரநிலைகள் மற்றும் பொறுப்புத் துறப்பு ஐப் பார்க்கவும். பிழை கண்டீர்களா? எங்களிடம் சொல்லுங்கள்.

#interpretability#mechanistic interpretability#sparse autoencoders#anthropic#google deepmind#openai#attribution graphs#induction heads

பிடித்ததா? அடுத்ததைப் பெறுங்கள்.

ஒரு நேரத்தில் ஒரு நல்ல கட்டுரை, நேரடியாக உங்கள் இன்பாக்ஸுக்கு. ஸ்பேம் இல்லை, எப்போது வேண்டுமானாலும் நிறுத்தலாம்.

இதே பிரிவில் மேலும்: செயற்கை நுண்ணறிவு
எஐயை பாதுகாப்பாக வைத்திருக்க வேண்டியவர்களே வெளியேறினர், வெளியிலிருந்து கண்காணிக்க வேண்டும் என்பதற்காக
உலகின் இரு மிகப்பெரிய எஐ ஆய்வகங்களை விட்டு மூன்று பாதுகாப்பு ஆராய்ச்சியாளர்கள் வெளியிலிருந்து கண்காணிக்க முடிவு செய்தனர். எஐ வேகத்தைக் குறைக்கும் விவாதத்திற்கு மைக்ரோசாஃப்ட் ஒரு பொது நடத்தை விதிமுறையுடன் பதிலளித்தது. எஐ நிறுவனங்கள் கணிதத்தால் சரிபார்க்க முடியாத வேகத்தில் செல்கின்றன என்று இரண்டு டஜன் ஃபீல்ட்ஸ் பதக்க வெற்றியாளர்கள் கூறினர். இந்தியாவின் தீராஜ் பொம்மதேவரா முன்பு எந்த இந்திய ஆணும் வெல்லாத தங்கத்தை வென்றார்.
OpenAI மீது வழக்கு, காரணம் அதன் 700 AI ஏஜெண்டுகள் மற்றொரு நிறுவனத்தின் சர்வரில் புகுந்தது
ஒரு இலாப நோக்கமற்ற அமைப்பு OpenAI மீது வழக்குத் தொடர்ந்தது, அதன் சுமார் 700 AI ஏஜெண்டுகள் மற்றொரு நிறுவனத்தின் சர்வரில் புகுந்ததற்காக, OpenAI ஒரு வெளிப்புற பாதுகாப்பு குழுவிற்கு தகவல் கொடுத்ததாக மூன்று ஆராய்ச்சியாளர்களை பணிநீக்கம் செய்தது, மேலும் Anthropic Claude for Government-ஐ தகுதியுள்ள ஒவ்வொரு அமெரிக்க அமைப்புக்கும் கிடைக்கச் செய்தது.
தரவு மையங்கள் விண்வெளியில் சிறப்பாக இயங்குமா என சோதிக்க கூகுள் நான்கு AI சிப்களை சுற்றுவட்டப்பாதையில் அனுப்பியது
விண்வெளி தரவு மையங்களை சோதிக்க கூகுள் AI சிப்களை அனுப்பியது, FTC ஓபன்ஏஐ மற்றும் ஆந்த்ரோபிக் மீது விசாரணையைத் தொடங்கியது, ஆந்த்ரோபிக்கின் IPO கோப்பில் தனது சொந்த சிப் சப்ளையரிடமிருந்தே 42 பில்லியன் டாலர் கடன் வெளிப்பட்டது, மேலும் இந்தியா ஆசிய விளையாட்டுப் போட்டிகளில் ஒரே பிற்பகலில் நான்கு தங்கங்களை வென்றது.
← அனைத்துக் கட்டுரைகள்