चित्रण: tuput
हिन्दी
Anthropic के मई 2024 के शोध-पत्र ने Claude 3 Sonnet पर 34 मिलियन तक फ़ीचर वाले ऑटोएनकोडर इस्तेमाल किए और कहा कि वह उस परत के कुल फ़ीचर से संभवतः कई गुना पीछे है। गूगल डीपमाइंड की टीम ने मार्च 2025 में बताया कि हानिकारक इरादे की जाँच में सीधे रैखिक प्रोब ऑटोएनकोडर से बेहतर निकले। Anthropic के 2025 के एट्रिब्यूशन ग्राफ़ ने लेखकों को आज़माए गए प्रॉम्प्ट में से लगभग एक चौथाई पर संतोषजनक समझ दी।
मई 2024 में Anthropic के शोधकर्ताओं ने Claude 3 Sonnet के एक आंतरिक फ़ीचर को, जो गोल्डन गेट ब्रिज पर प्रतिक्रिया करता है, उसकी अधिकतम सक्रियता के 10 गुना पर रखा, और मॉडल ख़ुद को पुल बताकर बात करने लगा। इंटरप्रिटेबिलिटी वह शोध-क्षेत्र है जो यह पता लगाने की कोशिश करता है कि किसी भाषा मॉडल के भीतर प्रॉम्प्ट और जवाब के बीच क्या होता है। यह लेख बताता है कि 2020 से जुलाई 2026 तक इसके मुख्य शोध-पत्रों ने क्या नापा, और हर टीम के अनुसार उसके नतीजे क्या नहीं दिखाते।
पहले विज़न सर्किट आए, एक चेतावनी के साथ
डिस्टिल का सर्किट्स सिलसिला 10 मार्च 2020 को क्रिस ओला और पाँच साथियों के “Zoom In” से शुरू हुआ, जो तब OpenAI में थे। उसने न्यूरल नेटवर्क के बारे में तीन दावे किए। फ़ीचर, यानी नेटवर्क की गतिविधि की दिशाएँ, उसकी बुनियादी इकाई हैं। फ़ीचर वज़न के ज़रिए जुड़कर सर्किट बनाते हैं। मिलते-जुलते फ़ीचर और सर्किट अलग-अलग मॉडलों और कामों में बनते हैं।
लेखकों ने इन दावों को “जान-बूझकर अटकलबाज़” कहा। उनके उदाहरण एक ही इमेज क्लासिफ़ायर, InceptionV1, से आए थे। उन्होंने यह भी लिखा कि शोधकर्ता इस पर बँटे हुए थे कि ऐसे नेटवर्कों में अर्थपूर्ण इकाइयाँ हैं भी या नहीं।
इंडक्शन हेड, और छोटे मॉडलों के लिए ज़्यादा मज़बूत मामला
Anthropic का “In-context Learning and Induction Heads”, जो 8 मार्च 2022 को छपा, दो अटेंशन हेड के साथ काम करने का वर्णन करता है, यानी मॉडल के वे हिस्से जो तय करते हैं कि वह पहले के किन शब्दों को देखे। एक हर शब्द की पहचान अगली जगह तक पहुँचाता है। दूसरा मौजूदा शब्द की पहले की प्रति ढूँढता है, देखता है कि उसके बाद क्या आया था, और उसी शब्द को फिर से ज़्यादा संभावित बना देता है। लेखकों ने प्रशिक्षण के दौरान 34 ट्रांसफ़ॉर्मर मॉडलों का विश्लेषण किया और 50,000 से ज़्यादा हेड एब्लेशन चलाए, यानी एक हेड को बंद करके नुकसान नापना।
इंडक्शन हेड प्रशिक्षण में उसी बिंदु पर बने जहाँ इन-कॉन्टेक्स्ट लर्निंग में तेज़ उछाल आया, यानी जिस तरह प्रॉम्प्ट लंबा होने पर मॉडल के अनुमान बेहतर होते हैं। लेखक लिखते हैं कि मामला बड़े मॉडलों से ज़्यादा छोटे मॉडलों के लिए मज़बूत है और बड़े मॉडलों के अपने सबूत को “सिर्फ़ सबूत की शुरुआत” कहते हैं। मॉडल पहली बार में पाठ का अनुमान कैसे लगाता है, इसके लिए हमारा चैटबॉट अगला शब्द क्यों अनुमान लगाता है वाला व्याख्यात्मक लेख देखें।
2023 में एक-परत की जाँच
भाषा मॉडल का एक अकेला न्यूरॉन अक्सर कई असंबंधित चीज़ों पर प्रतिक्रिया करता है। 4 अक्टूबर 2023 के “Towards Monosemanticity” में Anthropic ने अपने MLP ब्लॉक में 512 न्यूरॉन वाले एक-परत ट्रांसफ़ॉर्मर पर विरल ऑटोएनकोडर प्रशिक्षित किया। विरल ऑटोएनकोडर एक दूसरा छोटा नेटवर्क है जो किसी परत की गतिविधि को फ़ीचर के कहीं बड़े समूह में दोबारा लिखता है, जिसमें एक समय में कुछ ही सक्रिय होते हैं। शोध-पत्र 4,096 फ़ीचर वाले एक रन का अध्ययन करता है।
लेखक लिखते हैं कि उनके पास ऐसा कोई पैमाना नहीं जिस पर वे इंसानी परख से ज़्यादा भरोसा करें। उनका ब्लाइंड एनोटेटर शोध-पत्र के अपने ही एक लेखक थे, जिन्होंने 162 फ़ीचर और न्यूरॉन के 412 सक्रियता-अंतरालों को अंक दिए। औसत (मध्य) न्यूरॉन का अंक 0 रहा, यानी एनोटेटर कोई परिकल्पना नहीं बना सका, और औसत फ़ीचर-अंतराल का अंक 12। उस रन ने परत से मिलने वाली हानि-कमी का 79% लौटाया, एक आँकड़ा जिसे लेखक “काफ़ी नमक के साथ” लेने को कहते हैं। शोध-पत्र की टिप्पणियों में बाहरी शोधकर्ता नील नंदा ने बताया कि मुख्य नतीजे एक ओपन-सोर्स एक-परत मॉडल पर दोहराए जा सके।
Claude 3 Sonnet और पुल
21 मई 2024 के “Scaling Monosemanticity” ने Claude 3 Sonnet की एक बीच की परत पर लगभग 1 मिलियन, 4 मिलियन और 34 मिलियन फ़ीचर वाले ऑटोएनकोडर प्रशिक्षित किए। सबसे बड़े आकार पर लगभग 65% फ़ीचर मृत थे, यानी 10 मिलियन टोकन के नमूने में कभी सक्रिय नहीं हुए, जबकि 1 मिलियन पर यह 2% था। पुल वाले फ़ीचर को उसके अधिकतम के 10 गुना पर जकड़ देने से मॉडल ख़ुद को पुल बताने लगा। Anthropic ने 24 घंटे के लिए “Golden Gate Claude” डेमो चलाया, जिसकी घोषणा 23 मई 2024 को हुई।
लेखक उसी शोध-पत्र में सीमाएँ गिनाते हैं। वे नहीं मानते कि उस परत के सारे फ़ीचर के आसपास भी पहुँचे हैं, उन्हें काफ़ी संभावना लगती है कि वे कई गुना पीछे हैं, और कहते हैं कि हर परत में सब फ़ीचर ढूँढने के लिए मॉडल को प्रशिक्षित करने से ज़्यादा कंप्यूट लगेगा। वे अपने प्रशिक्षण-उद्देश्य को, जो सटीक पुनर्निर्माण और विरलता के बीच संतुलन रखता है, इंटरप्रिटेबिलिटी का एक प्रॉक्सी कहते हैं। कई परतों में फैले फ़ीचर, जिन्हें वे क्रॉस-लेयर सुपरपोज़िशन कहते हैं, अनसुलझे हैं। छल, पूर्वाग्रह और ख़तरनाक सामग्री से जुड़े फ़ीचर के बारे में वे बहुत ज़्यादा निष्कर्ष निकालने से सावधान करते हैं।
OpenAI, गूगल डीपमाइंड और एक जाँच जो ऑटोएनकोडर हार गए
OpenAI के “Scaling and evaluating sparse autoencoders” ने, जो 6 जून 2024 को जमा हुआ, GPT-4 की सक्रियताओं पर नेटवर्क में पाँच-छठे हिस्से की गहराई वाली एक परत से 16 मिलियन लेटेंट वाला ऑटोएनकोडर प्रशिक्षित किया। उसे GPT-4 में डालने पर भाषा-मॉडलिंग हानि उस मॉडल जैसी आई जो GPT-4 के प्रीट्रेनिंग कंप्यूट के 10% से प्रशिक्षित हो। लेखक कहते हैं कि GPT-4 की बहुत सी यादृच्छिक सक्रियताएँ अभी पर्याप्त रूप से एकार्थी (मोनोसिमैंटिक) नहीं हैं और उनका 64 टोकन का संदर्भ मॉडल के सबसे दिलचस्प व्यवहार को दिखाने के लिए बहुत छोटा हो सकता है।
गूगल डीपमाइंड के Gemma Scope ने, जो 9 अगस्त 2024 को जमा हुआ, Gemma 2 2B और 9B की हर परत और उप-परत के लिए खुले ऑटोएनकोडर जारी किए। 26 मार्च 2025 को गूगल डीपमाइंड की आठ लेखकों की एक टीम ने, जिसमें नील नंदा और Gemma Scope के कई लेखक थे, एक नकारात्मक नतीजा पोस्ट किया। उसने प्रॉम्प्ट में हानिकारक इरादा पकड़ने के लिए प्रोब प्रशिक्षित किए और उन्हें रोके गए जेलब्रेक पर परखा। मॉडल की गतिविधि पर सघन रैखिक प्रोब लगभग पूरी तरह सही रहे, नए जेलब्रेक पर भी। ऑटोएनकोडर पर आधारित प्रोब का प्रदर्शन ख़राब रहा, और ऑटोएनकोडर को चैट डेटा पर फ़ाइन-ट्यून करने से लगभग आधा अंतर पटा। टीम ने कहा कि वह फ़िलहाल ऑटोएनकोडर के बुनियादी शोध को पीछे रख रही है और ऑटोएनकोडर बेकार नहीं हैं। 1 दिसंबर 2025 को उसने लिखा कि 2024 में उससे बड़ी रणनीतिक ग़लतियाँ हुईं, क्योंकि वह तय कामों पर प्रदर्शन की जगह पुनर्निर्माण और विरलता को देखती रही, और कि डिक्शनरी लर्निंग ने रिवर्स-इंजीनियरिंग की दिशा में “ज़्यादा से ज़्यादा सीमित प्रगति” की है।
दूसरे समूहों ने इस तरीक़े को स्टीयरिंग पर परखा। 28 जनवरी 2025 को जमा हुए AxBench में झेंगशुआन वू और साथियों ने Gemma-2-2B और 9B पर पाया कि प्रॉम्प्टिंग से स्टीयरिंग सबसे अच्छी रही, उसके बाद फ़ाइन-ट्यूनिंग, और ऑटोएनकोडर स्टीयरिंग या अवधारणाएँ पकड़ने में मुक़ाबले में नहीं थे। 29 मई 2026 को जमा हुआ मिक्केल गोड्स्क जॉर्गेन्सन और लार्स काई हैनसन का एक शोध-पत्र तर्क देता है कि AxBench ने इस तरीक़े के साथ सख़्ती बरती। उनकी निगरानी-वाली फ़ीचर-चयन पाइपलाइन के साथ ऑटोएनकोडर उस बेंचमार्क पर LoRA फ़ाइन-ट्यूनिंग वाले संदर्भ के क़रीब पहुँचे।
एक प्रोडक्शन मॉडल में एट्रिब्यूशन ग्राफ़
27 मार्च 2025 के “On the Biology of a Large Language Model” ने Claude 3.5 Haiku को 30 मिलियन फ़ीचर वाले एक प्रतिस्थापन मॉडल से खँगाला। डलास वाले राज्य की राजधानी के दो-क़दम वाले सवाल में ग्राफ़ ने टेक्सास को दर्शाता एक आंतरिक चरण दिखाया। तुकबंदी वाले दोहों में उन्हें पंक्ति लिखे जाने से पहले ही योजनाबद्ध अंतिम शब्द के फ़ीचर मिले, जाँचे गए लगभग आधे पद्यों में। 25 पद्यों में योजनाबद्ध शब्द “rabbit” और “green” डालने पर 70% मामलों में पंक्ति डाले गए शब्द पर ख़त्म हुई।
लेखक कहते हैं कि ग्राफ़ ने आज़माए गए प्रॉम्प्ट में से लगभग एक चौथाई पर संतोषजनक समझ दी, और सफलताओं में भी वे मॉडल की प्रक्रियाओं के बहुत छोटे हिस्से को पकड़ते हैं। यह तरीक़ा नहीं समझाता कि अटेंशन पैटर्न कैसे निकलते हैं, और लगभग सौ टोकन से लंबे प्रॉम्प्ट तक उसे नहीं बढ़ाया गया था। उसके दावे दिखाए गए उदाहरणों पर लागू होते हैं, आम प्रक्रियाओं पर नहीं।
बाहरी जाँचों ने क्या पाया
गोंसालो पाउलो और नोरा बेलरोज़ ने 28 जनवरी 2025 को जमा हुए एक शोध-पत्र में ऐसे ऑटोएनकोडर प्रशिक्षित किए जो सिर्फ़ रैंडम सीड में अलग थे। Llama 3 8B पर 131,000 लेटेंट वाले ऑटोएनकोडर में सिर्फ़ 30% फ़ीचर अलग-अलग सीड में साझा थे। वे निष्कर्ष निकालते हैं कि फ़ीचर का समूह एक काम का अपघटन है, मॉडल जो कुछ इस्तेमाल करता है उसकी पूरी सूची नहीं।
थॉमस हीप और साथियों ने, जो एक दिन बाद जमा हुआ, पाया कि यादृच्छिक रूप से शुरू किए ट्रांसफ़ॉर्मरों पर प्रशिक्षित ऑटोएनकोडर अक्सर स्वचालित इंटरप्रिटेबिलिटी पैमानों पर लगभग उतना ही अच्छा अंक पाते थे जितना असली मॉडलों पर प्रशिक्षित (संस्करण 2, 27 जनवरी 2026)। वे तर्क देते हैं कि सिर्फ़ ऊँचे अंक यह नहीं दिखाते कि मॉडल के काम करने वाले फ़ीचर वापस पाए गए।
OpenAI के 17 नवंबर 2025 के शोध-पत्र ने ऐसे ट्रांसफ़ॉर्मर प्रशिक्षित किए जिनके ज़्यादातर वज़न शून्य रखे गए थे, और उनमें पढ़े जा सकने वाले सर्किट मिले। लेखक लिखते हैं कि दसियों मिलियन ग़ैर-शून्य पैरामीटर से आगे बढ़ना और फिर भी व्याख्या-योग्य रहना एक चुनौती बना हुआ है।
2026 के शोध-पत्र
नीचे के तीनों 2026 के शोध-पत्र Anthropic के अपने हैं, और Anthropic के अपने मॉडलों का अध्ययन करते हैं। 2 अप्रैल 2026 को उसने Claude Sonnet 4.5 में 171 भाव-अवधारणाओं के इमोशन वेक्टर बताए। “desperate” वेक्टर से स्टीयरिंग ने एक परीक्षण-परिदृश्य में एक शुरुआती स्नैपशॉट की ब्लैकमेल दर को उसके 22% के आधार स्तर से ऊपर कर दिया, और “calm” वेक्टर ने घटा दिया। लेखक कहते हैं कि इसमें से कुछ भी यह नहीं दिखाता कि भाषा मॉडल कुछ महसूस करते हैं या उनके व्यक्तिगत अनुभव होते हैं।
7 मई 2026 को उसने नैचुरल लैंग्वेज ऑटोएनकोडर बताए, जो किसी सक्रियता को पाठ में बदलते हैं। उन्होंने मूल्यांकन-जागरूकता का संकेत दिया, यानी मॉडल को परीक्षण का शक होना: विनाशकारी कोडिंग कार्रवाइयों की एक जाँच में 16% बार और SWE-bench Verified की 26% समस्याओं पर, जबकि claude.ai के सहमति देने वाले ट्रांसक्रिप्ट में 1% से कम। उस परीक्षण की अंक-समस्याएँ हमारा बेंचमार्क वाला लेख बताता है। एक ऑडिटिंग खेल में उनका इस्तेमाल करने वाले ऑडिटरों ने रोपा हुआ छिपा मक़सद 12% से 15% बार ढूँढा, जबकि उनके बिना 3% से कम। Anthropic खेल को खिलौना मॉडल कहता है और बताता है कि व्याख्याएँ ग़लत हो सकती हैं, कभी-कभी ट्रांसक्रिप्ट में मौजूद न होने वाले ब्योरे गढ़ देती हैं। हर सक्रियता को पढ़ने में सैकड़ों जेनरेट किए गए टोकन लगते हैं।
6 जुलाई 2026 को उसने Claude में एक “J-स्पेस” बताया, एक समय में कुछ दर्जन अवधारणाएँ जो आंतरिक गतिविधि के दसवें हिस्से से कम का हिसाब रखती हैं। “Soccer” को “Rugby” से बदलने से जवाब बदला, और “spider” को “ant” से बदलने से 8 पैरों का जवाब 6 पैरों का हो गया। Anthropic कहता है कि उसका तरीक़ा अपूर्ण है, सिर्फ़ वही अवधारणाएँ ढूँढता है जो एक टोकन से मेल खाती हों, और यह नहीं बता सकता कि कौन-सी अवधारणाएँ J-स्पेस में आती हैं यह किससे तय होता है। उसके पन्ने के अनुसार नील नंदा की बाहरी टिप्पणी में कुछ नतीजों की स्वतंत्र पुनरावृत्ति शामिल है।
स्रोत और आगे पढ़ने के लिए
- Olah and others, Zoom In: An Introduction to Circuits, Distill (10 March 2020)
- Olsson and others, In-context Learning and Induction Heads, Transformer Circuits Thread (8 March 2022)
- Bricken and others, Towards Monosemanticity: Decomposing Language Models With Dictionary Learning, Transformer Circuits Thread (4 October 2023)
- Templeton and others, Scaling Monosemanticity: Extracting Interpretable Features from Claude 3 Sonnet, Transformer Circuits Thread (21 May 2024)
- Anthropic: Golden Gate Claude (23 May 2024)
- Gao and others, Scaling and evaluating sparse autoencoders (OpenAI, arXiv:2406.04093, 6 June 2024)
- Lieberum and others, Gemma Scope: Open Sparse Autoencoders Everywhere All At Once on Gemma 2 (arXiv:2408.05147, 9 August 2024)
- Smith and others, Negative Results for SAEs On Downstream Tasks and Deprioritising SAE Research, GDM Mech Interp Team Progress Update #2 (AI Alignment Forum, 26 March 2025)
- Nanda and others, A Pragmatic Vision for Interpretability, Google DeepMind mechanistic interpretability team (1 December 2025)
- Wu and others, AxBench: Steering LLMs? Even Simple Baselines Outperform Sparse Autoencoders (arXiv:2501.17148, 28 January 2025)
- Jorgensen and Hansen, Steering LLMs? Actually, Sparse Autoencoders can outperform simple baselines (arXiv:2605.31183, 29 May 2026)
- Lindsey and others, On the Biology of a Large Language Model, Transformer Circuits Thread (27 March 2025)
- Paulo and Belrose, Sparse Autoencoders Trained on the Same Data Learn Different Features (arXiv:2501.16615, 28 January 2025)
- Heap and others, Automated Interpretability Metrics Do Not Distinguish Trained and Random Transformers (arXiv:2501.17727, 29 January 2025; version 2, 27 January 2026)
- Gao and others, Weight-sparse transformers have interpretable circuits (OpenAI, arXiv:2511.13653, 17 November 2025)
- Anthropic: Emotion concepts and their function in a large language model (2 April 2026)
- Anthropic: Natural Language Autoencoders, turning Claude's thoughts into text (7 May 2026)
- Anthropic: A global workspace in language models (6 July 2026)
यह लेख AI उपकरणों की सहायता से शोधित और लिखा गया है, और सटीकता के लिए संपादित किया गया है। यह केवल सामान्य जानकारी और चर्चा के लिए है, पेशेवर सलाह नहीं। हमारे संपादकीय मानक और अस्वीकरण देखें। कोई त्रुटि मिली? हमें बताएँ।
अच्छा लगा? अगला लेख पाएँ।
एक बार में एक अच्छा लेख, सीधे आपके इनबॉक्स में। कोई स्पैम नहीं, जब चाहें अनसब्सक्राइब करें।