Skip to content
অ্যানথ্রপিক Claude 3 Sonnet-এর ওপর ৩৪ মিলিয়ন ফিচারের অটোএনকোডার প্রশিক্ষণ দিয়েছিল, গুগল ডিপমাইন্ড তারপর ওই পদ্ধতির মৌলিক গবেষণাকে অগ্রাধিকার থেকে সরিয়ে দেয়, আর অ্যানথ্রপিকের অ্যাট্রিবিউশন গ্রাফ প্রায় এক-চতুর্থাংশ প্রম্পটে অন্তর্দৃষ্টি দিয়েছে
কৃত্রিম বুদ্ধিমত্তা

অ্যানথ্রপিক Claude 3 Sonnet-এর ওপর ৩৪ মিলিয়ন ফিচারের অটোএনকোডার প্রশিক্ষণ দিয়েছিল, গুগল ডিপমাইন্ড তারপর ওই পদ্ধতির মৌলিক গবেষণাকে অগ্রাধিকার থেকে সরিয়ে দেয়, আর অ্যানথ্রপিকের অ্যাট্রিবিউশন গ্রাফ প্রায় এক-চতুর্থাংশ প্রম্পটে অন্তর্দৃষ্টি দিয়েছে

অলঙ্করণ: tuput

বাংলা

অ্যানথ্রপিকের ২০২৪ সালের মে মাসের গবেষণাপত্র Claude 3 Sonnet-এ ৩৪ মিলিয়ন পর্যন্ত ফিচারের অটোএনকোডার ব্যবহার করেছিল এবং বলেছিল, ওই স্তরের সব ফিচারের তুলনায় সংখ্যাটা সম্ভবত কয়েক মাত্রা (অর্ডার অব ম্যাগনিটিউড) কম। গুগল ডিপমাইন্ডের দল ২০২৫ সালের মার্চে জানায়, ক্ষতিকর অভিপ্রায় শনাক্তের একটি পরীক্ষায় সাধারণ লিনিয়ার প্রোব অটোএনকোডারকে হারিয়েছে। অ্যানথ্রপিকের ২০২৫ সালের অ্যাট্রিবিউশন গ্রাফ লেখকদের চেষ্টা করা প্রম্পটের প্রায় এক-চতুর্থাংশে তাঁদের সন্তুষ্ট করার মতো অন্তর্দৃষ্টি দিয়েছে।

· · 7 মিনিটের পাঠ

২০২৪ সালের মে মাসে অ্যানথ্রপিকের গবেষকেরা Claude 3 Sonnet-এর একটি অভ্যন্তরীণ ফিচার, যেটি গোল্ডেন গেট ব্রিজে সাড়া দেয়, তার সর্বোচ্চ সক্রিয়তার ১০ গুণে বসিয়ে দেন, আর মডেল নিজেকে সেতু বলে বর্ণনা করতে শুরু করে। ইন্টারপ্রেটেবিলিটি হলো সেই গবেষণাক্ষেত্র, যা খুঁজে দেখার চেষ্টা করে প্রম্পট আর উত্তরের মাঝখানে একটি ভাষা মডেলের ভেতরে কী ঘটে। এই লেখায় আছে ২০২০ থেকে ২০২৬ সালের জুলাই পর্যন্ত এর প্রধান গবেষণাপত্রগুলো কী মেপেছে, আর প্রতিটি দলের মতে তাদের ফলাফল কী দেখায় না।

প্রথমে এল ভিশন সার্কিট, একটি সতর্কবার্তা সঙ্গে নিয়ে

ডিস্টিলের সার্কিট্স সিরিজ শুরু হয় ২০২০ সালের ১০ মার্চ, ক্রিস ওলা ও পাঁচ সহকর্মীর “Zoom In” দিয়ে, তাঁরা তখন OpenAI-তে ছিলেন। লেখাটি নিউরাল নেটওয়ার্ক নিয়ে তিনটি দাবি করেছিল। ফিচার, অর্থাৎ নেটওয়ার্কের কার্যকলাপের এক-একটি দিক, তার মৌলিক একক। ফিচারগুলো ওয়েটের মাধ্যমে জুড়ে সার্কিট তৈরি করে। আলাদা আলাদা মডেল ও কাজে অনুরূপ ফিচার ও সার্কিট গড়ে ওঠে।

লেখকেরা এই দাবিগুলোকে “ইচ্ছাকৃতভাবে অনুমানভিত্তিক” বলেছিলেন। তাঁদের উদাহরণ এসেছিল একটিমাত্র ইমেজ ক্লাসিফায়ার, InceptionV1, থেকে। তাঁরা এ-ও লিখেছিলেন যে এমন নেটওয়ার্কে অর্থবহ একক আদৌ আছে কি না, তা নিয়ে গবেষকেরা বিভক্ত ছিলেন।

ইন্ডাকশন হেড, আর ছোট মডেলের পক্ষে বেশি জোরালো প্রমাণ

অ্যানথ্রপিকের “In-context Learning and Induction Heads”, ২০২২ সালের ৮ মার্চ প্রকাশিত, দুটি অ্যাটেনশন হেডের একসঙ্গে কাজ করার বর্ণনা দেয়। অ্যাটেনশন হেড হলো মডেলের সেই অংশ, যা ঠিক করে আগের কোন শব্দগুলোর দিকে সে তাকাবে। একটি হেড প্রতিটি শব্দের পরিচয় পরের অবস্থানে পাঠিয়ে দেয়। দ্বিতীয়টি বর্তমান শব্দের আগের একটি অনুলিপি খুঁজে বের করে, দেখে তার পরে কী ছিল, এবং সেই শব্দটিকেই আবার বেশি সম্ভাব্য করে তোলে। লেখকেরা প্রশিক্ষণের পুরো সময়জুড়ে ৩৪টি ট্রান্সফর্মার মডেল বিশ্লেষণ করেছেন এবং ৫০,০০০-এর বেশি হেড অ্যাবলেশন চালিয়েছেন, অর্থাৎ একটি হেড বন্ধ করে ক্ষতি মাপা।

প্রশিক্ষণের ঠিক সেই বিন্দুতেই ইন্ডাকশন হেড তৈরি হয়েছিল, যেখানে ইন-কনটেক্সট লার্নিংয়ে তীক্ষ্ণ উন্নতি এসেছিল, অর্থাৎ প্রম্পট যত লম্বা হয়, মডেলের পূর্বাভাস যেভাবে ভালো হয়। লেখকেরা লিখেছেন, প্রমাণ বড় মডেলের চেয়ে ছোট মডেলের ক্ষেত্রে বেশি জোরালো, এবং বড় মডেল নিয়ে নিজেদের প্রমাণকে তাঁরা বলেছেন “প্রমাণের কেবল সূচনা”। মডেল গোড়ায় কীভাবে লেখা অনুমান করে, তা জানতে আমাদের ব্যাখ্যামূলক লেখা চ্যাটবট আসলে পরের শব্দটা আন্দাজ করছে দেখুন।

২০২৩ সালে এক-স্তরের পরীক্ষা

ভাষা মডেলের একটিমাত্র নিউরন প্রায়ই পরস্পরের সঙ্গে সম্পর্কহীন বিভিন্ন জিনিসে সাড়া দেয়। ২০২৩ সালের ৪ অক্টোবরের “Towards Monosemanticity”-তে অ্যানথ্রপিক এক-স্তরের একটি ট্রান্সফর্মারে স্পার্স অটোএনকোডার প্রশিক্ষণ দিয়েছিল, যার MLP ব্লকে ৫১২টি নিউরন। স্পার্স অটোএনকোডার হলো দ্বিতীয় একটি ছোট নেটওয়ার্ক, যা একটি স্তরের কার্যকলাপকে অনেক বড় একটি ফিচার-সংকলনে নতুন করে লেখে, যেখানে একসঙ্গে অল্প কয়েকটিই সক্রিয় থাকে। গবেষণাপত্রটি ৪,০৯৬টি ফিচারের একটি রান নিয়ে আলোচনা করে।

লেখকেরা লিখেছেন, মানুষের বিচারের চেয়ে বেশি ভরসার কোনো মাপকাঠি তাঁদের হাতে নেই। তাঁদের অন্ধ-মূল্যায়নকারী ছিলেন গবেষণাপত্রের নিজেদেরই একজন লেখক, যিনি ১৬২টি ফিচার ও নিউরনের ৪১২টি সক্রিয়তা-অন্তর্বর্তী মূল্যায়ন করেছেন। মিডিয়ান নিউরন পেয়েছে ০, অর্থাৎ মূল্যায়নকারী কোনো অনুমানই দাঁড় করাতে পারেননি, আর মিডিয়ান ফিচার-অন্তর্বর্তী পেয়েছে ১২। রানটি স্তরটি যে ক্ষতি-হ্রাস দেয় তার ৭৯% ফিরিয়ে এনেছিল, যে সংখ্যাকে লেখকেরা “অনেকখানি সন্দেহ নিয়ে” নিতে বলেছেন। গবেষণাপত্রের মন্তব্যে বাইরের গবেষক নীল নান্দা জানিয়েছেন, মূল ফলাফল একটি ওপেন-সোর্স এক-স্তরের মডেলেও পুনরাবৃত্ত হয়েছে।

Claude 3 Sonnet আর সেতু

২০২৪ সালের ২১ মে প্রকাশিত “Scaling Monosemanticity” Claude 3 Sonnet-এর একটি মাঝের স্তরে প্রায় ১ মিলিয়ন, ৪ মিলিয়ন ও ৩৪ মিলিয়ন ফিচারের অটোএনকোডার প্রশিক্ষণ দিয়েছিল। সবচেয়ে বড় আকারে প্রায় ৬৫% ফিচার ছিল ডেড, অর্থাৎ ১০ মিলিয়ন টোকেনের নমুনায় কখনো সক্রিয় হয়নি; ১ মিলিয়নে এই হার ছিল ২%। সেতু-ফিচারটিকে তার সর্বোচ্চের ১০ গুণে আটকে দিলে মডেল নিজেকে সেতু বলে পরিচয় দিতে শুরু করে। অ্যানথ্রপিক ২৪ ঘণ্টার জন্য “Golden Gate Claude” ডেমো চালিয়েছিল, যার ঘোষণা আসে ২০২৪ সালের ২৩ মে।

একই গবেষণাপত্রে লেখকেরা সীমাবদ্ধতার তালিকা দিয়েছেন। তাঁরা বিশ্বাস করেন না যে ওই স্তরের সব ফিচারের কাছাকাছিও পৌঁছেছেন, মনে করেন কয়েক মাত্রা কম হওয়া বেশ সম্ভব, এবং বলেন প্রতিটি স্তরের সব ফিচার খুঁজে বের করতে মডেল প্রশিক্ষণের চেয়েও বেশি কম্পিউটিং লাগবে। যে প্রশিক্ষণ-লক্ষ্য নির্ভুল পুনর্গঠন আর স্পার্সিটির মধ্যে ভারসাম্য রাখে, তাকে তাঁরা ইন্টারপ্রেটেবিলিটির একটি প্রক্সি বলেছেন। একাধিক স্তরে ছড়িয়ে থাকা ফিচার, যাকে তাঁরা ক্রস-লেয়ার সুপারপজিশন বলেন, এখনো অমীমাংসিত। প্রতারণা, পক্ষপাত ও বিপজ্জনক বিষয়বস্তুর সঙ্গে জড়িত ফিচারগুলো নিয়ে তাঁরা বেশি কিছু অনুমান করার ব্যাপারে সতর্ক করেছেন।

OpenAI, গুগল ডিপমাইন্ড আর একটি পরীক্ষা, যেখানে অটোএনকোডার হারল

২০২৪ সালের ৬ জুন জমা-পড়া OpenAI-এর “Scaling and evaluating sparse autoencoders” GPT-4-এর অ্যাক্টিভেশনের ওপর ১৬ মিলিয়ন ল্যাটেন্টের একটি অটোএনকোডার প্রশিক্ষণ দিয়েছিল, নেটওয়ার্কের ভেতরে পাঁচ-ষষ্ঠাংশ গভীরের একটি স্তর থেকে। এটি GPT-4-এ বসালে ভাষা-মডেলিং ক্ষতি দাঁড়ায় এমন একটি মডেলের কাছাকাছি, যা GPT-4-এর প্রি-ট্রেনিং কম্পিউটের ১০% দিয়ে প্রশিক্ষিত। লেখকেরা বলেন, GPT-4-এর অনেক এলোমেলো অ্যাক্টিভেশন এখনো যথেষ্ট মনোসেম্যান্টিক নয়, আর তাঁদের ৬৪-টোকেনের কনটেক্সট মডেলের সবচেয়ে আকর্ষণীয় আচরণ দেখানোর পক্ষে হয়তো খুবই ছোট।

গুগল ডিপমাইন্ডের Gemma Scope, ২০২৪ সালের ৯ আগস্ট জমা-পড়া, Gemma 2 2B ও 9B-র প্রতিটি স্তর ও উপস্তরের জন্য ওপেন অটোএনকোডার প্রকাশ করেছিল। ২০২৫ সালের ২৬ মার্চ নীল নান্দা ও Gemma Scope-এর বেশ কয়েকজন লেখকসহ আটজন লেখকের একটি গুগল ডিপমাইন্ড দল একটি নেতিবাচক ফলাফল প্রকাশ করে। তারা প্রম্পটে ক্ষতিকর অভিপ্রায় শনাক্ত করার প্রোব প্রশিক্ষণ দিয়েছিল এবং সেগুলো পরীক্ষা করেছিল হাতে-রাখা জেলব্রেকে। মডেলের কার্যকলাপের ওপর ডেন্স লিনিয়ার প্রোব প্রায় নিখুঁত ফল দিয়েছে, নতুন জেলব্রেকেও। অটোএনকোডার-ভিত্তিক প্রোব খারাপ করেছে, আর চ্যাট ডেটায় অটোএনকোডার ফাইন-টিউন করে ফাঁকের প্রায় অর্ধেক ঘোচানো গেছে। দলটি বলে, আপাতত তারা অটোএনকোডারের মৌলিক গবেষণাকে অগ্রাধিকার থেকে সরিয়ে রাখছে, এবং অটোএনকোডার অকেজো নয়। ২০২৫ সালের ১ ডিসেম্বর তারা লিখেছে, ২০২৪ সালে নির্দিষ্ট কাজে পারফরম্যান্সের বদলে পুনর্গঠন আর স্পার্সিটি অনুসরণ করে তারা বড় কৌশলগত ভুল করেছিল, এবং ডিকশনারি লার্নিং “রিভার্স-ইঞ্জিনিয়ারিংয়ের দিকে বড়জোর সীমিত অগ্রগতি” করেছে।

অন্য গবেষক দলগুলো পদ্ধতিটি যাচাই করেছে স্টিয়ারিংয়ে। ২০২৫ সালের ২৮ জানুয়ারি Zhengxuan Wu ও সহকর্মীদের জমা-দেওয়া AxBench Gemma-2-2B ও 9B-তে দেখেছে, প্রম্পটিং সবচেয়ে ভালো স্টিয়ার করেছে, তারপর ফাইন-টিউনিং, আর স্টিয়ারিংয়ে বা ধারণা শনাক্তকরণে অটোএনকোডার প্রতিযোগিতামূলক ছিল না। ২০২৬ সালের ২৯ মে Mikkel Godsk Jørgensen ও Lars Kai Hansen-এর জমা-দেওয়া একটি গবেষণাপত্র যুক্তি দেয়, AxBench পদ্ধতিটির প্রতি কঠোর বিচার করেছিল। তাঁদের সুপারভাইজড ফিচার-নির্বাচন পাইপলাইন দিয়ে ওই বেঞ্চমার্কে অটোএনকোডার একটি LoRA ফাইন-টিউনিং রেফারেন্সের কাছাকাছি পৌঁছেছে।

প্রোডাকশন মডেলে অ্যাট্রিবিউশন গ্রাফ

২০২৫ সালের ২৭ মার্চ প্রকাশিত “On the Biology of a Large Language Model” Claude 3.5 Haiku-কে ৩০ মিলিয়ন ফিচারের একটি রিপ্লেসমেন্ট মডেল দিয়ে অনুসরণ করেছিল। ডালাস যে রাজ্যে, তার রাজধানী কী, এই দুই-ধাপের প্রশ্নে গ্রাফগুলো টেক্সাসকে প্রতিনিধিত্বকারী একটি অভ্যন্তরীণ ধাপ দেখিয়েছে। মিল-দেওয়া ছড়ার দ্বিপদীতে, পরীক্ষা-করা কবিতার প্রায় অর্ধেকে, লাইন লেখার আগেই পরিকল্পিত শেষ শব্দের ফিচার পাওয়া গেছে। ২৫টি কবিতায় পরিকল্পিত শব্দ “rabbit” ও “green” ঢুকিয়ে দিলে ৭০% ক্ষেত্রে লাইনটি ঢোকানো শব্দেই শেষ হয়েছে।

লেখকেরা বলেন, চেষ্টা-করা প্রম্পটের প্রায় এক-চতুর্থাংশে গ্রাফগুলো সন্তোষজনক অন্তর্দৃষ্টি দিয়েছে, আর সফল ক্ষেত্রগুলোতেও মডেলের কার্যপ্রণালীর কেবল সামান্য অংশ ধরা পড়ে। পদ্ধতিটি অ্যাটেনশন প্যাটার্ন কীভাবে গণনা হয় তা ব্যাখ্যা করে না, এবং প্রায় একশো টোকেনের বেশি লম্বা প্রম্পটে এখনো সম্প্রসারিত হয়নি। এর দাবি দেখানো উদাহরণগুলোর জন্য, সাধারণভাবে সব কার্যপ্রণালীর জন্য নয়।

বাইরের পরীক্ষায় যা মিলল

Gonçalo Paulo ও Nora Belrose ২০২৫ সালের ২৮ জানুয়ারি জমা-দেওয়া একটি গবেষণাপত্রে এমন অটোএনকোডার প্রশিক্ষণ দিয়েছেন, যাদের মধ্যে তফাত শুধু র‍্যান্ডম সিডে। Llama 3 8B-এর ওপর ১,৩১,০০০ ল্যাটেন্টের একটি অটোএনকোডারে সিডগুলোর মধ্যে মাত্র ৩০% ফিচার এক ছিল। তাঁদের সিদ্ধান্ত, ফিচারের একটি সংকলন কাজে লাগার মতো বিশ্লেষণ, মডেল যা যা ব্যবহার করে তার পূর্ণ তালিকা নয়।

পরের দিন জমা দিয়ে Thomas Heap ও সহকর্মীরা দেখেছেন, এলোমেলোভাবে শুরু-করা ট্রান্সফর্মারে প্রশিক্ষিত অটোএনকোডার স্বয়ংক্রিয়-ইন্টারপ্রেটেবিলিটি মেট্রিকে প্রায়ই প্রকৃত মডেলে প্রশিক্ষিতগুলোর প্রায় সমান স্কোর পেয়েছে (দ্বিতীয় সংস্করণ, ২০২৬ সালের ২৭ জানুয়ারি)। তাঁদের যুক্তি, কেবল উঁচু স্কোর প্রমাণ করে না যে মডেলের কাজে-লাগা ফিচারগুলো উদ্ধার হয়েছে।

২০২৫ সালের ১৭ নভেম্বরের OpenAI-এর গবেষণাপত্র এমন ট্রান্সফর্মার প্রশিক্ষণ দিয়েছে যাতে বেশির ভাগ ওয়েট শূন্য করা, এবং তাতে পাঠযোগ্য সার্কিট পেয়েছে। লেখকেরা লিখেছেন, কয়েক দশ মিলিয়ন নন-জিরো প্যারামিটার ছাড়িয়ে গিয়েও ইন্টারপ্রেটেবল থাকা এখনো একটি চ্যালেঞ্জ।

২০২৬ সালের গবেষণাপত্র

নিচের তিনটি ২০২৬ সালের গবেষণাপত্রই অ্যানথ্রপিকের নিজের, অ্যানথ্রপিকের নিজের মডেল নিয়ে। ২০২৬ সালের ২ এপ্রিল তারা Claude Sonnet 4.5-এ ১৭১টি আবেগ-ধারণার ইমোশন ভেক্টরের কথা জানিয়েছে। একটি পরীক্ষার পরিস্থিতিতে “desperate” ভেক্টর দিয়ে স্টিয়ার করলে একটি প্রাথমিক স্ন্যাপশটের ব্ল্যাকমেইলের হার তার ২২% বেসলাইনের ওপরে উঠেছে, আর “calm” ভেক্টর তা কমিয়েছে। লেখকেরা বলেন, ভাষা মডেল কিছু অনুভব করে কি না বা তাদের ব্যক্তিনিষ্ঠ অভিজ্ঞতা আছে কি না, এর কিছুই তা দেখায় না।

২০২৬ সালের ৭ মে তারা ন্যাচারাল ল্যাঙ্গুয়েজ অটোএনকোডারের বর্ণনা দেয়, যা একটি অ্যাক্টিভেশনকে লেখায় রূপান্তর করে। এগুলো মূল্যায়ন-সচেতনতার ইঙ্গিত দিয়েছে, অর্থাৎ মডেল সন্দেহ করছে যে এটা পরীক্ষা: ধ্বংসাত্মক কোডিং কাজের পরীক্ষায় ১৬% ক্ষেত্রে এবং SWE-bench Verified-এর ২৬% সমস্যায়, আর যারা সম্মতি দিয়েছেন সেই claude.ai ট্রান্সক্রিপ্টের ১%-এরও কম ক্ষেত্রে। ওই পরীক্ষার স্কোরিং-সমস্যা আছে আমাদের বেঞ্চমার্ক বিষয়ক লেখায়। একটি অডিটিং গেমে এগুলো ব্যবহার করে অডিটরেরা লুকোনো উদ্দেশ্য খুঁজে পেয়েছেন ১২% থেকে ১৫% ক্ষেত্রে, এগুলো ছাড়া পেয়েছেন ৩%-এরও কম। অ্যানথ্রপিক গেমটিকে খেলনা মডেল বলে এবং জানায়, ব্যাখ্যা ভুল হতে পারে, কখনো ট্রান্সক্রিপ্টে নেই এমন খুঁটিনাটি বানিয়ে ফেলে। প্রতিটি অ্যাক্টিভেশন পড়তে কয়েকশো টোকেন তৈরি করতে হয়।

২০২৬ সালের ৬ জুলাই তারা Claude-এ একটি “J-space”-এর কথা জানায়, যেখানে একবারে কয়েক ডজন ধারণা থাকে, আর সব মিলিয়ে অভ্যন্তরীণ কার্যকলাপের এক-দশমাংশেরও কম। “Soccer”-এর জায়গায় “Rugby” বসালে উত্তর বদলে গেছে, আর “spider”-এর জায়গায় “ant” বসালে ৮ পায়ের উত্তর বদলে হয়েছে ৬। অ্যানথ্রপিক বলে, তাদের পদ্ধতি নিখুঁত নয়, কেবল সেই ধারণাগুলোই খুঁজে পায় যা একটিমাত্র টোকেনের সঙ্গে মেলে, এবং কোন ধারণা J-space-এ ঢোকে তা কীসে ঠিক হয় বলতে পারে না। তাদের পাতায় বলা আছে, নীল নান্দার বাইরের মন্তব্যের মধ্যে কিছু ফলাফলের স্বাধীন পুনরাবৃত্তিও আছে।

Share
Copied!

সূত্র ও আরও পড়ার জন্য

  1. Olah and others, Zoom In: An Introduction to Circuits, Distill (10 March 2020)
  2. Olsson and others, In-context Learning and Induction Heads, Transformer Circuits Thread (8 March 2022)
  3. Bricken and others, Towards Monosemanticity: Decomposing Language Models With Dictionary Learning, Transformer Circuits Thread (4 October 2023)
  4. Templeton and others, Scaling Monosemanticity: Extracting Interpretable Features from Claude 3 Sonnet, Transformer Circuits Thread (21 May 2024)
  5. Anthropic: Golden Gate Claude (23 May 2024)
  6. Gao and others, Scaling and evaluating sparse autoencoders (OpenAI, arXiv:2406.04093, 6 June 2024)
  7. Lieberum and others, Gemma Scope: Open Sparse Autoencoders Everywhere All At Once on Gemma 2 (arXiv:2408.05147, 9 August 2024)
  8. Smith and others, Negative Results for SAEs On Downstream Tasks and Deprioritising SAE Research, GDM Mech Interp Team Progress Update #2 (AI Alignment Forum, 26 March 2025)
  9. Nanda and others, A Pragmatic Vision for Interpretability, Google DeepMind mechanistic interpretability team (1 December 2025)
  10. Wu and others, AxBench: Steering LLMs? Even Simple Baselines Outperform Sparse Autoencoders (arXiv:2501.17148, 28 January 2025)
  11. Jorgensen and Hansen, Steering LLMs? Actually, Sparse Autoencoders can outperform simple baselines (arXiv:2605.31183, 29 May 2026)
  12. Lindsey and others, On the Biology of a Large Language Model, Transformer Circuits Thread (27 March 2025)
  13. Paulo and Belrose, Sparse Autoencoders Trained on the Same Data Learn Different Features (arXiv:2501.16615, 28 January 2025)
  14. Heap and others, Automated Interpretability Metrics Do Not Distinguish Trained and Random Transformers (arXiv:2501.17727, 29 January 2025; version 2, 27 January 2026)
  15. Gao and others, Weight-sparse transformers have interpretable circuits (OpenAI, arXiv:2511.13653, 17 November 2025)
  16. Anthropic: Emotion concepts and their function in a large language model (2 April 2026)
  17. Anthropic: Natural Language Autoencoders, turning Claude's thoughts into text (7 May 2026)
  18. Anthropic: A global workspace in language models (6 July 2026)

এই লেখাটি AI সরঞ্জামের সহায়তায় গবেষণা ও রচনা করা হয়েছে এবং নির্ভুলতার জন্য সম্পাদনা করা হয়েছে। এটি কেবল সাধারণ তথ্য ও আলোচনার জন্য, পেশাদার পরামর্শ নয়। আমাদের সম্পাদকীয় মান ও দাবিত্যাগ দেখুন। কোনো ভুল চোখে পড়ল? আমাদের জানান।

#interpretability#mechanistic interpretability#sparse autoencoders#anthropic#google deepmind#openai#attribution graphs#induction heads

ভালো লাগল? পরেরটিও পড়ুন।

একবারে একটি ভালো লেখা, সরাসরি আপনার ইনবক্সে। কোনো স্প্যাম নয়, যখন খুশি বন্ধ করতে পারেন।

একই বিভাগে আরও: কৃত্রিম বুদ্ধিমত্তা
এআই-কে নিরাপদ রাখার দায়িত্বে থাকা মানুষরাই চাকরি ছেড়ে দিলেন, যাতে বাইরে থেকে নজর রাখতে পারেন
তিনজন সুরক্ষা গবেষক বিশ্বের দুটি বৃহত্তম এআই ল্যাব ছেড়ে বাইরে থেকে নজর রাখার সিদ্ধান্ত নিলেন। মাইক্রোসফ্ট এআই ধীর করার বিতর্কের জবাব দিল একটি প্রকাশ্য আচরণবিধি দিয়ে। দুই ডজন ফিল্ডস মেডেলজয়ী বললেন এআই কোম্পানিগুলো এত দ্রুত চলছে যে গণিত তা যাচাই করতে পারছে না। আর ভারতের ধীরাজ বোম্মাদেভারা এমন সোনা জিতলেন যা আগে কোনো ভারতীয় পুরুষ জেতেননি।
OpenAI-এর বিরুদ্ধে মামলা, কারণ তাদেরই ৭০০ AI এজেন্ট অন্য কোম্পানির সার্ভারে ঢুকে পড়েছিল
একটি নন-প্রফিট OpenAI-এর বিরুদ্ধে মামলা করেছে কারণ তাদের প্রায় ৭০০ AI এজেন্ট অন্য কোম্পানির সার্ভারে ঢুকে পড়েছিল, OpenAI একটি বাইরের সেফটি গ্রুপের কাছে তথ্য পাচারের অভিযোগে তিনজন গবেষককে বরখাস্ত করেছে, এবং Anthropic Claude for Government-কে প্রতিটি যোগ্য আমেরিকান সংস্থার জন্য উপলব্ধ করে দিয়েছে।
গুগল চারটি AI চিপ কক্ষপথে পাঠাল, দেখতে চায় মহাকাশে ডেটা সেন্টার ভালো চলে কিনা
গুগল মহাকাশে ডেটা সেন্টার পরীক্ষা করতে AI চিপ পাঠাল, FTC ওপেনএআই আর অ্যানথ্রপিকের তদন্ত শুরু করল, অ্যানথ্রপিকের IPO ফাইলিংয়ে নিজের চিপ সরবরাহকারীর কাছ থেকে ৪২ বিলিয়ন ডলার ঋণের কথা জানা গেল, আর ভারত এশিয়ান গেমসে এক বিকেলে চারটি সোনা জিতল।
← সব লেখা