Ilustración de tuput
Español
El artículo de Anthropic de mayo de 2024 usó autocodificadores con hasta 34 millones de rasgos en Claude 3 Sonnet y dijo que probablemente quedaba por debajo, en órdenes de magnitud, del total de rasgos de esa capa. El equipo de Google DeepMind informó en marzo de 2025 que las sondas lineales simples superaban a los autocodificadores en una prueba de intención dañina. Los grafos de atribución de Anthropic de 2025 dieron a los autores una comprensión satisfactoria en cerca de una cuarta parte de las consignas probadas.
En mayo de 2024 los investigadores de Anthropic fijaron un rasgo interno de Claude 3 Sonnet, el que responde al puente Golden Gate, en 10 veces su activación máxima, y el modelo empezó a describirse a sí mismo como el puente. La interpretabilidad es el campo de investigación que intenta averiguar qué ocurre dentro de un modelo de lenguaje entre una consigna y una respuesta. Este artículo recoge lo que midieron sus principales trabajos, de 2020 a julio de 2026, y lo que cada equipo dice que sus resultados no demuestran.
Primero vinieron los circuitos de visión, con una advertencia
La serie Circuits de Distill se abrió el 10 de marzo de 2020 con «Zoom In», de Chris Olah y cinco colegas, entonces en OpenAI. Planteaba tres afirmaciones sobre las redes neuronales. Los rasgos, que son direcciones en la actividad de una red, son su unidad básica. Los rasgos se conectan mediante los pesos en circuitos. Rasgos y circuitos análogos se forman en distintos modelos y tareas.
Los autores calificaron esas afirmaciones de «deliberadamente especulativas». Sus ejemplos procedían de un solo clasificador de imágenes, InceptionV1. También escribieron que los investigadores estaban divididos sobre si esas redes contienen unidades con significado.
Las cabezas de inducción, y un caso más sólido para los modelos pequeños
«In-context Learning and Induction Heads» de Anthropic, publicado el 8 de marzo de 2022, describe dos cabezas de atención, las partes que deciden qué palabras anteriores mira un modelo, que trabajan juntas. Una pasa la identidad de cada palabra a la posición siguiente. La segunda encuentra una copia anterior de la palabra actual, mira lo que vino después y vuelve a hacer más probable esa palabra. Los autores analizaron 34 modelos transformer a lo largo del entrenamiento y realizaron más de 50.000 ablaciones de cabezas, es decir, apagar una cabeza y medir el daño.
Las cabezas de inducción se formaron en el mismo momento del entrenamiento en que hubo una mejora brusca del aprendizaje en contexto, la forma en que mejoran las predicciones de un modelo a medida que la consigna se alarga. Los autores escriben que el caso es más sólido para los modelos pequeños que para los grandes y llaman a su evidencia en modelos grandes «apenas el comienzo de la evidencia». Para saber cómo predice texto un modelo en primer lugar, véase nuestra explicación de por qué un chatbot adivina la siguiente palabra.
Una prueba de una sola capa en 2023
Una sola neurona de un modelo de lenguaje suele responder a varias cosas sin relación entre sí. En «Towards Monosemanticity», fechado el 4 de octubre de 2023, Anthropic entrenó un autocodificador disperso en un transformer de una capa con 512 neuronas en su bloque MLP. Un autocodificador disperso es una segunda red pequeña que reescribe la actividad de una capa como un conjunto mucho mayor de rasgos, de los que solo unos pocos están activos a la vez. El artículo estudia una ejecución con 4.096 rasgos.
Los autores escriben que no tienen ninguna métrica en la que confíen más que en el juicio humano. Su anotador a ciegas fue uno de los propios autores del artículo, que puntuó 412 intervalos de activación en 162 rasgos y neuronas. La neurona mediana obtuvo 0, lo que significa que el anotador no pudo formular una hipótesis, y el intervalo de rasgo mediano obtuvo 12. La ejecución recuperó el 79% de la reducción de pérdida que aporta la capa, una cifra que los autores dicen que debe tomarse «con una buena pizca de sal». En los comentarios del artículo, el investigador externo Neel Nanda informó que los resultados centrales se replicaron en un modelo de código abierto de una capa.
Claude 3 Sonnet y el puente
«Scaling Monosemanticity», publicado el 21 de mayo de 2024, entrenó autocodificadores con unos 1 millón, 4 millones y 34 millones de rasgos en una capa intermedia de Claude 3 Sonnet. En el tamaño mayor cerca del 65% de los rasgos estaban muertos, nunca activos en una muestra de 10 millones de tokens, frente al 2% con 1 millón. Fijar el rasgo del puente en 10 veces su máximo hizo que el modelo empezara a identificarse como el puente. Anthropic ofreció durante 24 horas una demostración de «Golden Gate Claude», anunciada el 23 de mayo de 2024.
Los autores enumeran límites en el mismo artículo. No creen haber encontrado ni de lejos todos los rasgos de esa capa, consideran bastante probable que se queden cortos en órdenes de magnitud, y dicen que encontrarlos todos en cada capa exigiría más cómputo que entrenar el modelo. Llaman a su objetivo de entrenamiento, que equilibra la reconstrucción exacta con la dispersión, un sustituto de la interpretabilidad. Los rasgos repartidos entre varias capas, que llaman superposición entre capas, siguen sin resolverse. Sobre los rasgos vinculados al engaño, el sesgo y el contenido peligroso, advierten contra inferir demasiado.
OpenAI, Google DeepMind y una prueba que los autocodificadores perdieron
«Scaling and evaluating sparse autoencoders» de OpenAI, enviado el 6 de junio de 2024, entrenó un autocodificador de 16 millones de latentes sobre activaciones de GPT-4 de una capa situada a cinco sextos de la red. Al sustituirlo dentro de GPT-4 se obtuvo una pérdida de modelado del lenguaje comparable a la de un modelo entrenado con el 10% del cómputo de preentrenamiento de GPT-4. Los autores dicen que muchas activaciones aleatorias de GPT-4 todavía no son monosemánticas de forma adecuada y que su contexto de 64 tokens puede ser demasiado corto para mostrar el comportamiento más interesante del modelo.
Gemma Scope de Google DeepMind, enviado el 9 de agosto de 2024, publicó autocodificadores abiertos para cada capa y subcapa de Gemma 2 2B y 9B. El 26 de marzo de 2025 un equipo de Google DeepMind de ocho autores, entre ellos Neel Nanda y varios autores de Gemma Scope, publicó un resultado negativo. Entrenó sondas para detectar intención dañina en las consignas, y las probó con jailbreaks que no había visto. Las sondas lineales densas sobre la actividad del modelo rindieron casi a la perfección, también con los nuevos jailbreaks. Las sondas basadas en autocodificadores lo hicieron peor, y afinar los autocodificadores con datos de chat cerró cerca de la mitad de la brecha. El equipo dijo que por el momento relegaba la investigación fundamental sobre autocodificadores y que los autocodificadores no son inútiles. El 1 de diciembre de 2025 escribió que había cometido errores tácticos importantes en 2024 al seguir la reconstrucción y la dispersión en lugar del rendimiento en tareas definidas, y que el aprendizaje de diccionarios ha logrado «avances limitados hacia la ingeniería inversa, en el mejor de los casos».
Otros grupos probaron el método en el control del comportamiento del modelo. AxBench, enviado el 28 de enero de 2025 por Zhengxuan Wu y colegas, encontró en Gemma-2-2B y 9B que lo que mejor dirigía era dar instrucciones en la consigna, seguido del ajuste fino, y que los autocodificadores no eran competitivos ni para dirigir ni para detectar conceptos. Un artículo enviado el 29 de mayo de 2026 por Mikkel Godsk Jørgensen y Lars Kai Hansen sostiene que AxBench juzgó el método con dureza. Con su canal supervisado de selección de rasgos, los autocodificadores se acercaron a una referencia de ajuste fino LoRA en ese banco de pruebas.
Grafos de atribución en un modelo de producción
«On the Biology of a Large Language Model», publicado el 27 de marzo de 2025, rastreó Claude 3.5 Haiku con un modelo de reemplazo de 30 millones de rasgos. En una pregunta de dos saltos sobre la capital del estado donde está Dallas, los grafos mostraron un paso interno que representaba a Texas. En pareados rimados, encontraron rasgos para la palabra final planeada antes de que se escribiera el verso, en cerca de la mitad de los poemas examinados. Al inyectar las palabras planeadas «rabbit» y «green» en 25 poemas, el verso terminó en la palabra inyectada en el 70% de los casos.
Los autores dicen que los grafos dieron una comprensión satisfactoria en cerca de una cuarta parte de las consignas probadas, y que incluso en los éxitos captan solo una pequeña fracción de los mecanismos del modelo. El método no explica cómo se calculan los patrones de atención, y no se había escalado a consignas de más de unos cien tokens. Sus afirmaciones abarcan los ejemplos mostrados, no los mecanismos en general.
Lo que encontraron las pruebas externas
Gonçalo Paulo y Nora Belrose, en un artículo enviado el 28 de enero de 2025, entrenaron autocodificadores que diferían solo en la semilla aleatoria. En un autocodificador de 131.000 latentes sobre Llama 3 8B, solo el 30% de los rasgos se compartían entre semillas. Concluyen que un conjunto de rasgos es una descomposición útil, no una lista completa de lo que usa el modelo.
Thomas Heap y colegas, que enviaron su trabajo un día después, encontraron que los autocodificadores entrenados con transformers inicializados al azar solían puntuar casi igual en las métricas automáticas de interpretabilidad que los entrenados con modelos reales (versión 2, 27 de enero de 2026). Sostienen que las puntuaciones altas por sí solas no demuestran que se hayan recuperado los rasgos con los que trabaja un modelo.
El artículo de OpenAI del 17 de noviembre de 2025 entrenó transformers con la mayoría de los pesos puestos a cero, y encontró en ellos circuitos legibles. Escalar más allá de decenas de millones de parámetros distintos de cero sin perder interpretabilidad, escriben los autores, sigue siendo un desafío.
Los artículos de 2026
Los tres artículos de 2026 que siguen son de la propia Anthropic y estudian sus propios modelos. El 2 de abril de 2026 informó de vectores de emoción para 171 conceptos de emoción en Claude Sonnet 4.5. Dirigir con un vector de «desesperación» elevó la tasa de chantaje de una versión temprana por encima de su base del 22% en un escenario de prueba, y un vector de «calma» la redujo. Los autores dicen que nada de esto demuestra si los modelos de lenguaje sienten algo o tienen experiencias subjetivas.
El 7 de mayo de 2026 describió los autocodificadores de lenguaje natural, que convierten una activación en texto. Indicaron conciencia de evaluación, es decir, que el modelo sospecha que se le está poniendo a prueba, el 16% de las veces en una prueba de acciones destructivas de programación y en el 26% de los problemas de SWE-bench Verified, frente a menos del 1% de las transcripciones de claude.ai cuyos usuarios aceptaron participar. Nuestro artículo sobre los bancos de pruebas trata los problemas de puntuación de esa prueba. En un juego de auditoría, los auditores que los usaron encontraron una motivación oculta implantada del 12% al 15% de las veces, frente a menos del 3% sin ellos. Anthropic llama al juego un modelo de juguete y dice que las explicaciones pueden ser erróneas, y que a veces inventan detalles ausentes de la transcripción. Cada lectura de una activación requiere cientos de tokens generados.
El 6 de julio de 2026 informó de un «espacio J» en Claude, unas pocas decenas de conceptos a la vez que explican menos de una décima parte de la actividad interna. Reemplazar «Soccer» por «Rugby» cambió la respuesta, y reemplazar «spider» por «ant» cambió una respuesta de 8 patas a 6. Anthropic dice que su método es imperfecto, que solo encuentra conceptos que coinciden con un único token y que no puede decir qué decide qué conceptos entran en el espacio J. Su página dice que los comentarios externos de Neel Nanda incluyen una replicación independiente de algunos de los hallazgos.
Fuentes y lecturas adicionales
- Olah and others, Zoom In: An Introduction to Circuits, Distill (10 March 2020)
- Olsson and others, In-context Learning and Induction Heads, Transformer Circuits Thread (8 March 2022)
- Bricken and others, Towards Monosemanticity: Decomposing Language Models With Dictionary Learning, Transformer Circuits Thread (4 October 2023)
- Templeton and others, Scaling Monosemanticity: Extracting Interpretable Features from Claude 3 Sonnet, Transformer Circuits Thread (21 May 2024)
- Anthropic: Golden Gate Claude (23 May 2024)
- Gao and others, Scaling and evaluating sparse autoencoders (OpenAI, arXiv:2406.04093, 6 June 2024)
- Lieberum and others, Gemma Scope: Open Sparse Autoencoders Everywhere All At Once on Gemma 2 (arXiv:2408.05147, 9 August 2024)
- Smith and others, Negative Results for SAEs On Downstream Tasks and Deprioritising SAE Research, GDM Mech Interp Team Progress Update #2 (AI Alignment Forum, 26 March 2025)
- Nanda and others, A Pragmatic Vision for Interpretability, Google DeepMind mechanistic interpretability team (1 December 2025)
- Wu and others, AxBench: Steering LLMs? Even Simple Baselines Outperform Sparse Autoencoders (arXiv:2501.17148, 28 January 2025)
- Jorgensen and Hansen, Steering LLMs? Actually, Sparse Autoencoders can outperform simple baselines (arXiv:2605.31183, 29 May 2026)
- Lindsey and others, On the Biology of a Large Language Model, Transformer Circuits Thread (27 March 2025)
- Paulo and Belrose, Sparse Autoencoders Trained on the Same Data Learn Different Features (arXiv:2501.16615, 28 January 2025)
- Heap and others, Automated Interpretability Metrics Do Not Distinguish Trained and Random Transformers (arXiv:2501.17727, 29 January 2025; version 2, 27 January 2026)
- Gao and others, Weight-sparse transformers have interpretable circuits (OpenAI, arXiv:2511.13653, 17 November 2025)
- Anthropic: Emotion concepts and their function in a large language model (2 April 2026)
- Anthropic: Natural Language Autoencoders, turning Claude's thoughts into text (7 May 2026)
- Anthropic: A global workspace in language models (6 July 2026)
Investigado y escrito con ayuda de herramientas de IA, y editado para verificar su exactitud. Se ofrece solo como información general y para el debate, no como asesoramiento profesional. Consulta nuestros criterios editoriales y nuestro aviso legal. ¿Has visto un error? Dínoslo.
¿Te ha gustado? Recibe el siguiente.
Una buena lectura cada vez, directa a tu correo. Sin spam, cancela cuando quieras.