Interpretabilidad: mirar adentro de un modelo
La interpretabilidad intenta responder una pregunta incómoda: sabemos que estos modelos funcionan, pero no sabemos bien por qué. Abrirlos y mirar adentro —encontrar circuitos, características, patrones de atribución— es el intento más serio de convertir eso en conocimiento.
Es además una de las pocas áreas donde alguien con una GPU y buenas ideas todavía puede producir resultados relevantes, porque el cuello de botella es conceptual y no de cómputo. En los últimos años pasó de resultados en modelos de juguete a encontrar características manipulables en modelos de producción y a trazar grafos de atribución que muestran planificación anticipada y racionalización a posteriori.
11 recursos de interpretabilidad
Ordenados con los imprescindibles primero y agrupados por tipo. Los marcados con ★ son los que recomendaría alguien que ya recorrió el camino; los que dicen «gratis» no cuestan nada.
🎓 Curso
📚 Libro
📄 Paper
El texto fundacional de la interpretabilidad mecanicista. Cabezas de atención como operaciones componibles sobre el residual stream.
Encontraron el circuito concreto que hace posible el aprendizaje en contexto. Uno de los resultados más satisfactorios del campo.
Grafos de atribución que muestran planificación anticipada, razonamiento multilingüe y racionalizaciones a posteriori dentro del modelo. Fascinante.
Autoencoders dispersos aplicados a un modelo de producción: millones de características identificables y manipulables.
Por qué las neuronas representan más conceptos que dimensiones tienen. Explica por qué interpretar redes es tan difícil.
✍️ Blog/Post
La hoja de ruta más honesta para entrar al campo, incluyendo qué NO hacer. Además: '200 Concrete Open Problems'.
El origen del programa de circuitos, aplicado a visión. Las visualizaciones siguen sin ser superadas.
🐙 Repo
Preguntas frecuentes sobre interpretabilidad
¿Se puede saber por qué un modelo de IA responde lo que responde?
Parcialmente, y es un área de investigación muy activa. Existen técnicas para identificar qué características internas se activan y trazar cómo influyen en la salida. Todavía está lejos de ser una auditoría confiable y completa, pero dejó de ser puramente académica.
¿Qué son los autoencoders dispersos (SAE)?
Son modelos auxiliares que descomponen las activaciones internas de una red en muchas características individuales e interpretables. Atacan el problema de la superposición: que una misma neurona representa varios conceptos a la vez, lo que hace ilegible el modelo si se lo mira neurona por neurona.