Interpretabilidad: mirar adentro de un modelo

La interpretabilidad intenta responder una pregunta incómoda: sabemos que estos modelos funcionan, pero no sabemos bien por qué. Abrirlos y mirar adentro —encontrar circuitos, características, patrones de atribución— es el intento más serio de convertir eso en conocimiento.

Es además una de las pocas áreas donde alguien con una GPU y buenas ideas todavía puede producir resultados relevantes, porque el cuello de botella es conceptual y no de cómputo. En los últimos años pasó de resultados en modelos de juguete a encontrar características manipulables en modelos de producción y a trazar grafos de atribución que muestran planificación anticipada y racionalización a posteriori.

11 recursos de interpretabilidad

Ordenados con los imprescindibles primero y agrupados por tipo. Los marcados con ★ son los que recomendaría alguien que ya recorrió el camino; los que dicen «gratis» no cuestan nada.

🎓 Curso

📚 Libro

📄 Paper

✍️ Blog/Post

🐙 Repo

Preguntas frecuentes sobre interpretabilidad

¿Se puede saber por qué un modelo de IA responde lo que responde?

Parcialmente, y es un área de investigación muy activa. Existen técnicas para identificar qué características internas se activan y trazar cómo influyen en la salida. Todavía está lejos de ser una auditoría confiable y completa, pero dejó de ser puramente académica.

¿Qué son los autoencoders dispersos (SAE)?

Son modelos auxiliares que descomponen las activaciones internas de una red en muchas características individuales e interpretables. Atacan el problema de la superposición: que una misma neurona representa varios conceptos a la vez, lo que hace ilegible el modelo si se lo mira neurona por neurona.