Evaluación de modelos de IA y benchmarks

Es la habilidad más subestimada del campo y la que más rápido separa a alguien que construye prototipos de alguien que construye productos. Sin evaluaciones no hay ingeniería: hay intuición disfrazada de criterio.

Todo benchmark público tiende a contaminarse —termina, de una u otra forma, dentro de los datos de entrenamiento— o a saturarse. Por eso lo importante nunca es el número que se anuncia, sino entender qué mide exactamente y qué deja afuera. Y por eso, para cualquier producto real, las evaluaciones que importan son las propias: construidas sobre tus casos, con tus criterios y revisadas a mano al menos una vez.

13 recursos de evaluación y benchmarks

Ordenados con los imprescindibles primero y agrupados por tipo. Los marcados con ★ son los que recomendaría alguien que ya recorrió el camino; los que dicen «gratis» no cuestan nada.

📄 Paper

✍️ Blog/Post

🐙 Repo

🛠️ Herramienta

📊 Benchmark

Preguntas frecuentes sobre evaluación y benchmarks

¿Cómo se mide si un modelo de IA es bueno?

Con benchmarks estandarizados para comparar modelos entre sí, y con evaluaciones propias para decidir si sirve para tu caso. Las segundas importan mucho más: un modelo puede liderar tablas públicas y fallar en tu tarea específica. La práctica mínima es un conjunto de casos representativos con criterios explícitos de acierto.

¿Qué es la contaminación de benchmarks?

Que los datos de evaluación hayan quedado, directa o indirectamente, dentro del corpus de entrenamiento. El modelo entonces no generaliza: recuerda. Es una de las razones por las que los puntajes públicos hay que leerlos con escepticismo, sobre todo en benchmarks viejos y muy citados.