Evaluación de modelos de IA y benchmarks
Es la habilidad más subestimada del campo y la que más rápido separa a alguien que construye prototipos de alguien que construye productos. Sin evaluaciones no hay ingeniería: hay intuición disfrazada de criterio.
Todo benchmark público tiende a contaminarse —termina, de una u otra forma, dentro de los datos de entrenamiento— o a saturarse. Por eso lo importante nunca es el número que se anuncia, sino entender qué mide exactamente y qué deja afuera. Y por eso, para cualquier producto real, las evaluaciones que importan son las propias: construidas sobre tus casos, con tus criterios y revisadas a mano al menos una vez.
13 recursos de evaluación y benchmarks
Ordenados con los imprescindibles primero y agrupados por tipo. Los marcados con ★ son los que recomendaría alguien que ya recorrió el camino; los que dicen «gratis» no cuestan nada.
📄 Paper
Usar modelos como jueces funciona, pero con sesgos medibles (posición, verbosidad, auto-preferencia). Leé esto antes de confiar en tu LLM-judge.
Y 'Datasheets for Datasets' (arXiv:1803.09010). Documentar qué hace un modelo y con qué datos es parte del oficio.
✍️ Blog/Post
🐙 Repo
El estándar de facto para evaluar modelos de lenguaje. Es lo que corre detrás de casi todos los leaderboards.
Framework de evaluaciones de nivel gubernamental: agentes, herramientas, scorers, sandboxing. Muy bien diseñado.
Herramientas prácticas para evaluar aplicaciones LLM y RAG: red-teaming, comparación de prompts, métricas de recuperación.
🛠️ Herramienta
Ranking por comparación ciega entre modelos, votada por humanos. El benchmark menos contaminable que existe, aunque mide preferencia, no capacidad.
La mejor fuente de datos duros sobre cómputo, costos de entrenamiento, tendencias de capacidad y proyecciones. Rigurosa y sin hype.
Evaluación multidimensional: precisión, calibración, robustez, sesgo, toxicidad, eficiencia. No solo un número.
Benchmarks con preguntas nuevas cada mes para evitar contaminación de datos de entrenamiento. Cada vez más necesarios.
📊 Benchmark
Diseñado explícitamente para resistir la memorización: mide adquisición de habilidades nuevas, no conocimiento almacenado. El benchmark conceptualmente más interesante.
Benchmarks 'a prueba de Google' para conocimiento experto y matemática de investigación. Reemplazaron a MMLU cuando este se saturó.
Resolver issues reales de GitHub. Se convirtió en el benchmark que define el progreso de los agentes de programación.
Preguntas frecuentes sobre evaluación y benchmarks
¿Cómo se mide si un modelo de IA es bueno?
Con benchmarks estandarizados para comparar modelos entre sí, y con evaluaciones propias para decidir si sirve para tu caso. Las segundas importan mucho más: un modelo puede liderar tablas públicas y fallar en tu tarea específica. La práctica mínima es un conjunto de casos representativos con criterios explícitos de acierto.
¿Qué es la contaminación de benchmarks?
Que los datos de evaluación hayan quedado, directa o indirectamente, dentro del corpus de entrenamiento. El modelo entonces no generaliza: recuerda. Es una de las razones por las que los puntajes públicos hay que leerlos con escepticismo, sobre todo en benchmarks viejos y muy citados.