Datos, tokenización y leyes de escalado
La parte menos glamorosa y más determinante. La calidad del corpus explica más varianza entre modelos que la arquitectura: dos equipos con el mismo diseño y presupuesto distinto de curación de datos terminan con modelos muy distintos. Casi nadie publica su receta completa, y esa opacidad es en sí misma un dato sobre dónde está el valor.
Las leyes de escalado son lo que convirtió el entrenamiento en ingeniería predecible: permiten estimar qué desempeño vas a obtener con determinado cómputo, datos y parámetros antes de gastar el presupuesto. Chinchilla corrigió el equilibrio hacia más datos; después el eje se corrió otra vez, esta vez hacia el cómputo en tiempo de inferencia.
12 recursos de datos, tokenización y scaling laws
Ordenados con los imprescindibles primero y agrupados por tipo. Los marcados con ★ son los que recomendaría alguien que ya recorrió el camino; los que dicen «gratis» no cuestan nada.
📄 Paper
El paper que convirtió el progreso de la IA en una ecuación. Pérdida como ley de potencia de cómputo, datos y parámetros.
Corrigió a Kaplan: los modelos estaban muy subentrenados en datos. Reescribió el presupuesto de entrenamiento de toda la industria.
Curar bien los datos puede romper la ley de potencia. Uno de los resultados más accionables sobre calidad de datos.
Corpus abierto con toolkit de curación documentado. Complemento perfecto de OLMo.
Cómo se construye realmente un corpus de 15T tokens: deduplicación, filtros, clasificadores educativos. El blog interactivo asociado es aún mejor que el paper.
El origen de Byte-Pair Encoding, el algoritmo detrás de casi todos los tokenizadores actuales.
Qué pasa cuando repetís datos (spoiler: se degrada peor de lo que pensás). Crucial ahora que los datos web de calidad escasean.
Datos sintéticos de altísima calidad superan a montañas de datos web. Inició la línea de modelos pequeños sorprendentemente capaces.
El primer corpus abierto grande y documentado. Referencia histórica sobre composición de datos.
✍️ Blog/Post
Un ensayo de una página que explica 70 años de historia de la IA: los métodos generales que escalan con cómputo siempre ganan. El texto más citado del campo.
El ensayo que articuló, antes que casi nadie, por qué la escala sola iba a llevar tan lejos. Documento histórico.
🐙 Repo
Preguntas frecuentes sobre datos, tokenización y scaling laws
¿Qué son las scaling laws o leyes de escalado?
Son relaciones empíricas —típicamente leyes de potencia— entre la pérdida de un modelo y el cómputo, los datos y los parámetros usados para entrenarlo. Permiten extrapolar desde experimentos chicos y baratos qué va a pasar a escala grande, y son el hallazgo empírico más robusto que tiene el campo.
¿Se están agotando los datos para entrenar IA?
El stock de texto público de alta calidad tiene margen estrecho según las proyecciones más citadas. La respuesta de la industria son datos sintéticos, currículums curados, entornos verificables y aprendizaje por refuerzo: si no quedan datos humanos nuevos, el aprendizaje tiene que venir de la interacción.