Datos, tokenización y leyes de escalado

La parte menos glamorosa y más determinante. La calidad del corpus explica más varianza entre modelos que la arquitectura: dos equipos con el mismo diseño y presupuesto distinto de curación de datos terminan con modelos muy distintos. Casi nadie publica su receta completa, y esa opacidad es en sí misma un dato sobre dónde está el valor.

Las leyes de escalado son lo que convirtió el entrenamiento en ingeniería predecible: permiten estimar qué desempeño vas a obtener con determinado cómputo, datos y parámetros antes de gastar el presupuesto. Chinchilla corrigió el equilibrio hacia más datos; después el eje se corrió otra vez, esta vez hacia el cómputo en tiempo de inferencia.

12 recursos de datos, tokenización y scaling laws

Ordenados con los imprescindibles primero y agrupados por tipo. Los marcados con ★ son los que recomendaría alguien que ya recorrió el camino; los que dicen «gratis» no cuestan nada.

📄 Paper

Scaling Laws for Neural Language Models ★ · Kaplan et al. (OpenAI)

El paper que convirtió el progreso de la IA en una ecuación. Pérdida como ley de potencia de cómputo, datos y parámetros.

📄 Paper Intermedio 2020 Datos, tokenización y scaling laws
Training Compute-Optimal Large Language Models (Chinchilla) ★ · Hoffmann et al. (DeepMind)

Corrigió a Kaplan: los modelos estaban muy subentrenados en datos. Reescribió el presupuesto de entrenamiento de toda la industria.

📄 Paper Intermedio 2022 Datos, tokenización y scaling laws
Beyond neural scaling laws: beating power law scaling via data pruning · Sorscher et al.

Curar bien los datos puede romper la ley de potencia. Uno de los resultados más accionables sobre calidad de datos.

📄 Paper Avanzado 2022 Datos, tokenización y scaling laws
Dolma: an Open Corpus of Three Trillion Tokens · Allen Institute for AI

Corpus abierto con toolkit de curación documentado. Complemento perfecto de OLMo.

📄 Paper Intermedio 2024 Datos, tokenización y scaling laws
FineWeb: decanting the web for the finest text data at scale · Hugging Face

Cómo se construye realmente un corpus de 15T tokens: deduplicación, filtros, clasificadores educativos. El blog interactivo asociado es aún mejor que el paper.

📄 Paper Avanzado 2024 Datos, tokenización y scaling laws
Neural Machine Translation of Rare Words with Subword Units (BPE) · Sennrich, Haddow, Birch

El origen de Byte-Pair Encoding, el algoritmo detrás de casi todos los tokenizadores actuales.

📄 Paper Avanzado 2015 Datos, tokenización y scaling laws
Scaling Laws and Interpretability of Learning from Repeated Data · Anthropic

Qué pasa cuando repetís datos (spoiler: se degrada peor de lo que pensás). Crucial ahora que los datos web de calidad escasean.

📄 Paper Avanzado 2022 Datos, tokenización y scaling laws
Textbooks Are All You Need (phi-1) · Microsoft Research

Datos sintéticos de altísima calidad superan a montañas de datos web. Inició la línea de modelos pequeños sorprendentemente capaces.

📄 Paper Intermedio 2023 Datos, tokenización y scaling laws
The Pile: An 800GB Dataset of Diverse Text · EleutherAI

El primer corpus abierto grande y documentado. Referencia histórica sobre composición de datos.

📄 Paper Intermedio 2020 Datos, tokenización y scaling laws

✍️ Blog/Post

🐙 Repo

Preguntas frecuentes sobre datos, tokenización y scaling laws

¿Qué son las scaling laws o leyes de escalado?

Son relaciones empíricas —típicamente leyes de potencia— entre la pérdida de un modelo y el cómputo, los datos y los parámetros usados para entrenarlo. Permiten extrapolar desde experimentos chicos y baratos qué va a pasar a escala grande, y son el hallazgo empírico más robusto que tiene el campo.

¿Se están agotando los datos para entrenar IA?

El stock de texto público de alta calidad tiene margen estrecho según las proyecciones más citadas. La respuesta de la industria son datos sintéticos, currículums curados, entornos verificables y aprendizaje por refuerzo: si no quedan datos humanos nuevos, el aprendizaje tiene que venir de la interacción.