Entrenar un modelo de IA desde cero
Nunca vas a entrenar un modelo frontera solo, y no es el objetivo. Pero entrenar uno chico de punta a punta —tokenizador, arquitectura, datos, bucle de entrenamiento, evaluación— cambia irreversiblemente cómo entendés a los grandes. Deja de ser una caja negra y pasa a ser un sistema con partes que ya tocaste.
El recorrido canónico está bien establecido: nanoGPT para reproducir GPT-2 a escala manejable, Stanford CS336 para el pipeline completo con paralelismo y kernels, y los playbooks de entrenamiento a escala para la parte que los papers omiten: qué se rompe en un cluster, cómo se detectan divergencias y cuánto del trabajo real es infraestructura y no ciencia.
16 recursos para entrenar un modelo desde cero
Ordenados con los imprescindibles primero y agrupados por tipo. Los marcados con ★ son los que recomendaría alguien que ya recorrió el camino; los que dicen «gratis» no cuestan nada.
🎓 Curso
📚 Libro
📄 Paper
✍️ Blog/Post
La bitácora honesta de entrenar SmolLM3: ablaciones, picos de loss, bugs de infraestructura, decisiones de datos. Lo que ningún paper te cuenta.
Paralelismo de datos, tensorial, de pipeline, de contexto y de expertos, explicado con más de 4000 experimentos reales. Gratis y sin equivalente.
🐙 Repo
Notebooks, bonus sobre Llama/Qwen/Gemma, DPO, KV cache y MoE. Se actualiza constantemente.
~300 líneas que reproducen GPT-2. El repositorio educativo más copiado del mundo.
El pipeline COMPLETO de un ChatGPT mínimo por ~100 dólares: tokenizador, pretraining, SFT, RL, inferencia y UI web. La culminación de todo lo que enseña Karpathy.
ZeRO, offloading a CPU/NVMe, inferencia optimizada. Estándar de facto en muchos clusters.
La implementación industrial de paralelismo tensorial y de pipeline. Ver también el paper original (arXiv:1909.08053).
El equivalente del anterior pero para modelos de razonamiento: cadena de pensamiento, verificadores, RL.
Entrenamiento en JAX con foco en reproducibilidad bit a bit. Proyecto asociado: Marin, un laboratorio abierto de modelos.
Entrenamiento de GPT-2 en C/CUDA puro, sin PyTorch. Para entender qué hace realmente el hardware.
Competencia abierta por entrenar GPT-2 lo más rápido posible. Cada récord introduce un truco real (optimizador Muon, atención con ventanas, etc.). Aprendizaje por ingeniería inversa.
Pretraining 3D-parallel minimalista y legible. Ideal para leer código de escala sin ahogarte.
Referencia oficial de PyTorch para pretraining a gran escala: FSDP2, tensor/pipeline parallel, torch.compile, float8.
Preguntas frecuentes sobre entrenar desde cero
¿Cuánto cuesta entrenar un modelo de lenguaje?
Reproducir algo del tamaño de GPT-2 cuesta hoy decenas de dólares en GPUs alquiladas, con código abierto disponible. Un modelo abierto competitivo de tamaño medio está en el orden de cientos de miles a millones. Los modelos frontera están en cientos de millones. La curva de costo por unidad de capacidad viene bajando muy rápido.
¿Puedo entrenar un modelo con una sola GPU?
Un modelo chico, sí, y es el mejor ejercicio de aprendizaje que existe. Para adaptar un modelo grande ya entrenado a una tarea propia con una sola GPU está el fine-tuning con LoRA o QLoRA, que es otra cosa y mucho más barata.