Entrenar un modelo de IA desde cero

Nunca vas a entrenar un modelo frontera solo, y no es el objetivo. Pero entrenar uno chico de punta a punta —tokenizador, arquitectura, datos, bucle de entrenamiento, evaluación— cambia irreversiblemente cómo entendés a los grandes. Deja de ser una caja negra y pasa a ser un sistema con partes que ya tocaste.

El recorrido canónico está bien establecido: nanoGPT para reproducir GPT-2 a escala manejable, Stanford CS336 para el pipeline completo con paralelismo y kernels, y los playbooks de entrenamiento a escala para la parte que los papers omiten: qué se rompe en un cluster, cómo se detectan divergencias y cuánto del trabajo real es infraestructura y no ciencia.

16 recursos para entrenar un modelo desde cero

Ordenados con los imprescindibles primero y agrupados por tipo. Los marcados con ★ son los que recomendaría alguien que ya recorrió el camino; los que dicen «gratis» no cuestan nada.

🎓 Curso

📚 Libro

📄 Paper

✍️ Blog/Post

🐙 Repo

LLMs-from-scratch (código del libro) ★ · Sebastian Raschka

Notebooks, bonus sobre Llama/Qwen/Gemma, DPO, KV cache y MoE. Se actualiza constantemente.

🐙 Repo Intermedio 2025 gratis Entrenar desde cero
nanoGPT ★ · Andrej Karpathy

~300 líneas que reproducen GPT-2. El repositorio educativo más copiado del mundo.

🐙 Repo Intermedio 2024 gratis Entrenar desde cero
nanochat ★ · Andrej Karpathy

El pipeline COMPLETO de un ChatGPT mínimo por ~100 dólares: tokenizador, pretraining, SFT, RL, inferencia y UI web. La culminación de todo lo que enseña Karpathy.

🐙 Repo Avanzado 2025 gratis Entrenar desde cero
DeepSpeed · Microsoft

ZeRO, offloading a CPU/NVMe, inferencia optimizada. Estándar de facto en muchos clusters.

🐙 Repo Avanzado 2025 gratis Entrenar desde cero
Megatron-LM · NVIDIA

La implementación industrial de paralelismo tensorial y de pipeline. Ver también el paper original (arXiv:1909.08053).

🐙 Repo Avanzado 2025 gratis Entrenar desde cero
Reasoning-From-Scratch · Sebastian Raschka

El equivalente del anterior pero para modelos de razonamiento: cadena de pensamiento, verificadores, RL.

🐙 Repo Avanzado 2025 gratis Entrenar desde cero
levanter / marin · Stanford CRFM

Entrenamiento en JAX con foco en reproducibilidad bit a bit. Proyecto asociado: Marin, un laboratorio abierto de modelos.

🐙 Repo Avanzado 2025 gratis Entrenar desde cero
llm.c · Andrej Karpathy

Entrenamiento de GPT-2 en C/CUDA puro, sin PyTorch. Para entender qué hace realmente el hardware.

🐙 Repo Avanzado 2024 gratis Entrenar desde cero
modded-nanogpt (NanoGPT speedrun) · Keller Jordan y comunidad

Competencia abierta por entrenar GPT-2 lo más rápido posible. Cada récord introduce un truco real (optimizador Muon, atención con ventanas, etc.). Aprendizaje por ingeniería inversa.

🐙 Repo Intermedio 2025 gratis Entrenar desde cero
nanotron · Hugging Face

Pretraining 3D-parallel minimalista y legible. Ideal para leer código de escala sin ahogarte.

🐙 Repo Avanzado 2025 gratis Entrenar desde cero
torchtitan · PyTorch

Referencia oficial de PyTorch para pretraining a gran escala: FSDP2, tensor/pipeline parallel, torch.compile, float8.

🐙 Repo Avanzado 2025 gratis Entrenar desde cero

Preguntas frecuentes sobre entrenar desde cero

¿Cuánto cuesta entrenar un modelo de lenguaje?

Reproducir algo del tamaño de GPT-2 cuesta hoy decenas de dólares en GPUs alquiladas, con código abierto disponible. Un modelo abierto competitivo de tamaño medio está en el orden de cientos de miles a millones. Los modelos frontera están en cientos de millones. La curva de costo por unidad de capacidad viene bajando muy rápido.

¿Puedo entrenar un modelo con una sola GPU?

Un modelo chico, sí, y es el mejor ejercicio de aprendizaje que existe. Para adaptar un modelo grande ya entrenado a una tarea propia con una sola GPU está el fine-tuning con LoRA o QLoRA, que es otra cosa y mucho más barata.