/

Todo para aprender
cómo funcionan los modelos de IA

Desde la matemática que hay debajo hasta cómo se entrena un modelo frontera, cómo se lo alinea, cómo se lo sirve y qué se discute hoy sobre lo que viene. Cada recurso está acá porque alguien lo usó para aprender de verdad, no porque aparezca en una lista de listas.

Tipo de recurso
Nivel y atajos

🧭 Rutas de aprendizaje

El error más común es empezar por todos lados a la vez. Elegí una ruta según de dónde venís, seguila en orden y recién después dispersate. Cada paso enlaza a la sección correspondiente.

🌱 Nunca entrené un modelo

Sabés programar poco o nada. Meta: entender qué es una red neuronal y entrenar una.
  1. Intuición visual: la serie de redes neuronales de 3Blue1Brown, completa.
  2. Python básico si hace falta, y NumPy con foco en shapes.
  3. Machine Learning Specialization de Andrew Ng, o fast.ai si preferís aprender haciendo.
  4. micrograd de Karpathy: construí un motor de autodiff en 100 líneas.
  5. Un proyecto propio con datos que te importen. Sin proyecto no se consolida nada.

🔨 Quiero construir con LLMs

Sos desarrollador. Meta: productos con modelos, no entrenarlos desde cero.
  1. Deep Dive into LLMs de Karpathy (3h30). Empezá por acá, siempre.
  2. Prompting y contexto: las guías de Anthropic y OpenAI, más "Building Effective Agents".
  3. Evaluaciones antes que nada: el post de Hamel Husain sobre evals. Esto separa juguetes de productos.
  4. RAG y agentes: el curso de agentes de HF, DSPy y el Model Context Protocol.
  5. Inferencia: vLLM u Ollama, cuantización, y las cuentas de costo real por token.
  6. Fine-tuning al final, solo si las evals demuestran que hace falta.

🧪 Quiero entrenar modelos

Base sólida de programación y matemática. Meta: entender y modificar el pipeline completo.
  1. Neural Networks: Zero to Hero completo, escribiendo el código vos.
  2. Understanding Deep Learning (Prince) como libro de referencia paralelo.
  3. Attention Is All You Need + The Annotated Transformer + The Illustrated Transformer.
  4. Stanford CS336: tokenizador, arquitectura, kernels, entrenamiento distribuido, scaling laws.
  5. nanoGPT → nanochat: reproducí GPT-2 y después el pipeline completo con post-training.
  6. Ultra-Scale Playbook + Smol Training Playbook para la realidad de los clusters.
  7. Post-training: InstructGPT, DPO, GRPO, y open-r1 para leer código real de RLVR.

🔬 Quiero investigar

Meta: contribuir a interpretabilidad, alineamiento o arquitecturas.
  1. Base matemática sólida: Mathematics for Machine Learning + Murphy como referencia.
  2. ARENA completo: es el currículum más directo hacia investigación técnica en seguridad.
  3. Los papers de circuitos de Anthropic, en orden cronológico, con TransformerLens abierto al lado.
  4. Reproducí un paper chico de punta a punta. Es el filtro real entre leer e investigar.
  5. Escribí en público lo que encontrás: blog, LessWrong, Alignment Forum. Así se entra al campo hoy.
  6. Elegí un problema abierto concreto — los "200 Concrete Open Problems" de Neel Nanda son un buen catálogo.
Una advertencia sobre el consumo pasivo

Mirar videos y leer papers da una sensación de progreso que no siempre se corresponde con aprendizaje. La regla práctica: por cada hora de consumo, una hora escribiendo código que rompe, se debuguea y funciona. Si nunca te peleaste con un shape mismatch, todavía no aprendiste el tema.

📐 Matemática

Álgebra lineal, cálculo, probabilidad y optimización: lo mínimo indispensable para no leer papers como si fueran magia. No necesitás una licenciatura, pero sí estas cuatro cosas.

⌨️ Programación y tooling

Python, PyTorch, JAX y las herramientas con las que vas a pasar el 90% del tiempo. Aprender a debuggear tensores vale más que memorizar arquitecturas.

📈 Machine learning clásico

Regresión, árboles, validación cruzada, bias-variance. Sigue siendo la mejor herramienta para la mayoría de los problemas tabulares reales, y los conceptos de generalización se aprenden mejor acá que con transformers.

🧠 Deep learning

Redes profundas, backpropagation, optimización, regularización y los fenómenos que todavía no entendemos del todo (doble descenso, grokking, la hipótesis de la lotería).

🏗️ Arquitecturas

El transformer es el sustrato dominante, pero no es el final de la historia. Acá está el mapa completo: las piezas que casi todos los modelos comparten (RoPE, RMSNorm, SwiGLU, GQA), las apuestas de eficiencia (MoE, mixture-of-depths) y las alternativas serias (espacios de estados, híbridos, sin tokenizador).

🔤 Transformers y LLMs

De "Attention Is All You Need" a los reportes técnicos de los modelos frontera actuales. Los reportes de Llama 3 y DeepSeek-V3 enseñan más sobre cómo se construye un modelo que la mayoría de los cursos.

⚙️ Entrenar desde cero

El pipeline completo de pre-entrenamiento. Nunca vas a entrenar un modelo frontera vos solo, pero entrenar uno chico de punta a punta cambia irreversiblemente cómo entendés a los grandes.

🗃️ Datos, tokenización y scaling laws

La parte menos glamorosa y más determinante. La calidad del corpus explica más varianza entre modelos que la arquitectura, y las leyes de escalado son lo que permite predecir el resultado antes de gastar el presupuesto.

🎯 Post-training, RLHF y razonamiento

Un modelo pre-entrenado no es un asistente: es un autocompletador de internet. Todo lo que hace útil a un modelo pasa acá. Desde 2025 esta es además la fase donde se concentra la mayor parte de las ganancias.

🔧 Fine-tuning práctico

LoRA, QLoRA y las herramientas para adaptar un modelo con una sola GPU. Advertencia frecuente entre quienes lo hacen a diario: la mayoría de los problemas que se intentan resolver con fine-tuning se resuelven mejor con mejores prompts, recuperación o evaluaciones.

Inferencia y optimización

Entrenar se hace una vez; servir se hace millones de veces. Acá se define el costo real de un producto: KV cache, batching continuo, cuantización, decodificación especulativa y el ancho de banda de memoria como cuello de botella.

🖥️ Infraestructura y GPUs

CUDA, Triton, clusters, tracking de experimentos y la economía del cómputo. Saber leer un roofline te ahorra semanas de optimizar lo que no era el problema.

🤖 RAG, agentes y contexto

Recuperación, uso de herramientas, memoria y orquestación. El término "prompt engineering" quedó chico: lo que importa hoy es la ingeniería de contexto, es decir, decidir qué información entra a la ventana en cada paso y qué se descarta.

🎨 Multimodal y generativos

Visión, difusión, audio, video y modelos del mundo. Dejó de ser un anexo del texto: los modelos frontera hoy nacen multimodales.

📊 Evaluación y benchmarks

Sin evaluaciones no hay ingeniería, hay intuición disfrazada. Y todo benchmark público tiende a contaminarse o saturarse: por eso lo importante no es el número, sino entender qué mide y qué no.

🔬 Interpretabilidad

Abrir el modelo y mirar adentro. Es una de las pocas áreas donde alguien con una GPU y buenas ideas todavía puede producir resultados relevantes, porque el cuello de botella es conceptual y no de cómputo.

🛡️ Alineamiento y seguridad

Desde problemas técnicos concretos (reward hacking, jailbreaks, supervisión escalable) hasta gobernanza y regulación. Incluye deliberadamente autores que están en desacuerdo entre sí.

📡 Blogs, canales y podcasts

El campo se mueve más rápido que los libros. Estas son las fuentes que vale la pena seguir de forma sostenida. Con dos newsletters y tres blogs alcanza: seguir todo es una forma elegante de no aprender nada.

👥 Cuentas y comunidades

Buena parte de la discusión real ocurre en X, Discord y Reddit semanas antes de llegar a un paper. Estas son las fuentes con mejor relación señal/ruido.

🌎 Recursos en español

Material de calidad en castellano. Es honestamente menos y suele ir algo atrasado respecto del inglés: sirve como puente y para intuición, pero en algún momento vas a tener que leer papers en inglés. No hay atajo.

🗺️ Línea de tiempo

Cómo llegamos hasta acá, en trece momentos. Leer estos papers en orden es la mejor forma de entender por qué el campo tomó las decisiones que tomó.

2012

AlexNet — el deep learning se vuelve inevitable

Una CNN entrenada en GPUs pulveriza ImageNet. Empieza la era en la que el cómputo, y no el diseño manual de features, define el estado del arte.

2014-2015

Seq2seq, atención y ResNets

Bahdanau introduce la atención para traducción; las conexiones residuales permiten entrenar redes muy profundas. Las dos piezas que faltaban para lo que vendría.

2017

Attention Is All You Need

Se tira la recurrencia por la ventana y queda solo la atención. Paralelizable, escalable, y todavía hoy la base de casi todo.

2018-2019

BERT y GPT-2 — el pre-entrenamiento se impone

Se bifurcan las dos ramas: encoder bidireccional para comprensión, decoder autorregresivo para generación. Gana la segunda.

2020

Scaling laws + GPT-3

El progreso se vuelve predecible: una ley de potencia en cómputo, datos y parámetros. Y aparece el aprendizaje en contexto, que nadie había pedido explícitamente.

2020-2021

Difusión y CLIP

La generación de imágenes cambia de paradigma. Alinear texto e imagen en un mismo espacio abre la puerta a todo lo multimodal.

2022 (marzo)

Chinchilla e InstructGPT

Dos correcciones el mismo mes: los modelos estaban subentrenados en datos, y el problema real no era la capacidad sino seguir instrucciones.

2022 (noviembre)

ChatGPT

Ninguna novedad técnica mayor: una interfaz. Y sin embargo es el momento en que el campo deja de ser un asunto académico.

2023

LLaMA, LoRA y el ecosistema abierto

Pesos abiertos + adaptación barata = miles de personas entrenando modelos en su casa. FlashAttention hace que todo eso además sea rápido.

2024

Contexto largo, MoE y agentes

Ventanas de un millón de tokens, mezcla de expertos como estándar de facto, y los primeros agentes que hacen trabajo real de varios pasos.

2024 (septiembre)

o1 y el cómputo en tiempo de inferencia

Aparece el segundo eje de escalado: pensar más tiempo antes de responder. El entrenamiento deja de ser la única palanca.

2025 (enero)

DeepSeek-R1

El razonamiento emerge de RL con recompensas verificables, se publica en abierto y a un costo mucho menor del que se creía necesario. El campo entero se reorganiza alrededor de esto.

2025-2026

Agentes, memoria y arquitecturas híbridas

El foco se corre de "responder bien" a "completar tareas largas de forma autónoma". Vuelven a discutirse en serio el aprendizaje continuo, los modelos del mundo y las alternativas a la atención pura.

🔮 Qué se viene

Esta sección envejece más rápido que el resto, así que está escrita separando tres cosas que suelen mezclarse: lo que es apuesta segura, lo que está cambiando ahora mismo, y lo que está genuinamente en disputa.

1. Apuestas seguras: lo que estudiar hoy sigue valiendo en diez años

Si tu tiempo de estudio es limitado, invertilo acá. Nada de esto depende de qué modelo esté de moda.

  • La matemática de base. Álgebra lineal, cálculo, probabilidad y optimización no cambiaron y no van a cambiar. Toda arquitectura futura se va a describir con este vocabulario.
  • El descenso por gradiente y la diferenciación automática. Podemos cambiar de arquitectura, de optimizador o de precisión numérica; el esquema de "definir una pérdida y bajar por el gradiente" lleva seis décadas resistiendo.
  • La lección amarga. Los métodos generales que aprovechan más cómputo terminan superando a los que codifican conocimiento humano. Se cumplió tantas veces que conviene tratarla como un prior fuerte al evaluar cualquier propuesta nueva.
  • Que el progreso escala con recursos de forma predecible. Las constantes cambian y los ejes se mueven (parámetros → datos → cómputo de inferencia), pero la existencia de curvas de escalado predecibles es el hallazgo empírico más robusto del campo.
  • La destilación. Modelos grandes que entrenan modelos chicos: es la técnica con mejor retorno económico de la industria y no hay razón para que deje de serlo.
  • La evaluación como disciplina. A medida que los sistemas se vuelven más autónomos, medir bien se vuelve más difícil y más valioso. Es la habilidad más subestimada del campo.
  • Los conceptos, no las implementaciones. Representaciones distribuidas, atención como mecanismo de enrutamiento de información, cuellos de botella de memoria, sobreajuste. Sobreviven a cualquier cambio de arquitectura.
Regla práctica

Si un recurso te enseña por qué algo funciona, casi seguro sigue siendo válido dentro de cinco años. Si te enseña qué botón apretar en una librería, probablemente esté obsoleto en seis meses. Priorizá el primero y aprendé el segundo cuando lo necesites.

2. Lo que está cambiando ahora mismo (2025-2026)

Estas transiciones ya ocurrieron o están ocurriendo. No son predicciones: son el estado actual del campo, y explican por qué material de 2023 puede sonar viejo.

El escalado se corrió del pre-entrenamiento

Durante años, "mejorar el modelo" significaba entrenar uno más grande con más datos. Hoy la mayor parte de las ganancias viene del post-entrenamiento y del cómputo en tiempo de inferencia: RL con recompensas verificables, cadenas de razonamiento largas, búsqueda y verificación. DeepSeek-R1 lo volvió público y reproducible, y desde entonces el gasto se corrió hacia esa etapa.

De modelos a agentes

La unidad de análisis dejó de ser "el modelo" y pasó a ser el sistema completo: modelo + herramientas + memoria + bucle de control. Buena parte del progreso visible del último año viene del andamiaje alrededor del modelo, no de los pesos. La métrica que mejor captura esto es el horizonte temporal de tareas que un sistema completa de forma autónoma, que viene duplicándose aproximadamente cada siete meses.

Arquitecturas híbridas y eficiencia

La mezcla de expertos es hoy el estándar de facto en modelos frontera: activar una fracción de los parámetros por token. En paralelo, los modelos de espacio de estados dejaron de ser una curiosidad y aparecen como capas intercaladas con atención en modelos de producción. La atención cuadrática pura ya no es la única opción seria.

Los datos humanos de calidad se están agotando

Las proyecciones sobre el stock de texto público de alta calidad convergen en que el margen es estrecho. La respuesta de la industria son datos sintéticos, currículums cuidados, entornos verificables y RL. Esto conecta directamente con la tesis de la "era de la experiencia": si no quedan datos humanos que consumir, el aprendizaje tiene que venir de la interacción.

Modelos chicos sorprendentemente capaces

Destilación más datos curados hicieron que modelos de 3B a 30B parámetros hagan hoy lo que en 2023 requería cientos de miles de millones. Consecuencia práctica: cada vez más casos de uso se resuelven local, barato y sin enviar datos a ningún lado.

La interpretabilidad empezó a ser útil

Pasó de resultados en modelos de juguete a encontrar características manipulables en modelos de producción y a trazar grafos de atribución que muestran planificación anticipada y racionalización a posteriori. Todavía está lejos de ser una herramienta de auditoría confiable, pero dejó de ser puramente académica.

3. Lo que está genuinamente en disputa

Acá hay gente muy inteligente en desacuerdo profundo. Desconfiá de quien te presente cualquiera de estos puntos como resuelto, en cualquier dirección.

La preguntaUna posiciónLa otra
¿Alcanza con escalar? Las curvas siguen sin quebrarse; falta ingeniería, no ideas nuevas. Los LLMs interpolan sobre lo visto; falta un mecanismo de generalización que no tenemos (Chollet, LeCun).
¿Los modelos "razonan"? Las cadenas largas resuelven problemas genuinamente nuevos y verificables. Es búsqueda sobre patrones memorizados que colapsa al subir la complejidad estructural.
¿El RL crea capacidades o las revela? El RL con recompensas verificables enseña habilidades nuevas de razonamiento. Solo amplifica lo que el modelo base ya podía hacer con muestreo suficiente.
¿Sobrevive el transformer? La inercia de hardware y software es enorme; se seguirá modificando por dentro. Los híbridos, los modelos sin tokenizador y los modelos del mundo lo van a desplazar en 3-5 años.
¿Cuándo llega el aprendizaje continuo? Memoria en tiempo de test y arquitecturas tipo Titans ya apuntan en esa dirección. El olvido catastrófico sigue sin resolverse y puede requerir un cambio de paradigma.
¿Cuándo llega la IA general? Esta década, por extrapolación de las curvas de capacidad y autonomía. La definición misma es confusa y la difusión real la limitan las instituciones, no la capacidad.
¿La inversión actual es sostenible? El capex se justifica: la demanda de inferencia crece más rápido que la oferta. Hay una brecha grande entre gasto en cómputo e ingresos; una corrección afectaría el ritmo del campo.

4. Qué mirar para actualizar tus creencias

En vez de seguir opiniones, seguí indicadores. Estas son las señales que efectivamente distinguen entre los escenarios de la tabla anterior:

  1. Benchmarks resistentes a la memorización (ARC-AGI-2 y sucesores, FrontierMath, Humanity's Last Exam). Si estos ceden rápido, la posición escaladora se fortalece mucho.
  2. Horizonte temporal de tareas autónomas (METR). Si la duplicación cada ~7 meses se sostiene, los agentes económicamente relevantes llegan antes de lo que sugiere la intuición.
  3. Costo por unidad de capacidad. El precio de alcanzar un nivel dado de desempeño viene cayendo de forma brutal; es lo que determina qué se vuelve viable en la práctica.
  4. Publicaciones de aprendizaje continuo y modelos del mundo. Un resultado sólido acá sería el cambio cualitativo más grande desde los modelos de razonamiento.
  5. Adopción real medida, no anunciada. Estudios de productividad y datos de uso, no comunicados de prensa.
  6. Datos de Epoch AI. Es la fuente que convierte esta discusión en algo empírico en lugar de retórico.
Cómo leer a los que predicen

Casi todos los pronósticos públicos vienen de gente con incentivos: laboratorios que necesitan capital, críticos que construyeron su identidad sobre el escepticismo, inversores con posiciones tomadas. Eso no los invalida, pero conviene leer siempre en pares opuestos —"Situational Awareness" junto a "AI as Normal Technology", Sutton junto a los escaladores— y quedarse con los mecanismos causales que cada uno propone, no con las fechas.

5. Recursos sobre el futuro