Los recursos imprescindibles para aprender IA
Una lista de 336 recursos tiene un problema evidente: es demasiado para empezar. Esta es la respuesta a la pregunta que hace todo el mundo — «sí, pero ¿cuáles en serio?».
Son los marcados con ★ en el resto del sitio: uno o dos por tema, los que recomendaría alguien que ya recorrió el camino si solo pudiera nombrar unos pocos. El criterio no es popularidad, es densidad: cuánto entendés por cada hora invertida.
Sigue siendo bastante material. Si querés algo todavía más acotado y con un orden, elegí una de las cuatro rutas de aprendizaje: son estos mismos recursos, pero secuenciados.
119 recursos
🎓 Curso
Curso gratuito y práctico: fundamentos, frameworks, evaluación y un proyecto final certificable.
Cursos gratuitos y guiados sobre alineamiento y gobernanza, con cohortes y facilitadores. La puerta de entrada más común al campo.
Currículum completo y gratuito: fundamentos de deep learning, interpretabilidad de transformers, RL y evaluaciones de LLMs. El mejor camino estructurado hacia investigación en seguridad.
Cinco cursos: redes profundas, hiperparámetros/regularización, estructuración de proyectos, CNNs, secuencias. Sigue siendo la mejor base ordenada.
Serie de charlas sobre CUDA, Triton, kernels y rendimiento, con un Discord muy activo. El mejor lugar para aprender programación de GPUs aplicada a IA.
Pruning, cuantización, NAS, destilación, sistemas de inferencia para LLMs y difusión. El curso más completo sobre eficiencia.
Se actualiza cada año en enero. Denso, moderno y gratis: CNNs, RNNs, transformers, generativos, RL, LLMs. Todas las clases en YouTube.
La puerta de entrada canónica. Regresión, clasificación, redes neuronales, clustering, sistemas de recomendación. Auditable gratis.
El curso completo: micrograd → makemore → GPT → tokenizador. Gratis. Probablemente el mejor material de IA jamás publicado.
Enfoque top-down: entrenás un modelo útil en la lección 1 y recién después bajás a la teoría. Si los cursos tradicionales te aburren, este es tu camino.
Tensores, autograd, datasets, loop de entrenamiento. Hacelo con las manos, no leyéndolo.
Construís un LLM completo: tokenizador, arquitectura, kernels en Triton, entrenamiento distribuido, scaling laws, datos, alineamiento. Clases en YouTube y assignments públicos. El curso más importante que se dicta hoy.
▶️ Video
3h30 que explican TODO el pipeline: pretraining, tokenización, alucinaciones, SFT, RLHF, modelos de razonamiento. Si solo podés ver un video, es este.
Vectores, matrices, autovalores y cambio de base explicados geométricamente. Es el prerequisito real de todo lo demás.
Un GPT completo, línea por línea, en dos horas. Es el rito de iniciación del campo.
La tokenización es la fuente de la mitad de las rarezas de los LLMs (aritmética, deletreo, idiomas no ingleses). Este video las explica todas.
La mejor intuición visual que existe sobre qué es una red neuronal, backpropagation y gradiente. Actualizada con capítulos sobre transformers y attention. Empezá acá, siempre.
Construye un motor de autodiff en 100 líneas de Python puro. Después de esto, PyTorch deja de ser magia. Es el video más valioso de esta lista.
La charla que instaló la analogía 'LLM = sistema operativo'. Excelente panorama de una hora.
📺 Canal
Matemática visual. Las series de redes neuronales, álgebra lineal y cálculo son la base de todo.
Poco volumen, calidad máxima. Cada video suyo vale un curso entero.
El divulgador de IA más conocido en español. Excelente para intuición y actualidad; complementalo con material técnico en inglés.
Implementa papers completos desde cero en PyTorch, línea por línea: LLaMA, Stable Diffusion, DPO, Mamba, entrenamiento distribuido. Increíblemente subestimado.
Explicaciones de papers con criterio crítico. Te enseña a leer papers, no solo a entenderlos.
🎙️ Podcast
Las mejores entrevistas largas del sector. Sus episodios con Sutton, Hassabis, Amodei, Sutskever y Karpathy son documentos históricos.
El podcast del 'AI Engineer': práctico, técnico y muy conectado con quienes construyen productos reales.
📚 Libro
PDF gratis, versiones en R y Python. El mejor libro para entender de verdad bias-variance, regularización, validación cruzada y árboles.
Capítulo a capítulo: attention, GPT, pretraining, fine-tuning para clasificación e instrucciones. Todo el código es gratis en GitHub.
El libro de referencia para llevar ML a producción: datos, features, despliegue, monitoreo, deriva de datos.
Libro interactivo: cada concepto viene con código ejecutable en PyTorch, JAX y TensorFlow. Usado en 500+ universidades. Hay traducción al español parcial.
El libro práctico más recomendado de la última década. Notebooks gratis en GitHub. Traducido al español.
PDF gratis. Álgebra lineal, cálculo vectorial, probabilidad y optimización con foco exclusivo en lo que ML necesita. El puente entre 'sé programar' y 'entiendo los papers'.
Libro abierto y en evolución sobre RLHF: modelos de recompensa, PPO/GRPO, evaluación, fallos conocidos. No hay nada equivalente.
La biblia del RL. PDF gratis. Si vas a hacer post-training en serio, los capítulos 3-6 y 13 son obligatorios.
PDF gratis + notebooks + slides. El mejor libro de deep learning escrito en los últimos años: cubre transformers, difusión, GNNs y RL con figuras excelentes.
📄 Paper
El texto fundacional de la interpretabilidad mecanicista. Cabezas de atención como operaciones componibles sobre el residual stream.
Un modelo que finge estar alineado durante el entrenamiento para preservar sus preferencias. Evidencia empírica de un riesgo que era teórico.
El paper que define la era actual. Todo LLM de hoy es una variación de estas 15 páginas. Leelo al menos tres veces en tu vida.
Alinear imágenes y texto en un mismo espacio de embeddings. Es el ladrillo sobre el que se apoya casi todo lo multimodal.
'Pensemos paso a paso'. La observación más simple y más rentable de la historia reciente de los LLMs.
El paper que convirtió la seguridad de IA en agenda técnica: efectos colaterales, reward hacking, supervisión escalable, exploración segura.
Demostró en abierto que el razonamiento emerge de RL con recompensas verificables, sin SFT previo. Cambió el rumbo del campo en 2025.
MoE de 671B, Multi-head Latent Attention, entrenamiento en FP8, predicción multi-token. Ingeniería de eficiencia de altísimo nivel, documentada en detalle.
Group Relative Policy Optimization: elimina la red de valor de PPO. Es el algoritmo que entrena la mayoría de los modelos de razonamiento actuales.
El paper que hizo funcionar la difusión. Agregar ruido y aprender a quitarlo: la idea que reemplazó a las GANs.
Alineamiento por preferencias sin modelo de recompensa ni RL. Simple, estable y hoy el punto de partida por defecto.
Memoria virtual paginada aplicada al KV cache. Multiplicó por 24 el throughput de servir modelos y se volvió el estándar.
No aproxima nada: solo reordena el cómputo para respetar la jerarquía de memoria de la GPU. La optimización más importante de la década. Ver también FlashAttention-2 (2307.08691) y -3 (2407.08608).
Difusión en espacio latente en vez de píxeles: es Stable Diffusion. Hizo la generación de imágenes accesible a cualquiera.
Encontraron el circuito concreto que hace posible el aprendizaje en contexto. Uno de los resultados más satisfactorios del campo.
El paper que demostró in-context learning y disparó la carrera de escala.
Entrenar matrices de rango bajo en vez del modelo entero. Es la razón por la que podés hacer fine-tuning en una sola GPU.
La alternativa más seria a la atención cuadrática. Modelos de espacio de estados con selectividad, complejidad lineal en la longitud.
El 'horizonte temporal' de las tareas que un modelo completa se duplica cada ~7 meses. Es la métrica de progreso más informativa que existe hoy, porque mide autonomía y no conocimiento.
Grafos de atribución que muestran planificación anticipada, razonamiento multilingüe y racionalizaciones a posteriori dentro del modelo. Fascinante.
LoRA sobre un modelo base en 4 bits. Democratizó el fine-tuning de modelos de 65B en hardware de consumo.
Razonar y actuar alternadamente. Es el patrón base de prácticamente todo agente que exista hoy.
El paper que nombró RAG. Vale leerlo para ver cuánto se desvió la práctica actual de la propuesta original.
El paper que formalizó el segundo eje de escalado: pensar más en inferencia puede valer más que un modelo más grande.
El paper que convirtió el progreso de la IA en una ecuación. Pérdida como ley de potencia de cómputo, datos y parámetros.
Autoencoders dispersos aplicados a un modelo de producción: millones de características identificables y manipulables.
Puertas traseras que sobreviven al SFT, RLHF y al entrenamiento adversarial. Resultado incómodo y muy importante.
MoE: activar solo una fracción de los parámetros por token. Base de casi todos los modelos frontera actuales.
92 páginas con detalles reales de datos, infraestructura, fallos de hardware y post-training. El reporte técnico más útil publicado por un laboratorio grande.
Por qué las neuronas representan más conceptos que dimensiones tienen. Explica por qué interpretar redes es tan difícil.
Corrigió a Kaplan: los modelos estaban muy subentrenados en datos. Reescribió el presupuesto de entrenamiento de toda la industria.
El paper que convirtió un modelo de texto en un asistente. SFT + modelo de recompensa + PPO. Es la receta que dio origen a ChatGPT.
Los dos padres del RL moderno argumentan que los datos humanos se agotaron y que la próxima era será de agentes que aprenden de su propia experiencia. Si tenés que apostar a una sola tesis sobre el futuro, esta es la más respaldada por trayectoria.
✍️ Blog/Post
Por qué tu red no entrena y qué hacer al respecto, en orden. Releelo cada vez que algo falle.
El contrapunto riguroso a los escenarios de despegue: la difusión de una tecnología está limitada por instituciones, no por capacidad del modelo. Leelo junto a los dos anteriores.
Análisis mensual de papers y arquitecturas con implementaciones propias. El equilibrio perfecto entre profundidad y claridad.
La distinción clave entre workflows y agentes, y por qué la mayoría de los problemas se resuelven mejor con lo primero. Lectura corta y obligatoria.
El 'prompt engineering' evolucionó a gestionar el contexto como recurso escaso: compactación, memoria externa, sub-agentes.
Hamel es la voz más sensata sobre cuándo NO hacer fine-tuning y por qué las evaluaciones importan más que el entrenamiento.
El mejor seguimiento continuo de post-training, RLVR y modelos abiertos. Lambert está dentro del proceso, no comentándolo desde afuera.
'The Illustrated Transformer', 'Illustrated GPT-2', 'Illustrated Stable Diffusion'. Si algo no se entiende, probablemente Jay ya lo dibujó.
El mapa conceptual de referencia: planificación, memoria, uso de herramientas. Sigue siendo la mejor síntesis del tema.
Cada post es prácticamente un survey: difusión, agentes, alucinaciones, hacking de recompensas, razonamiento. La mejor escritura técnica larga del campo.
El escenario optimista escrito con seriedad: biología, salud mental, desarrollo económico, gobernanza. Explícitamente especulativo, y por eso mismo útil.
La hoja de ruta más honesta para entrar al campo, incluyendo qué NO hacer. Además: '200 Concrete Open Problems'.
La definición de inteligencia como eficiencia en la adquisición de habilidades. El argumento más sólido de por qué escalar memorización no basta.
Experimentos reales sobre rank, alpha, qué capas tocar y cuándo LoRA empata con full fine-tuning.
Análisis profundo de hardware, datacenters, cadena de suministro y economía real del cómputo de IA. Nadie más hace este trabajo con este nivel de detalle.
El mejor cronista del día a día de los LLMs aplicados: cada modelo nuevo, cada truco, cada vulnerabilidad (prompt injection). Publica casi a diario.
El paper original línea por línea, con el código PyTorch al lado de cada párrafo.
Un ensayo de una página que explica 70 años de historia de la IA: los métodos generales que escalan con cómputo siempre ganan. El texto más citado del campo.
La explicación visual definitiva de self-attention, multi-head y encoder-decoder. Leelo antes del paper original.
La bitácora honesta de entrenar SmolLM3: ablaciones, picos de loss, bugs de infraestructura, decisiones de datos. Lo que ningún paper te cuenta.
Paralelismo de datos, tensorial, de pipeline, de contexto y de expertos, explicado con más de 4000 experimentos reales. Gratis y sin equivalente.
El post que enseñó LSTMs a una generación entera. Aún hoy es la referencia para entender memoria en secuencias.
Lecciones tácticas, operativas y estratégicas de gente que puso LLMs en producción. Antídoto contra el hype.
La derivación matemática más clara que hay en abierto sobre difusión. Denso pero completo.
El artículo más importante sobre evaluación aplicada. Sin evals no estás haciendo ingeniería, estás adivinando.
Pocos posts, todos memorables: 'Software 2.0', 'A Recipe for Training Neural Networks', 'The Unreasonable Effectiveness of RNNs'.
📬 Newsletter
Resumen diario de Discords, Reddit y X, generado con IA y revisado. Si querés no perderte nada, es esto.
Papers relevantes con comentario político-estratégico y una ficción corta al final. Perspectiva única sobre hacia dónde va todo.
Semanal, equilibrada, con la carta de Andrew Ng al inicio. La mejor opción si querés una sola newsletter.
🐙 Repo
Programar el comportamiento del modelo y dejar que los prompts se optimicen solos. El cambio de paradigma más interesante frente al prompt-crafting manual.
Notebooks, bonus sobre Llama/Qwen/Gemma, DPO, KV cache y MoE. Se actualiza constantemente.
LoRA, DoRA, IA³, prompt tuning y compañía en una línea de código. El punto de entrada estándar.
SFT, DPO, GRPO, PPO, reward modeling con una API consistente. La forma más rápida de hacer post-training real.
2-5× más rápido y con mucha menos memoria mediante kernels Triton propios. Sus notebooks gratuitos en Colab son el camino más corto para tu primer fine-tune.
Inferencia en C/C++ que corre en cualquier cosa: CPU, Mac, Raspberry Pi. Creó el formato GGUF y todo el ecosistema local.
El estándar de facto para evaluar modelos de lenguaje. Es lo que corre detrás de casi todos los leaderboards.
~300 líneas que reproducen GPT-2. El repositorio educativo más copiado del mundo.
El pipeline COMPLETO de un ChatGPT mínimo por ~100 dólares: tokenizador, pretraining, SFT, RL, inferencia y UI web. La culminación de todo lo que enseña Karpathy.
El motor de inferencia de referencia: continuous batching, prefix caching, tensor parallel, API compatible con OpenAI.
🛠️ Herramienta
Tendencias de cómputo, costos, tamaños de modelos y capacidades, con metodología pública. La forma correcta de discutir el futuro: con datos.
Papers del día curados y votados por la comunidad. La forma más eficiente de seguir la literatura sin ahogarte.
Un millón y medio de modelos, datasets y demos. Es el GitHub de la IA: si no lo usás, estás trabajando de más.
Ranking por comparación ciega entre modelos, votada por humanos. El benchmark menos contaminable que existe, aunque mide preferencia, no capacidad.
`ollama run qwen3` y ya tenés un modelo local. La forma más simple de empezar a experimentar sin nube ni tarjeta de crédito.
📘 Docs
El estándar abierto para conectar modelos con herramientas y datos. Adoptado por toda la industria: si construís agentes, tenés que conocerlo.
Los compromisos públicos de los laboratorios sobre qué capacidades exigen qué salvaguardas. Documentos que definen la política real de la industria.
📊 Benchmark
👤 Cuenta
Los dos agregadores de papers más rápidos. Si algo importante salió hoy, ya lo postearon.
Intuiciones destiladas, hilos didácticos y observaciones que después se vuelven consenso del campo.
Resúmenes de papers con figuras propias y comparaciones de arquitecturas. Consistentemente útil.
💬 Comunidad
Preguntas frecuentes
Si solo puedo estudiar una cosa, ¿cuál elijo?
«Neural Networks: Zero to Hero» de Andrej Karpathy, escribiendo el código vos en vez de mirarlo. Ninguna otra cosa sola cambia tanto la comprensión de cómo funcionan estos modelos, y es gratis.
¿Cómo se eligieron los recursos imprescindibles?
Por densidad de aprendizaje por hora invertida, no por popularidad ni por antigüedad. Se prioriza el material que explica por qué algo funciona sobre el que muestra qué botón apretar, porque el primero sigue siendo válido cinco años después y el segundo caduca en seis meses.