Nunca entrené un modelo
- Intuición visual primero
- Python y NumPy con foco en shapes
- Un curso de machine learning completo
- micrograd de Karpathy
Ver la ruta completa (5 pasos, 3 a 6 meses con unas 10 horas semanales) →
Una colección curada de recursos para aprender inteligencia artificial: desde la matemática que hay debajo hasta cómo se entrena un modelo frontera, cómo se lo alinea, cómo se lo sirve y qué se discute hoy sobre lo que viene. Cada recurso está acá porque alguien lo usó para aprender de verdad, no porque aparezca en una lista de listas.
Aprender IA en 2026 no tiene un problema de escasez: tiene un problema de exceso. Hay miles de cursos, cientos de canales y una cantidad absurda de listas que se copian entre sí. El resultado es que empezar se volvió más difícil, no más fácil. Este sitio existe para resolver ese problema concreto: 336 recursos revisados uno por uno, organizados en 22 temas y cuatro rutas de aprendizaje según de dónde venís.
Está pensado para el público hispanohablante —Argentina, México, Colombia, Chile, España y donde sea que estés leyendo esto— y todo el material propio está en castellano. Los recursos enlazados están mayoritariamente en inglés, porque ahí está lo mejor, pero hay una sección completa de recursos de IA en español y podés filtrar por idioma en cualquier momento.
La pregunta que más se repite no es "¿qué recursos hay?" sino "¿cuál agarro hoy?". Depende menos de tu nivel que del tiempo real que tenés disponible:
| Si tenés… | Hacé esto | Vas a salir sabiendo |
|---|---|---|
| Una hora | El primer capítulo de la serie de redes neuronales de 3Blue1Brown. | Qué es realmente una red neuronal, sin fórmulas ni misticismo. |
| Un fin de semana | «Deep Dive into LLMs» de Karpathy (3h30) y después jugar con un modelo local. | Por qué un modelo alucina, qué es pre-entrenamiento y qué es post-entrenamiento. |
| Un mes | La ruta desde cero hasta micrograd, escribiendo el código vos. | Entrenar una red propia y entender backpropagation desde adentro. |
| Seis meses | Una ruta completa con un proyecto propio en paralelo. | Leer papers con comodidad y construir cosas que funcionan. |
Si solo querés la lista corta sin decidir nada, están los recursos imprescindibles: uno o dos por tema, los que elegiría si tuviera que recomendar pocos.
Tan importante como qué entra es qué se deja afuera, porque es lo que hace que la lista signifique algo:
El criterio completo, y quién está detrás de todo esto, está en la página sobre el sitio.
El error más común al aprender inteligencia artificial es empezar por todos lados a la vez. Elegí una ruta según de dónde venís, seguila en orden y recién después dispersate.
Ver la ruta completa (5 pasos, 3 a 6 meses con unas 10 horas semanales) →
Ver la ruta completa (6 pasos, 1 a 3 meses si ya programás) →
Ver la ruta completa (7 pasos, 6 a 12 meses con base previa) →
Ver la ruta completa (6 pasos, 1 a 2 años, dependiendo de la base previa) →
Los mismos recursos cortados por otro eje: por precio, por formato o por cuán imprescindibles son. Es como los busca mucha gente.
336 recursos organizados en 22 temas, de la matemática de base a la interpretabilidad y la seguridad. Cada tema tiene su propia página con el listado completo.
Álgebra lineal, cálculo, probabilidad y optimización: lo mínimo indispensable para no leer papers como si fueran magia.
Vectores, matrices, autovalores y cambio de base explicados geométricamente. Es el prerequisito real de todo lo demás.
PDF gratis. Álgebra lineal, cálculo vectorial, probabilidad y optimización con foco exclusivo en lo que ML necesita. El puente entre 'sé programar' y 'entiendo los papers'.
La mejor intuición visual que existe sobre qué es una red neuronal, backpropagation y gradiente. Actualizada con capítulos sobre transformers y attention. Empezá acá, siempre.
Derivadas y regla de la cadena. La regla de la cadena ES backpropagation.
El curso canónico de álgebra lineal. Strang enseña como si te estuviera contando un secreto.
El enfoque bayesiano completo: procesos gaussianos, inferencia variacional, cuantificación de incertidumbre.
Python, PyTorch, JAX y las herramientas con las que vas a pasar el 90% del tiempo.
Por qué tu red no entrena y qué hacer al respecto, en orden. Releelo cada vez que algo falle.
Tensores, autograd, datasets, loop de entrenamiento. Hacelo con las manos, no leyéndolo.
Construye un motor de autodiff en 100 líneas de Python puro. Después de esto, PyTorch deja de ser magia. Es el video más valioso de esta lista.
einsum/einops te ahorran años de sufrimiento con reshapes y transposes.
La librería de redes neuronales sobre JAX. Si vas a JAX, vas a pasar por acá.
Programación funcional + autodiff + XLA. Domina en TPUs y en investigación de escala (DeepMind). jit/vmap/pmap cambian cómo pensás el cómputo.
Regresión, árboles, validación cruzada, bias-variance. Todo lo que sigue vigente aunque ya no aparezca en los titulares.
PDF gratis, versiones en R y Python. El mejor libro para entender de verdad bias-variance, regularización, validación cruzada y árboles.
El libro práctico más recomendado de la última década. Notebooks gratis en GitHub. Traducido al español.
La puerta de entrada canónica. Regresión, clasificación, redes neuronales, clustering, sistemas de recomendación. Auditable gratis.
Micro-cursos de 3-5 horas: Python, pandas, ML intro, feature engineering, deep learning, explicabilidad. Muy buen retorno por hora invertida.
~15 horas, muy bien producido, con ejercicios interactivos. Actualizado con módulos de LLMs y embeddings.
La versión con toda la matemática que CS229 omite en Coursera. Notas y problem sets públicos.
Redes profundas, backpropagation, optimización, regularización y los fenómenos raros que todavía no entendemos del todo.
Cinco cursos: redes profundas, hiperparámetros/regularización, estructuración de proyectos, CNNs, secuencias. Sigue siendo la mejor base ordenada.
Libro interactivo: cada concepto viene con código ejecutable en PyTorch, JAX y TensorFlow. Usado en 500+ universidades. Hay traducción al español parcial.
Se actualiza cada año en enero. Denso, moderno y gratis: CNNs, RNNs, transformers, generativos, RL, LLMs. Todas las clases en YouTube.
Enfoque top-down: entrenás un modelo útil en la lección 1 y recién después bajás a la teoría. Si los cursos tradicionales te aburren, este es tu camino.
PDF gratis + notebooks + slides. El mejor libro de deep learning escrito en los últimos años: cubre transformers, difusión, GNNs y RL con figuras excelentes.
El post que enseñó LSTMs a una generación entera. Aún hoy es la referencia para entender memoria en secuencias.
Transformers y todo lo demás: MoE, modelos de espacio de estados, híbridos, difusión, GNNs. Qué hay, qué cambia y qué se mantiene.
El paper que define la era actual. Todo LLM de hoy es una variación de estas 15 páginas. Leelo al menos tres veces en tu vida.
La alternativa más seria a la atención cuadrática. Modelos de espacio de estados con selectividad, complejidad lineal en la longitud.
MoE: activar solo una fracción de los parámetros por token. Base de casi todos los modelos frontera actuales.
El paper original línea por línea, con el código PyTorch al lado de cada párrafo.
La explicación visual definitiva de self-attention, multi-head y encoder-decoder. Leelo antes del paper original.
GNNs explicadas interactivamente. Relevantes para química, biología, grafos de conocimiento y sistemas de recomendación.
De 'Attention Is All You Need' a los reportes técnicos de los modelos frontera actuales.
3h30 que explican TODO el pipeline: pretraining, tokenización, alucinaciones, SFT, RLHF, modelos de razonamiento. Si solo podés ver un video, es este.
Demostró en abierto que el razonamiento emerge de RL con recompensas verificables, sin SFT previo. Cambió el rumbo del campo en 2025.
MoE de 671B, Multi-head Latent Attention, entrenamiento en FP8, predicción multi-token. Ingeniería de eficiencia de altísimo nivel, documentada en detalle.
El paper que demostró in-context learning y disparó la carrera de escala.
Un GPT completo, línea por línea, en dos horas. Es el rito de iniciación del campo.
La tokenización es la fuente de la mitad de las rarezas de los LLMs (aritmética, deletreo, idiomas no ingleses). Este video las explica todas.
El pipeline completo de pre-entrenamiento: código, paralelismo, clusters y los detalles sucios que ningún paper cuenta.
Capítulo a capítulo: attention, GPT, pretraining, fine-tuning para clasificación e instrucciones. Todo el código es gratis en GitHub.
Notebooks, bonus sobre Llama/Qwen/Gemma, DPO, KV cache y MoE. Se actualiza constantemente.
Construís un LLM completo: tokenizador, arquitectura, kernels en Triton, entrenamiento distribuido, scaling laws, datos, alineamiento. Clases en YouTube y assignments públicos. El curso más importante que se dicta hoy.
La bitácora honesta de entrenar SmolLM3: ablaciones, picos de loss, bugs de infraestructura, decisiones de datos. Lo que ningún paper te cuenta.
Paralelismo de datos, tensorial, de pipeline, de contexto y de expertos, explicado con más de 4000 experimentos reales. Gratis y sin equivalente.
~300 líneas que reproducen GPT-2. El repositorio educativo más copiado del mundo.
Cómo se arma un corpus, cómo se parte el texto y cómo predecir qué vas a obtener antes de gastar el presupuesto.
El paper que convirtió el progreso de la IA en una ecuación. Pérdida como ley de potencia de cómputo, datos y parámetros.
Un ensayo de una página que explica 70 años de historia de la IA: los métodos generales que escalan con cómputo siempre ganan. El texto más citado del campo.
Corrigió a Kaplan: los modelos estaban muy subentrenados en datos. Reescribió el presupuesto de entrenamiento de toda la industria.
Curar bien los datos puede romper la ley de potencia. Uno de los resultados más accionables sobre calidad de datos.
Corpus abierto con toolkit de curación documentado. Complemento perfecto de OLMo.
Cómo se construye realmente un corpus de 15T tokens: deduplicación, filtros, clasificadores educativos. El blog interactivo asociado es aún mejor que el paper.
SFT, modelos de recompensa, DPO, GRPO y RL con recompensas verificables: donde se decide hoy la calidad de un modelo.
'Pensemos paso a paso'. La observación más simple y más rentable de la historia reciente de los LLMs.
Group Relative Policy Optimization: elimina la red de valor de PPO. Es el algoritmo que entrena la mayoría de los modelos de razonamiento actuales.
Alineamiento por preferencias sin modelo de recompensa ni RL. Simple, estable y hoy el punto de partida por defecto.
El mejor seguimiento continuo de post-training, RLVR y modelos abiertos. Lambert está dentro del proceso, no comentándolo desde afuera.
Libro abierto y en evolución sobre RLHF: modelos de recompensa, PPO/GRPO, evaluación, fallos conocidos. No hay nada equivalente.
La biblia del RL. PDF gratis. Si vas a hacer post-training en serio, los capítulos 3-6 y 13 son obligatorios.
LoRA, QLoRA y las herramientas para adaptar un modelo con una sola GPU (y cuándo conviene no hacerlo).
Hamel es la voz más sensata sobre cuándo NO hacer fine-tuning y por qué las evaluaciones importan más que el entrenamiento.
Entrenar matrices de rango bajo en vez del modelo entero. Es la razón por la que podés hacer fine-tuning en una sola GPU.
LoRA, DoRA, IA³, prompt tuning y compañía en una línea de código. El punto de entrada estándar.
Experimentos reales sobre rank, alpha, qué capas tocar y cuándo LoRA empata con full fine-tuning.
LoRA sobre un modelo base en 4 bits. Democratizó el fine-tuning de modelos de 65B en hardware de consumo.
2-5× más rápido y con mucha menos memoria mediante kernels Triton propios. Sus notebooks gratuitos en Colab son el camino más corto para tu primer fine-tune.
FlashAttention, KV cache, cuantización, decodificación especulativa y motores de serving. Acá se define el costo real.
Memoria virtual paginada aplicada al KV cache. Multiplicó por 24 el throughput de servir modelos y se volvió el estándar.
No aproxima nada: solo reordena el cómputo para respetar la jerarquía de memoria de la GPU. La optimización más importante de la década. Ver también FlashAttention-2 (2307.08691) y -3 (2407.08608).
Pruning, cuantización, NAS, destilación, sistemas de inferencia para LLMs y difusión. El curso más completo sobre eficiencia.
`ollama run qwen3` y ya tenés un modelo local. La forma más simple de empezar a experimentar sin nube ni tarjeta de crédito.
Inferencia en C/C++ que corre en cualquier cosa: CPU, Mac, Raspberry Pi. Creó el formato GGUF y todo el ecosistema local.
El motor de inferencia de referencia: continuous batching, prefix caching, tensor parallel, API compatible con OpenAI.
CUDA, Triton, clusters, tracking de experimentos y la economía del cómputo.
El libro de referencia para llevar ML a producción: datos, features, despliegue, monitoreo, deriva de datos.
Serie de charlas sobre CUDA, Triton, kernels y rendimiento, con un Discord muy activo. El mejor lugar para aprender programación de GPUs aplicada a IA.
Análisis profundo de hardware, datacenters, cadena de suministro y economía real del cómputo de IA. Nadie más hace este trabajo con este nivel de detalle.
Notas de campo de alguien que entrenó modelos grandes de verdad: debugging de NCCL, picos de loss, fallas de hardware, tuning de throughput.
La alternativa open source y self-hosted para tracking, registro de modelos y despliegue.
GPUs por hora sin administrar infraestructura. Modal es especialmente cómodo para entrenar o servir desde Python puro.
Recuperación, uso de herramientas, memoria, orquestación y el arte de administrar el contexto como recurso escaso.
Curso gratuito y práctico: fundamentos, frameworks, evaluación y un proyecto final certificable.
La distinción clave entre workflows y agentes, y por qué la mayoría de los problemas se resuelven mejor con lo primero. Lectura corta y obligatoria.
Programar el comportamiento del modelo y dejar que los prompts se optimicen solos. El cambio de paradigma más interesante frente al prompt-crafting manual.
El 'prompt engineering' evolucionó a gestionar el contexto como recurso escaso: compactación, memoria externa, sub-agentes.
El mapa conceptual de referencia: planificación, memoria, uso de herramientas. Sigue siendo la mejor síntesis del tema.
El estándar abierto para conectar modelos con herramientas y datos. Adoptado por toda la industria: si construís agentes, tenés que conocerlo.
Visión, difusión, audio, video y modelos del mundo. La rama que dejó de ser un anexo del texto.
Alinear imágenes y texto en un mismo espacio de embeddings. Es el ladrillo sobre el que se apoya casi todo lo multimodal.
El paper que hizo funcionar la difusión. Agregar ruido y aprender a quitarlo: la idea que reemplazó a las GANs.
Difusión en espacio latente en vez de píxeles: es Stable Diffusion. Hizo la generación de imágenes accesible a cualquiera.
La derivación matemática más clara que hay en abierto sobre difusión. Denso pero completo.
La apuesta contrapuesta a los LLMs: predecir en espacio de representaciones, no tokens. Base de I-JEPA y V-JEPA.
Transformers aplicados a audio: clasificación, ASR, síntesis de voz.
Sin evaluaciones no hay ingeniería. Qué mide cada benchmark, cómo se contaminan y cómo armar las tuyas.
Diseñado explícitamente para resistir la memorización: mide adquisición de habilidades nuevas, no conocimiento almacenado. El benchmark conceptualmente más interesante.
Ranking por comparación ciega entre modelos, votada por humanos. El benchmark menos contaminable que existe, aunque mide preferencia, no capacidad.
El artículo más importante sobre evaluación aplicada. Sin evals no estás haciendo ingeniería, estás adivinando.
El estándar de facto para evaluar modelos de lenguaje. Es lo que corre detrás de casi todos los leaderboards.
La mejor fuente de datos duros sobre cómputo, costos de entrenamiento, tendencias de capacidad y proyecciones. Rigurosa y sin hype.
Benchmarks 'a prueba de Google' para conocimiento experto y matemática de investigación. Reemplazaron a MMLU cuando este se saturó.
Abrir el modelo y mirar adentro: circuitos, superposición, autoencoders dispersos, grafos de atribución.
El texto fundacional de la interpretabilidad mecanicista. Cabezas de atención como operaciones componibles sobre el residual stream.
Currículum completo y gratuito: fundamentos de deep learning, interpretabilidad de transformers, RL y evaluaciones de LLMs. El mejor camino estructurado hacia investigación en seguridad.
Encontraron el circuito concreto que hace posible el aprendizaje en contexto. Uno de los resultados más satisfactorios del campo.
La hoja de ruta más honesta para entrar al campo, incluyendo qué NO hacer. Además: '200 Concrete Open Problems'.
Grafos de atribución que muestran planificación anticipada, razonamiento multilingüe y racionalizaciones a posteriori dentro del modelo. Fascinante.
Autoencoders dispersos aplicados a un modelo de producción: millones de características identificables y manipulables.
Alineamiento, red-teaming, riesgos, políticas de escalado y regulación. Técnico y no técnico.
Cursos gratuitos y guiados sobre alineamiento y gobernanza, con cohortes y facilitadores. La puerta de entrada más común al campo.
Un modelo que finge estar alineado durante el entrenamiento para preservar sus preferencias. Evidencia empírica de un riesgo que era teórico.
El paper que convirtió la seguridad de IA en agenda técnica: efectos colaterales, reward hacking, supervisión escalable, exploración segura.
Los compromisos públicos de los laboratorios sobre qué capacidades exigen qué salvaguardas. Documentos que definen la política real de la industria.
Puertas traseras que sobreviven al SFT, RLHF y al entrenamiento adversarial. Resultado incómodo y muy importante.
El marco regulatorio que ya afecta a cualquiera que despliegue IA en Europa, más el estándar de gestión de riesgos de EE.UU.
Las fuentes que vale la pena seguir de forma sostenida, ordenadas por tipo.
Matemática visual. Las series de redes neuronales, álgebra lineal y cálculo son la base de todo.
Resumen diario de Discords, Reddit y X, generado con IA y revisado. Si querés no perderte nada, es esto.
Análisis mensual de papers y arquitecturas con implementaciones propias. El equilibrio perfecto entre profundidad y claridad.
Poco volumen, calidad máxima. Cada video suyo vale un curso entero.
Las mejores entrevistas largas del sector. Sus episodios con Sutton, Hassabis, Amodei, Sutskever y Karpathy son documentos históricos.
Papers relevantes con comentario político-estratégico y una ficción corta al final. Perspectiva única sobre hacia dónde va todo.
A quién seguir y dónde se discuten las cosas antes de que lleguen a los papers.
Los dos agregadores de papers más rápidos. Si algo importante salió hoy, ya lo postearon.
Intuiciones destiladas, hilos didácticos y observaciones que después se vuelven consenso del campo.
Resúmenes de papers con figuras propias y comparaciones de arquitecturas. Consistentemente útil.
Papers del día curados y votados por la comunidad. La forma más eficiente de seguir la literatura sin ahogarte.
Un millón y medio de modelos, datasets y demos. Es el GitHub de la IA: si no lo usás, estás trabajando de más.
La comunidad más activa sobre modelos abiertos, cuantización, hardware y fine-tuning. Es donde las técnicas nuevas aparecen primero.
Material de calidad en castellano. Es menos y suele ir un poco atrasado, pero sirve como puente.
El divulgador de IA más conocido en español. Excelente para intuición y actualidad; complementalo con material técnico en inglés.
Blog y libro con ejercicios prácticos en español. Buen punto de partida si el inglés todavía te frena.
Series ordenadas de deep learning y redes neuronales en español, con enfoque de curso.
Los cursos de Andrew Ng tienen subtítulos y transcripciones en español de buena calidad.
Buena parte de los cursos y docs de HF están traducidos al español por la comunidad.
Tutoriales prácticos de redes neuronales y TensorFlow en español, muy bien explicados y con código.
Los papers que definieron cada etapa, en orden, para entender cómo llegamos hasta acá.
Qué es apuesta segura, qué está cambiando ahora mismo y qué está genuinamente en disputa.
El contrapunto riguroso a los escenarios de despegue: la difusión de una tecnología está limitada por instituciones, no por capacidad del modelo. Leelo junto a los dos anteriores.
Tendencias de cómputo, costos, tamaños de modelos y capacidades, con metodología pública. La forma correcta de discutir el futuro: con datos.
El escenario optimista escrito con seriedad: biología, salud mental, desarrollo económico, gobernanza. Explícitamente especulativo, y por eso mismo útil.
El 'horizonte temporal' de las tareas que un modelo completa se duplica cada ~7 meses. Es la métrica de progreso más informativa que existe hoy, porque mide autonomía y no conocimiento.
La definición de inteligencia como eficiencia en la adquisición de habilidades. El argumento más sólido de por qué escalar memorización no basta.
Los dos padres del RL moderno argumentan que los datos humanos se agotaron y que la próxima era será de agentes que aprenden de su propia experiencia. Si tenés que apostar a una sola tesis sobre el futuro, esta es la más respaldada por trayectoria.
Depende de tu punto de partida, pero hay un consenso bastante sólido: la serie de redes neuronales de 3Blue1Brown para intuición visual, «Neural Networks: Zero to Hero» de Andrej Karpathy para construir desde cero, fast.ai o la especialización de Andrew Ng para un curso completo, y «Attention Is All You Need» junto a The Illustrated Transformer para entender los modelos actuales. Este sitio reúne esos y otros 330 recursos organizados por tema y nivel.
Sí, y no como versión recortada: buena parte del mejor material del campo es gratuito. Los cursos de Stanford y el MIT están publicados, los libros de referencia tienen PDF libre, el código de los modelos abiertos está en GitHub y las GPUs de Colab y Kaggle alcanzan para aprender. En este sitio podés filtrar por recursos gratuitos.
Con unas diez horas semanales sostenidas: tres a seis meses para entender los fundamentos y entrenar modelos propios, alrededor de un año para leer papers con comodidad, y uno a dos años para contribuir con investigación. Si tu objetivo es construir productos con modelos ya entrenados y ya programás, uno a tres meses alcanzan.
Para entender cómo funcionan los modelos y construir cosas, sí: Python es imprescindible y no hay forma de esquivarlo. Para usar herramientas de IA de forma competente, no hace falta programar nada. Son dos objetivos distintos y conviene tener claro cuál es el tuyo antes de elegir por dónde empezar.
Álgebra lineal, cálculo hasta la regla de la cadena, probabilidad básica y nociones de optimización. No hace falta una licenciatura, y conviene aprenderla en paralelo con la práctica en vez de intentar completarla antes de escribir la primera línea de código.
No. El campo se reordena cada pocos años y buena parte de lo que hoy define el estado del arte —modelos de razonamiento, agentes, interpretabilidad aplicada— tiene menos de tres años. Alguien que empieza hoy y estudia en serio llega a la frontera de varios subcampos en un año.