Deep learning: cómo aprenden las redes neuronales
Acá está el corazón conceptual de todo lo demás. Una red neuronal profunda es una función enorme con millones de parámetros que se ajusta bajando por el gradiente de un error. Suena simple porque lo es; lo difícil es que funcione: inicialización, normalización, tasas de aprendizaje, regularización y una cantidad de decisiones que la literatura justifica a posteriori.
Esta sección incluye también los fenómenos que todavía no entendemos bien —doble descenso, grokking, la hipótesis de la lotería— porque son la mejor vacuna contra la idea de que el campo es una ciencia cerrada. Buena parte de lo que sabemos es empírico y provisorio, y conviene aprenderlo sabiendo eso.
El mejor uso de esta sección: mirar la serie Neural Networks: Zero to Hero de Karpathy escribiendo el código vos, no copiándolo. Construir un motor de autodiff en cien líneas hace por la comprensión lo que ningún video puede hacer solo.
22 recursos de deep learning
Ordenados con los imprescindibles primero y agrupados por tipo. Los marcados con ★ son los que recomendaría alguien que ya recorrió el camino; los que dicen «gratis» no cuestan nada.
🎓 Curso
Cinco cursos: redes profundas, hiperparámetros/regularización, estructuración de proyectos, CNNs, secuencias. Sigue siendo la mejor base ordenada.
Se actualiza cada año en enero. Denso, moderno y gratis: CNNs, RNNs, transformers, generativos, RL, LLMs. Todas las clases en YouTube.
Enfoque top-down: entrenás un modelo útil en la lección 1 y recién después bajás a la teoría. Si los cursos tradicionales te aburren, este es tu camino.
Uno de los cursos más exigentes y completos, con homeworks reales de implementación desde cero.
Perspectiva de LeCun: energy-based models, self-supervised learning, arquitecturas para percepción. Con transcripciones en varios idiomas.
Notebooks de altísima calidad en PyTorch y JAX: optimización, inicialización, transformers, GNNs, energy-based models, difusión.
📚 Libro
Libro interactivo: cada concepto viene con código ejecutable en PyTorch, JAX y TensorFlow. Usado en 500+ universidades. Hay traducción al español parcial.
PDF gratis + notebooks + slides. El mejor libro de deep learning escrito en los últimos años: cubre transformers, difusión, GNNs y RL con figuras excelentes.
Deep learning contado como diseño de programas diferenciables. Enfoque fresco y muy bien escrito.
El clásico de 2016. Anterior a los transformers, pero la Parte I (matemática) y la Parte II (fundamentos) siguen siendo insuperables.
El sucesor del legendario 'Pattern Recognition and Machine Learning'. Lectura online gratis. Rigor bayesiano + contenido moderno.
Online y gratis. La mejor explicación escrita de por qué backprop funciona, con demos interactivas.
~180 páginas formateadas para leer en el teléfono. Densidad de información altísima. Ideal como repaso.
📄 Paper
El optimizador por defecto durante una década. Entender momento y varianza adaptativa te explica el 90% de los problemas de entrenamiento.
Y su primo LayerNorm (arXiv:1607.06450), que es el que realmente usan los transformers.
Rompe la intuición clásica de bias-variance: más parámetros pueden mejorar la generalización. Base conceptual del escalado moderno.
Las conexiones residuales son la razón por la que hoy podemos entrenar redes de 100+ capas. Están dentro de todo transformer.
Modelos que memorizan y mucho después 'entienden'. Uno de los fenómenos más raros y estudiados del deep learning.
Dentro de una red grande hay subredes chicas que entrenan igual de bien. Fundamento conceptual del pruning.
✍️ Blog/Post
El post que enseñó LSTMs a una generación entera. Aún hoy es la referencia para entender memoria en secuencias.
Publicación (en pausa) de artículos con visualizaciones interactivas. 'Feature Visualization', 'Building Blocks of Interpretability' y 'Momentum' son obligatorios.
El post que anticipó todo lo que vino después. Contexto histórico esencial: qué se podía hacer antes de los transformers.
Preguntas frecuentes sobre deep learning
¿Cuál es la diferencia entre machine learning y deep learning?
El deep learning es una rama del machine learning que usa redes neuronales con muchas capas y aprende las representaciones directamente de los datos crudos, en vez de depender de features diseñadas a mano. Todo deep learning es machine learning; no al revés.
¿Qué es backpropagation, en simple?
Es la aplicación de la regla de la cadena del cálculo para saber cuánto contribuyó cada parámetro al error final. Con esa información, el optimizador ajusta cada peso en la dirección que reduce el error. Es el mecanismo que hace posible entrenar redes profundas.
¿Cuánto tiempo lleva aprender deep learning?
Con dedicación sostenida de unas diez horas semanales, tres a seis meses alcanzan para entender los fundamentos y entrenar modelos propios. Llegar a leer papers con comodidad suele llevar un año. La variable que más pesa no es la inteligencia: es la constancia y la cantidad de código propio escrito.