Línea de tiempo de la IA: los papers que definieron el campo

Entender cómo llegamos hasta acá explica muchísimo de por qué los modelos son como son. Cada decisión de diseño que hoy parece obvia fue en su momento una apuesta entre varias, y el orden cronológico deja ver la lógica: qué problema resolvía cada paper y qué problema nuevo creaba.

Leer estos trabajos en secuencia es, para mucha gente, la forma más eficiente de entrar al campo. Trece momentos, de 2012 a hoy.

2012

AlexNet — el deep learning se vuelve inevitable

Una CNN entrenada en GPUs pulveriza ImageNet. Empieza la era en la que el cómputo, y no el diseño manual de features, define el estado del arte.

2014-2015

Seq2seq, atención y ResNets

Bahdanau introduce la atención para traducción; las conexiones residuales permiten entrenar redes muy profundas. Las dos piezas que faltaban para lo que vendría.

2017

Attention Is All You Need

Se tira la recurrencia por la ventana y queda solo la atención. Paralelizable, escalable, y todavía hoy la base de casi todo.

2018-2019

BERT y GPT-2 — el pre-entrenamiento se impone

Se bifurcan las dos ramas: encoder bidireccional para comprensión, decoder autorregresivo para generación. Gana la segunda.

2020

Scaling laws + GPT-3

El progreso se vuelve predecible: una ley de potencia en cómputo, datos y parámetros. Y aparece el aprendizaje en contexto, que nadie había pedido explícitamente.

2020-2021

Difusión y CLIP

La generación de imágenes cambia de paradigma. Alinear texto e imagen en un mismo espacio abre la puerta a todo lo multimodal.

2022 (marzo)

Chinchilla e InstructGPT

Dos correcciones el mismo mes: los modelos estaban subentrenados en datos, y el problema real no era la capacidad sino seguir instrucciones.

2022 (noviembre)

ChatGPT

Ninguna novedad técnica mayor: una interfaz. Y sin embargo es el momento en que el campo deja de ser un asunto académico.

2023

LLaMA, LoRA y el ecosistema abierto

Pesos abiertos + adaptación barata = miles de personas entrenando modelos en su casa. FlashAttention hace que todo eso además sea rápido.

2024

Contexto largo, MoE y agentes

Ventanas de un millón de tokens, mezcla de expertos como estándar de facto, y los primeros agentes que hacen trabajo real de varios pasos.

2024 (septiembre)

o1 y el cómputo en tiempo de inferencia

Aparece el segundo eje de escalado: pensar más tiempo antes de responder. El entrenamiento deja de ser la única palanca.

2025 (enero)

DeepSeek-R1

El razonamiento emerge de RL con recompensas verificables, se publica en abierto y a un costo mucho menor del que se creía necesario. El campo entero se reorganiza alrededor de esto.

2025-2026

Agentes, memoria y arquitecturas híbridas

El foco se corre de «responder bien» a «completar tareas largas de forma autónoma». Vuelven a discutirse en serio el aprendizaje continuo, los modelos del mundo y las alternativas a la atención pura.

Preguntas frecuentes sobre los papers clave de la IA

¿Cuál es el paper más importante de la IA moderna?

«Attention Is All You Need» (2017), que introdujo el transformer. Reemplazó la recurrencia por atención pura y es la base de prácticamente todos los modelos de lenguaje actuales, además de buena parte de los modelos de imagen y audio.

¿Qué papers leer para entender los LLMs?

En orden: «Attention Is All You Need», el paper de GPT-3 con las leyes de escalado, Chinchilla para la corrección sobre datos, InstructGPT para el ajuste por instrucciones y DeepSeek-R1 para razonamiento con refuerzo. Con esos cinco tenés la columna vertebral.