Papers de IA: los que hay que leer
Leer papers asusta más de lo que cuesta. El inglés técnico es limitado y repetitivo, la estructura es siempre la misma, y después de diez papers el vocabulario deja de ser un obstáculo. Lo difícil no es el idioma: es saber cuáles vale la pena leer, porque se publican miles por mes y la mayoría no cambia nada.
Estos están ordenados cronológicamente, que es la forma en que más rinde leerlos: cada uno resuelve un problema que dejó abierto el anterior, y esa cadena explica por qué el campo tomó las decisiones que tomó. Si querés esa historia narrada en vez de la lista cruda, está en la línea de tiempo.
Si vas a leer uno solo: «Attention Is All You Need». Si vas a leer cinco, sumá el de GPT-3 con las leyes de escalado, Chinchilla, InstructGPT y DeepSeek-R1.
104 recursos
El texto fundacional de la interpretabilidad mecanicista. Cabezas de atención como operaciones componibles sobre el residual stream.
Un modelo que finge estar alineado durante el entrenamiento para preservar sus preferencias. Evidencia empírica de un riesgo que era teórico.
El paper que define la era actual. Todo LLM de hoy es una variación de estas 15 páginas. Leelo al menos tres veces en tu vida.
Alinear imágenes y texto en un mismo espacio de embeddings. Es el ladrillo sobre el que se apoya casi todo lo multimodal.
'Pensemos paso a paso'. La observación más simple y más rentable de la historia reciente de los LLMs.
El paper que convirtió la seguridad de IA en agenda técnica: efectos colaterales, reward hacking, supervisión escalable, exploración segura.
Demostró en abierto que el razonamiento emerge de RL con recompensas verificables, sin SFT previo. Cambió el rumbo del campo en 2025.
MoE de 671B, Multi-head Latent Attention, entrenamiento en FP8, predicción multi-token. Ingeniería de eficiencia de altísimo nivel, documentada en detalle.
Group Relative Policy Optimization: elimina la red de valor de PPO. Es el algoritmo que entrena la mayoría de los modelos de razonamiento actuales.
El paper que hizo funcionar la difusión. Agregar ruido y aprender a quitarlo: la idea que reemplazó a las GANs.
Alineamiento por preferencias sin modelo de recompensa ni RL. Simple, estable y hoy el punto de partida por defecto.
Memoria virtual paginada aplicada al KV cache. Multiplicó por 24 el throughput de servir modelos y se volvió el estándar.
No aproxima nada: solo reordena el cómputo para respetar la jerarquía de memoria de la GPU. La optimización más importante de la década. Ver también FlashAttention-2 (2307.08691) y -3 (2407.08608).
Difusión en espacio latente en vez de píxeles: es Stable Diffusion. Hizo la generación de imágenes accesible a cualquiera.
Encontraron el circuito concreto que hace posible el aprendizaje en contexto. Uno de los resultados más satisfactorios del campo.
El paper que demostró in-context learning y disparó la carrera de escala.
Entrenar matrices de rango bajo en vez del modelo entero. Es la razón por la que podés hacer fine-tuning en una sola GPU.
La alternativa más seria a la atención cuadrática. Modelos de espacio de estados con selectividad, complejidad lineal en la longitud.
El 'horizonte temporal' de las tareas que un modelo completa se duplica cada ~7 meses. Es la métrica de progreso más informativa que existe hoy, porque mide autonomía y no conocimiento.
Grafos de atribución que muestran planificación anticipada, razonamiento multilingüe y racionalizaciones a posteriori dentro del modelo. Fascinante.
LoRA sobre un modelo base en 4 bits. Democratizó el fine-tuning de modelos de 65B en hardware de consumo.
Razonar y actuar alternadamente. Es el patrón base de prácticamente todo agente que exista hoy.
El paper que nombró RAG. Vale leerlo para ver cuánto se desvió la práctica actual de la propuesta original.
El paper que formalizó el segundo eje de escalado: pensar más en inferencia puede valer más que un modelo más grande.
El paper que convirtió el progreso de la IA en una ecuación. Pérdida como ley de potencia de cómputo, datos y parámetros.
Autoencoders dispersos aplicados a un modelo de producción: millones de características identificables y manipulables.
Puertas traseras que sobreviven al SFT, RLHF y al entrenamiento adversarial. Resultado incómodo y muy importante.
MoE: activar solo una fracción de los parámetros por token. Base de casi todos los modelos frontera actuales.
92 páginas con detalles reales de datos, infraestructura, fallos de hardware y post-training. El reporte técnico más útil publicado por un laboratorio grande.
Por qué las neuronas representan más conceptos que dimensiones tienen. Explica por qué interpretar redes es tan difícil.
Corrigió a Kaplan: los modelos estaban muy subentrenados en datos. Reescribió el presupuesto de entrenamiento de toda la industria.
El paper que convirtió un modelo de texto en un asistente. SFT + modelo de recompensa + PPO. Es la receta que dio origen a ChatGPT.
Los dos padres del RL moderno argumentan que los datos humanos se agotaron y que la próxima era será de agentes que aprenden de su propia experiencia. Si tenés que apostar a una sola tesis sobre el futuro, esta es la más respaldada por trayectoria.
Sesgos lineales en atención que permiten extrapolar a secuencias más largas que las de entrenamiento.
El optimizador por defecto durante una década. Entender momento y varianza adaptativa te explica el 90% de los problemas de entrenamiento.
Los transformers se comen la visión por computadora. El puente hacia los modelos multimodales.
El espacio latente. Sin VAEs no hay Stable Diffusion (que difunde en latente, no en píxeles).
La rama encoder-only. Sigue siendo el caballo de batalla de clasificación, embeddings y búsqueda.
Y su primo LayerNorm (arXiv:1607.06450), que es el que realmente usan los transformers.
Curar bien los datos puede romper la ley de potencia. Uno de los resultados más accionables sobre calidad de datos.
Elimina el tokenizador y agrupa bytes dinámicamente según entropía. Una de las líneas más prometedoras para superar las limitaciones de la tokenización.
El truco que hace que los modelos de imagen obedezcan al prompt. El parámetro `guidance_scale` sale de acá.
RLAIF: reemplazar parte del feedback humano por principios explícitos + crítica del propio modelo.
Los modelos actuales no aprenden después de entrenados. Resolverlo es probablemente la próxima gran ruptura: seguí esta literatura de cerca.
Rompe la intuición clásica de bias-variance: más parámetros pueden mejorar la generalización. Base conceptual del escalado moderno.
Las conexiones residuales son la razón por la que hoy podemos entrenar redes de 100+ capas. Están dentro de todo transformer.
La destilación es hoy la técnica más rentable de la industria: modelos chicos que imitan a los grandes.
Descompone magnitud y dirección. Suele superar a LoRA con el mismo presupuesto de parámetros.
Corpus abierto con toolkit de curación documentado. Complemento perfecto de OLMo.
Leelo junto a su refutación: 'Are Emergent Abilities a Mirage?' (arXiv:2304.15004). El debate en sí enseña más que cualquiera de los dos.
Un modelo chico propone tokens, el grande los verifica en paralelo. 2-3× de aceleración sin perder calidad.
Cómo se construye realmente un corpus de 15T tokens: deduplicación, filtros, clasificadores educativos. El blog interactivo asociado es aún mejor que el paper.
Cómo intercalar imágenes y texto con cross-attention. Diseño arquitectónico influyente.
La formulación que reemplazó a la difusión clásica en los modelos de imagen y video más recientes. Más simple y más rápida.
Cuando la pregunta es sobre el corpus entero y no sobre un pasaje, el RAG por similitud falla. GraphRAG es la respuesta más elaborada.
Paper de dos páginas cuya conclusión honesta es 'no sabemos por qué funciona'. Está en casi todos los LLMs actuales.
Cuantización a 3-4 bits en una pasada. Junto a AWQ (2306.00978), la base de todos los modelos cuantizados que descargás.
El compromiso entre multi-head y multi-query que usan Llama, Mistral y casi todos. Reduce el KV cache drásticamente.
La era pre-difusión de la generación de imágenes. Históricamente clave y aún útil conceptualmente.
Memoria, reflexión y planificación en agentes que conviven. El paper más influyente sobre arquitectura de memoria agéntica.
Mundos jugables generados a partir de video sin etiquetas de acción. Una de las líneas más ambiciosas hacia agentes encarnados.
Modelos que memorizan y mucho después 'entienden'. Uno de los fenómenos más raros y estudiados del deep learning.
Consenso científico internacional sobre qué sabemos y qué no sobre capacidades y riesgos. La referencia neutral cuando la discusión se polariza.
El informe de consenso científico internacional sobre capacidades y riesgos, respaldado por 30+ países. La síntesis más equilibrada disponible.
Los híbridos (capas de atención + capas SSM) son hoy la apuesta más probable para contexto largo. Ver también Griffin (arXiv:2402.19427).
Usar modelos como jueces funciona, pero con sesgos medibles (posición, verbosidad, auto-preferencia). Leé esto antes de confiar en tu LLM-judge.
Por qué la cuantización ingenua falla en modelos grandes y cómo se resuelve. Fundamento de bitsandbytes.
El paper que abrió el ecosistema open-weights. Todo el mundo local corriendo modelos empieza acá.
El origen del decoder-only puro. Es la arquitectura que se sigue reimplementando en todos los tutoriales.
Predecir conceptos (oraciones en espacio de embeddings) en lugar de tokens. Apuesta de Meta contra el paradigma token-por-token.
Recompensar cada paso del razonamiento, no solo el resultado. Antecedente directo de los modelos tipo o1/o3.
El paper que hizo el MoE disperso accesible en abierto. Lectura obligada para entender MoE en la práctica.
No todos los tokens necesitan todas las capas. Cómputo adaptativo dentro del forward pass.
Y 'Datasheets for Datasets' (arXiv:1803.09010). Documentar qué hace un modelo y con qué datos es parte del oficio.
El origen de Byte-Pair Encoding, el algoritmo detrás de casi todos los tokenizadores actuales.
Modelo verdaderamente abierto: pesos, datos, código de entrenamiento, checkpoints intermedios y logs. Oro puro para investigar.
La crítica más influyente desde el otro lado del debate: costos ambientales, sesgo, opacidad de datos. Leelo aunque no coincidas.
El algoritmo de RL sobre el que se construyó todo el RLHF. Vale entenderlo aunque hoy uses GRPO o DPO.
154 checkpoints por modelo, en 8 escalas, con el orden de datos exacto. La herramienta estándar para estudiar dinámicas de entrenamiento.
RNN entrenable en paralelo, inferencia con memoria constante. Comunidad abierta muy activa.
Metodología de red-teaming con datos publicados. Base práctica para evaluar riesgos de un modelo.
Cómo casi todos los LLMs modernos codifican posición. Entender RoPE es entender por qué se puede extender el contexto.
El modelo que resolvió el reconocimiento de voz en abierto, incluido el español. Pesos libres.
LayerNorm sin la media. Más barato y funciona igual. Otro estándar silencioso.
Bootstrap del razonamiento: el modelo genera cadenas, filtrás las correctas, reentrenás. Base de casi todo el auto-mejoramiento actual.
Qué pasa cuando repetís datos (spoiler: se degrada peor de lo que pensás). Crucial ahora que los datos web de calidad escasean.
Modelo fundacional de segmentación. Ejemplo modelo de cómo diseñar una tarea + motor de datos + modelo a la vez.
Muestrear varias cadenas y votar por mayoría. La técnica de inferencia con mejor relación esfuerzo/beneficio.
'Todo es texto-a-texto'. Además, el estudio ablativo más sistemático que se hizo sobre decisiones de arquitectura.
Datos sintéticos de altísima calidad superan a montañas de datos web. Inició la línea de modelos pequeños sorprendentemente capaces.
Sostiene que los modelos de razonamiento colapsan al aumentar la complejidad. Provocó respuestas técnicas fuertes: el intercambio completo es el mejor material sobre qué significa 'razonar'.
Dentro de una red grande hay subredes chicas que entrenan igual de bien. Fundamento conceptual del pruning.
El primer corpus abierto grande y documentado. Referencia histórica sobre composición de datos.
Memoria neuronal a largo plazo que se actualiza durante la inferencia. Empuja hacia el aprendizaje continuo.
Los modelos aprenden solos cuándo llamar a una API. Antecedente del tool use nativo actual.
Unifica atención y modelos de espacio de estados bajo un mismo marco teórico. Uno de los papers conceptualmente más importantes de los últimos años.
Búsqueda deliberada sobre estados de razonamiento en lugar de una sola cadena lineal.
Sufijos adversariales que rompen el alineamiento y transfieren entre modelos. Lectura obligada antes de confiar en filtros de seguridad.
Robustez, monitoreo, alineamiento y riesgo sistémico como cuatro problemas separados. Buen marco mental.
El reporte técnico que instaló la idea de 'modelos del mundo' como camino hacia el razonamiento físico.
La receta abierta para convertir un LLM en un modelo de visión: encoder + proyector + instrucciones. Base de casi todo VLM abierto.
¿Puede un supervisor débil alinear a un modelo más capaz que él? La pregunta central de la supervisión escalable.
Proyección cuantitativa del agotamiento del texto humano de calidad. La razón por la que datos sintéticos y RL pasaron al centro de la escena.
La idea detrás de DeepSpeed y FSDP: repartir estados del optimizador, gradientes y parámetros entre GPUs.
Preguntas frecuentes
¿Por dónde empiezo a leer papers de IA?
Por «Attention Is All You Need», pero acompañado: leelo junto a The Illustrated Transformer y The Annotated Transformer, que lo explican visualmente y con código. Leer el paper solo, sin apoyo, es innecesariamente difícil la primera vez.
¿Cómo se lee un paper de machine learning?
En tres pasadas. Primero resumen, introducción y conclusiones para saber si te sirve. Después figuras y tablas de resultados, que suelen contar la historia completa. Recién entonces el método en detalle, y solo si vas a implementarlo o a criticarlo. Casi nadie lee papers de forma lineal.
¿Dónde se publican los papers de IA?
Mayoritariamente en arXiv, en abierto y antes de cualquier revisión por pares. Las conferencias que importan son NeurIPS, ICML y ICLR, pero en la práctica el campo se mueve por arXiv y por los reportes técnicos que publican los laboratorios.