Papers de IA: los que hay que leer

Leer papers asusta más de lo que cuesta. El inglés técnico es limitado y repetitivo, la estructura es siempre la misma, y después de diez papers el vocabulario deja de ser un obstáculo. Lo difícil no es el idioma: es saber cuáles vale la pena leer, porque se publican miles por mes y la mayoría no cambia nada.

Estos están ordenados cronológicamente, que es la forma en que más rinde leerlos: cada uno resuelve un problema que dejó abierto el anterior, y esa cadena explica por qué el campo tomó las decisiones que tomó. Si querés esa historia narrada en vez de la lista cruda, está en la línea de tiempo.

Si vas a leer uno solo: «Attention Is All You Need». Si vas a leer cinco, sumá el de GPT-3 con las leyes de escalado, Chinchilla, InstructGPT y DeepSeek-R1.

104 recursos

A Mathematical Framework for Transformer Circuits ★ · Anthropic

El texto fundacional de la interpretabilidad mecanicista. Cabezas de atención como operaciones componibles sobre el residual stream.

📄 Paper Avanzado 2021 Interpretabilidad
Alignment Faking in Large Language Models ★ · Anthropic & Redwood Research

Un modelo que finge estar alineado durante el entrenamiento para preservar sus preferencias. Evidencia empírica de un riesgo que era teórico.

📄 Paper Avanzado 2024 Alineamiento y seguridad
Attention Is All You Need ★ · Vaswani et al. (Google)

El paper que define la era actual. Todo LLM de hoy es una variación de estas 15 páginas. Leelo al menos tres veces en tu vida.

📄 Paper Intermedio 2017 Arquitecturas
CLIP: Learning Transferable Visual Models From Natural Language Supervision ★ · Radford et al. (OpenAI)

Alinear imágenes y texto en un mismo espacio de embeddings. Es el ladrillo sobre el que se apoya casi todo lo multimodal.

📄 Paper Intermedio 2021 Multimodal y generativos
Chain-of-Thought Prompting Elicits Reasoning in LLMs ★ · Wei et al. (Google)

'Pensemos paso a paso'. La observación más simple y más rentable de la historia reciente de los LLMs.

📄 Paper Intermedio 2022 Post-training, RLHF y razonamiento
Concrete Problems in AI Safety ★ · Amodei, Olah et al.

El paper que convirtió la seguridad de IA en agenda técnica: efectos colaterales, reward hacking, supervisión escalable, exploración segura.

📄 Paper Intermedio 2016 Alineamiento y seguridad
DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via RL ★ · DeepSeek AI

Demostró en abierto que el razonamiento emerge de RL con recompensas verificables, sin SFT previo. Cambió el rumbo del campo en 2025.

📄 Paper Avanzado 2025 Transformers y LLMs
DeepSeek-V3 Technical Report ★ · DeepSeek AI

MoE de 671B, Multi-head Latent Attention, entrenamiento en FP8, predicción multi-token. Ingeniería de eficiencia de altísimo nivel, documentada en detalle.

📄 Paper Avanzado 2024 Transformers y LLMs
DeepSeekMath: GRPO ★ · DeepSeek AI

Group Relative Policy Optimization: elimina la red de valor de PPO. Es el algoritmo que entrena la mayoría de los modelos de razonamiento actuales.

📄 Paper Avanzado 2024 Post-training, RLHF y razonamiento
Denoising Diffusion Probabilistic Models (DDPM) ★ · Ho, Jain, Abbeel

El paper que hizo funcionar la difusión. Agregar ruido y aprender a quitarlo: la idea que reemplazó a las GANs.

📄 Paper Intermedio 2020 Multimodal y generativos
Direct Preference Optimization (DPO) ★ · Rafailov et al. (Stanford)

Alineamiento por preferencias sin modelo de recompensa ni RL. Simple, estable y hoy el punto de partida por defecto.

📄 Paper Intermedio 2023 Post-training, RLHF y razonamiento
Efficient Memory Management for LLM Serving with PagedAttention (vLLM) ★ · Kwon et al. (Berkeley)

Memoria virtual paginada aplicada al KV cache. Multiplicó por 24 el throughput de servir modelos y se volvió el estándar.

📄 Paper Avanzado 2023 Inferencia y optimización
FlashAttention: Fast and Memory-Efficient Exact Attention ★ · Tri Dao et al.

No aproxima nada: solo reordena el cómputo para respetar la jerarquía de memoria de la GPU. La optimización más importante de la década. Ver también FlashAttention-2 (2307.08691) y -3 (2407.08608).

📄 Paper Avanzado 2022 Inferencia y optimización
High-Resolution Image Synthesis with Latent Diffusion Models ★ · Rombach et al.

Difusión en espacio latente en vez de píxeles: es Stable Diffusion. Hizo la generación de imágenes accesible a cualquiera.

📄 Paper Intermedio 2021 Multimodal y generativos
In-context Learning and Induction Heads ★ · Anthropic

Encontraron el circuito concreto que hace posible el aprendizaje en contexto. Uno de los resultados más satisfactorios del campo.

📄 Paper Avanzado 2022 Interpretabilidad
Language Models are Few-Shot Learners (GPT-3) ★ · Brown et al. (OpenAI)

El paper que demostró in-context learning y disparó la carrera de escala.

📄 Paper Intermedio 2020 Transformers y LLMs
LoRA: Low-Rank Adaptation of Large Language Models ★ · Hu et al. (Microsoft)

Entrenar matrices de rango bajo en vez del modelo entero. Es la razón por la que podés hacer fine-tuning en una sola GPU.

📄 Paper Intermedio 2021 Fine-tuning práctico
Mamba: Linear-Time Sequence Modeling with Selective State Spaces ★ · Gu & Dao

La alternativa más seria a la atención cuadrática. Modelos de espacio de estados con selectividad, complejidad lineal en la longitud.

📄 Paper Avanzado 2023 Arquitecturas
Measuring AI Ability to Complete Long Tasks ★ · METR

El 'horizonte temporal' de las tareas que un modelo completa se duplica cada ~7 meses. Es la métrica de progreso más informativa que existe hoy, porque mide autonomía y no conocimiento.

📄 Paper Intermedio 2025 Qué se viene
On the Biology of a Large Language Model / Circuit Tracing ★ · Anthropic

Grafos de atribución que muestran planificación anticipada, razonamiento multilingüe y racionalizaciones a posteriori dentro del modelo. Fascinante.

📄 Paper Avanzado 2025 Interpretabilidad
QLoRA: Efficient Finetuning of Quantized LLMs ★ · Dettmers et al.

LoRA sobre un modelo base en 4 bits. Democratizó el fine-tuning de modelos de 65B en hardware de consumo.

📄 Paper Intermedio 2023 Fine-tuning práctico
ReAct: Synergizing Reasoning and Acting in Language Models ★ · Yao et al.

Razonar y actuar alternadamente. Es el patrón base de prácticamente todo agente que exista hoy.

📄 Paper Intermedio 2022 RAG, agentes y contexto
Retrieval-Augmented Generation for Knowledge-Intensive NLP ★ · Lewis et al. (Meta)

El paper que nombró RAG. Vale leerlo para ver cuánto se desvió la práctica actual de la propuesta original.

📄 Paper Intermedio 2020 RAG, agentes y contexto
Scaling LLM Test-Time Compute Optimally ★ · Snell et al. (DeepMind/Berkeley)

El paper que formalizó el segundo eje de escalado: pensar más en inferencia puede valer más que un modelo más grande.

📄 Paper Avanzado 2024 Post-training, RLHF y razonamiento
Scaling Laws for Neural Language Models ★ · Kaplan et al. (OpenAI)

El paper que convirtió el progreso de la IA en una ecuación. Pérdida como ley de potencia de cómputo, datos y parámetros.

📄 Paper Intermedio 2020 Datos, tokenización y scaling laws
Scaling Monosemanticity: Extracting Interpretable Features from Claude 3 Sonnet ★ · Anthropic

Autoencoders dispersos aplicados a un modelo de producción: millones de características identificables y manipulables.

📄 Paper Avanzado 2024 Interpretabilidad
Sleeper Agents: Training Deceptive LLMs that Persist Through Safety Training ★ · Anthropic

Puertas traseras que sobreviven al SFT, RLHF y al entrenamiento adversarial. Resultado incómodo y muy importante.

📄 Paper Avanzado 2024 Alineamiento y seguridad
Switch Transformers (Mixture of Experts a escala) ★ · Fedus, Zoph, Shazeer (Google)

MoE: activar solo una fracción de los parámetros por token. Base de casi todos los modelos frontera actuales.

📄 Paper Avanzado 2021 Arquitecturas
The Llama 3 Herd of Models ★ · Meta AI

92 páginas con detalles reales de datos, infraestructura, fallos de hardware y post-training. El reporte técnico más útil publicado por un laboratorio grande.

📄 Paper Intermedio 2024 Transformers y LLMs
Toy Models of Superposition ★ · Anthropic

Por qué las neuronas representan más conceptos que dimensiones tienen. Explica por qué interpretar redes es tan difícil.

📄 Paper Avanzado 2022 Interpretabilidad
Training Compute-Optimal Large Language Models (Chinchilla) ★ · Hoffmann et al. (DeepMind)

Corrigió a Kaplan: los modelos estaban muy subentrenados en datos. Reescribió el presupuesto de entrenamiento de toda la industria.

📄 Paper Intermedio 2022 Datos, tokenización y scaling laws
Training language models to follow instructions with human feedback (InstructGPT) ★ · Ouyang et al. (OpenAI)

El paper que convirtió un modelo de texto en un asistente. SFT + modelo de recompensa + PPO. Es la receta que dio origen a ChatGPT.

📄 Paper Intermedio 2022 Post-training, RLHF y razonamiento
Welcome to the Era of Experience ★ · David Silver & Richard Sutton

Los dos padres del RL moderno argumentan que los datos humanos se agotaron y que la próxima era será de agentes que aprenden de su propia experiencia. Si tenés que apostar a una sola tesis sobre el futuro, esta es la más respaldada por trayectoria.

📄 Paper Intermedio 2025 Qué se viene
ALiBi: Train Short, Test Long · Press, Smith, Lewis

Sesgos lineales en atención que permiten extrapolar a secuencias más largas que las de entrenamiento.

📄 Paper Avanzado 2021 Arquitecturas
Adam: A Method for Stochastic Optimization · Kingma & Ba

El optimizador por defecto durante una década. Entender momento y varianza adaptativa te explica el 90% de los problemas de entrenamiento.

📄 Paper Intermedio 2014 Deep learning
An Image is Worth 16x16 Words (Vision Transformer) · Dosovitskiy et al. (Google)

Los transformers se comen la visión por computadora. El puente hacia los modelos multimodales.

📄 Paper Intermedio 2020 Arquitecturas
Auto-Encoding Variational Bayes (VAE) · Kingma & Welling

El espacio latente. Sin VAEs no hay Stable Diffusion (que difunde en latente, no en píxeles).

📄 Paper Intermedio 2013 Arquitecturas
BERT: Pre-training of Deep Bidirectional Transformers · Devlin et al. (Google)

La rama encoder-only. Sigue siendo el caballo de batalla de clasificación, embeddings y búsqueda.

📄 Paper Intermedio 2018 Arquitecturas
Batch Normalization · Ioffe & Szegedy

Y su primo LayerNorm (arXiv:1607.06450), que es el que realmente usan los transformers.

📄 Paper Intermedio 2015 Deep learning
Beyond neural scaling laws: beating power law scaling via data pruning · Sorscher et al.

Curar bien los datos puede romper la ley de potencia. Uno de los resultados más accionables sobre calidad de datos.

📄 Paper Avanzado 2022 Datos, tokenización y scaling laws
Byte Latent Transformer: Patches Scale Better Than Tokens · Meta AI

Elimina el tokenizador y agrupa bytes dinámicamente según entropía. Una de las líneas más prometedoras para superar las limitaciones de la tokenización.

📄 Paper Avanzado 2024 Arquitecturas
Classifier-Free Diffusion Guidance · Ho & Salimans

El truco que hace que los modelos de imagen obedezcan al prompt. El parámetro `guidance_scale` sale de acá.

📄 Paper Avanzado 2022 Multimodal y generativos
Constitutional AI: Harmlessness from AI Feedback · Anthropic

RLAIF: reemplazar parte del feedback humano por principios explícitos + crítica del propio modelo.

📄 Paper Intermedio 2022 Post-training, RLHF y razonamiento
Continual learning y catastrophic forgetting (línea de investigación) · varios

Los modelos actuales no aprenden después de entrenados. Resolverlo es probablemente la próxima gran ruptura: seguí esta literatura de cerca.

📄 Paper Avanzado 2025 Qué se viene
Deep Double Descent · Nakkiran et al. (OpenAI)

Rompe la intuición clásica de bias-variance: más parámetros pueden mejorar la generalización. Base conceptual del escalado moderno.

📄 Paper Avanzado 2019 Deep learning
Deep Residual Learning for Image Recognition (ResNet) · He, Zhang, Ren, Sun

Las conexiones residuales son la razón por la que hoy podemos entrenar redes de 100+ capas. Están dentro de todo transformer.

📄 Paper Avanzado 2015 Deep learning
Distilling the Knowledge in a Neural Network · Hinton, Vinyals, Dean

La destilación es hoy la técnica más rentable de la industria: modelos chicos que imitan a los grandes.

📄 Paper Intermedio 2015 Fine-tuning práctico
DoRA: Weight-Decomposed Low-Rank Adaptation · Liu et al. (NVIDIA)

Descompone magnitud y dirección. Suele superar a LoRA con el mismo presupuesto de parámetros.

📄 Paper Avanzado 2024 Fine-tuning práctico
Dolma: an Open Corpus of Three Trillion Tokens · Allen Institute for AI

Corpus abierto con toolkit de curación documentado. Complemento perfecto de OLMo.

📄 Paper Intermedio 2024 Datos, tokenización y scaling laws
Emergent Abilities of Large Language Models · Wei et al.

Leelo junto a su refutación: 'Are Emergent Abilities a Mirage?' (arXiv:2304.15004). El debate en sí enseña más que cualquiera de los dos.

📄 Paper Intermedio 2022 Transformers y LLMs
Fast Inference from Transformers via Speculative Decoding · Leviathan et al. (Google)

Un modelo chico propone tokens, el grande los verifica en paralelo. 2-3× de aceleración sin perder calidad.

📄 Paper Avanzado 2022 Inferencia y optimización
FineWeb: decanting the web for the finest text data at scale · Hugging Face

Cómo se construye realmente un corpus de 15T tokens: deduplicación, filtros, clasificadores educativos. El blog interactivo asociado es aún mejor que el paper.

📄 Paper Avanzado 2024 Datos, tokenización y scaling laws
Flamingo: a Visual Language Model for Few-Shot Learning · DeepMind

Cómo intercalar imágenes y texto con cross-attention. Diseño arquitectónico influyente.

📄 Paper Intermedio 2022 Multimodal y generativos
Flow Matching for Generative Modeling · Lipman et al. (Meta)

La formulación que reemplazó a la difusión clásica en los modelos de imagen y video más recientes. Más simple y más rápida.

📄 Paper Avanzado 2022 Multimodal y generativos
From Local to Global: A Graph RAG Approach · Microsoft Research

Cuando la pregunta es sobre el corpus entero y no sobre un pasaje, el RAG por similitud falla. GraphRAG es la respuesta más elaborada.

📄 Paper Avanzado 2024 RAG, agentes y contexto
GLU Variants Improve Transformer (SwiGLU) · Noam Shazeer

Paper de dos páginas cuya conclusión honesta es 'no sabemos por qué funciona'. Está en casi todos los LLMs actuales.

📄 Paper Avanzado 2020 Arquitecturas
GPTQ: Accurate Post-Training Quantization · Frantar et al.

Cuantización a 3-4 bits en una pasada. Junto a AWQ (2306.00978), la base de todos los modelos cuantizados que descargás.

📄 Paper Avanzado 2022 Inferencia y optimización
GQA: Grouped-Query Attention · Ainslie et al. (Google)

El compromiso entre multi-head y multi-query que usan Llama, Mistral y casi todos. Reduce el KV cache drásticamente.

📄 Paper Avanzado 2023 Arquitecturas
Generative Adversarial Networks · Goodfellow et al.

La era pre-difusión de la generación de imágenes. Históricamente clave y aún útil conceptualmente.

📄 Paper Intermedio 2014 Arquitecturas
Generative Agents: Interactive Simulacra of Human Behavior · Park et al. (Stanford)

Memoria, reflexión y planificación en agentes que conviven. El paper más influyente sobre arquitectura de memoria agéntica.

📄 Paper Intermedio 2023 RAG, agentes y contexto
Genie: Generative Interactive Environments · DeepMind

Mundos jugables generados a partir de video sin etiquetas de acción. Una de las líneas más ambiciosas hacia agentes encarnados.

📄 Paper Avanzado 2024 Multimodal y generativos
Grokking: Generalization Beyond Overfitting · Power et al. (OpenAI)

Modelos que memorizan y mucho después 'entienden'. Uno de los fenómenos más raros y estudiados del deep learning.

📄 Paper Avanzado 2022 Deep learning
International AI Safety Report · Bengio et al.

Consenso científico internacional sobre qué sabemos y qué no sobre capacidades y riesgos. La referencia neutral cuando la discusión se polariza.

📄 Paper Intermedio 2025 Qué se viene
International AI Safety Report · Yoshua Bengio y 100+ expertos

El informe de consenso científico internacional sobre capacidades y riesgos, respaldado por 30+ países. La síntesis más equilibrada disponible.

📄 Paper Intermedio 2025 Alineamiento y seguridad
Jamba: A Hybrid Transformer-Mamba Language Model · AI21 Labs

Los híbridos (capas de atención + capas SSM) son hoy la apuesta más probable para contexto largo. Ver también Griffin (arXiv:2402.19427).

📄 Paper Avanzado 2024 Arquitecturas
Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena · Zheng et al. (LMSYS)

Usar modelos como jueces funciona, pero con sesgos medibles (posición, verbosidad, auto-preferencia). Leé esto antes de confiar en tu LLM-judge.

📄 Paper Intermedio 2023 Evaluación y benchmarks
LLM.int8() y el problema de los outliers · Tim Dettmers et al.

Por qué la cuantización ingenua falla en modelos grandes y cómo se resuelve. Fundamento de bitsandbytes.

📄 Paper Avanzado 2022 Inferencia y optimización
LLaMA: Open and Efficient Foundation Language Models · Touvron et al. (Meta)

El paper que abrió el ecosistema open-weights. Todo el mundo local corriendo modelos empieza acá.

📄 Paper Intermedio 2023 Transformers y LLMs
Language Models are Unsupervised Multitask Learners (GPT-2) · Radford et al. (OpenAI)

El origen del decoder-only puro. Es la arquitectura que se sigue reimplementando en todos los tutoriales.

📄 Paper Intermedio 2019 Transformers y LLMs
Large Concept Models: Language Modeling in a Sentence Representation Space · Meta AI

Predecir conceptos (oraciones en espacio de embeddings) en lugar de tokens. Apuesta de Meta contra el paradigma token-por-token.

📄 Paper Avanzado 2024 Arquitecturas
Let's Verify Step by Step (process supervision) · Lightman et al. (OpenAI)

Recompensar cada paso del razonamiento, no solo el resultado. Antecedente directo de los modelos tipo o1/o3.

📄 Paper Intermedio 2023 Post-training, RLHF y razonamiento
Mixtral of Experts · Mistral AI

El paper que hizo el MoE disperso accesible en abierto. Lectura obligada para entender MoE en la práctica.

📄 Paper Avanzado 2024 Arquitecturas
Mixture-of-Depths: dynamically allocating compute · Raposo et al. (DeepMind)

No todos los tokens necesitan todas las capas. Cómputo adaptativo dentro del forward pass.

📄 Paper Avanzado 2024 Arquitecturas
Model Cards for Model Reporting · Mitchell et al. (Google)

Y 'Datasheets for Datasets' (arXiv:1803.09010). Documentar qué hace un modelo y con qué datos es parte del oficio.

📄 Paper Intermedio 2018 Evaluación y benchmarks
Neural Machine Translation of Rare Words with Subword Units (BPE) · Sennrich, Haddow, Birch

El origen de Byte-Pair Encoding, el algoritmo detrás de casi todos los tokenizadores actuales.

📄 Paper Avanzado 2015 Datos, tokenización y scaling laws
OLMo: Accelerating the Science of Language Models · Allen Institute for AI

Modelo verdaderamente abierto: pesos, datos, código de entrenamiento, checkpoints intermedios y logs. Oro puro para investigar.

📄 Paper Intermedio 2024 Transformers y LLMs
On the Dangers of Stochastic Parrots · Bender, Gebru, McMillan-Major, Mitchell

La crítica más influyente desde el otro lado del debate: costos ambientales, sesgo, opacidad de datos. Leelo aunque no coincidas.

📄 Paper Intermedio 2021 Alineamiento y seguridad
Proximal Policy Optimization (PPO) · Schulman et al. (OpenAI)

El algoritmo de RL sobre el que se construyó todo el RLHF. Vale entenderlo aunque hoy uses GRPO o DPO.

📄 Paper Intermedio 2017 Post-training, RLHF y razonamiento
Pythia: A Suite for Analyzing LLMs Across Training and Scaling · EleutherAI

154 checkpoints por modelo, en 8 escalas, con el orden de datos exacto. La herramienta estándar para estudiar dinámicas de entrenamiento.

📄 Paper Avanzado 2023 Transformers y LLMs
RWKV: Reinventing RNNs for the Transformer Era · Peng et al.

RNN entrenable en paralelo, inferencia con memoria constante. Comunidad abierta muy activa.

📄 Paper Avanzado 2023 Arquitecturas
Red Teaming Language Models to Reduce Harms · Anthropic

Metodología de red-teaming con datos publicados. Base práctica para evaluar riesgos de un modelo.

📄 Paper Intermedio 2022 Alineamiento y seguridad
RoFormer: Rotary Position Embedding (RoPE) · Su et al.

Cómo casi todos los LLMs modernos codifican posición. Entender RoPE es entender por qué se puede extender el contexto.

📄 Paper Avanzado 2021 Arquitecturas
Robust Speech Recognition via Large-Scale Weak Supervision (Whisper) · OpenAI

El modelo que resolvió el reconocimiento de voz en abierto, incluido el español. Pesos libres.

📄 Paper Intermedio 2022 Multimodal y generativos
Root Mean Square Layer Normalization (RMSNorm) · Zhang & Sennrich

LayerNorm sin la media. Más barato y funciona igual. Otro estándar silencioso.

📄 Paper Avanzado 2019 Arquitecturas
STaR: Self-Taught Reasoner · Zelikman et al. (Stanford)

Bootstrap del razonamiento: el modelo genera cadenas, filtrás las correctas, reentrenás. Base de casi todo el auto-mejoramiento actual.

📄 Paper Avanzado 2022 Post-training, RLHF y razonamiento
Scaling Laws and Interpretability of Learning from Repeated Data · Anthropic

Qué pasa cuando repetís datos (spoiler: se degrada peor de lo que pensás). Crucial ahora que los datos web de calidad escasean.

📄 Paper Avanzado 2022 Datos, tokenización y scaling laws
Segment Anything (SAM) · Meta AI

Modelo fundacional de segmentación. Ejemplo modelo de cómo diseñar una tarea + motor de datos + modelo a la vez.

📄 Paper Avanzado 2023 Multimodal y generativos
Self-Consistency Improves Chain of Thought Reasoning · Wang et al. (Google)

Muestrear varias cadenas y votar por mayoría. La técnica de inferencia con mejor relación esfuerzo/beneficio.

📄 Paper Intermedio 2022 Post-training, RLHF y razonamiento
T5: Exploring the Limits of Transfer Learning · Raffel et al. (Google)

'Todo es texto-a-texto'. Además, el estudio ablativo más sistemático que se hizo sobre decisiones de arquitectura.

📄 Paper Intermedio 2019 Arquitecturas
Textbooks Are All You Need (phi-1) · Microsoft Research

Datos sintéticos de altísima calidad superan a montañas de datos web. Inició la línea de modelos pequeños sorprendentemente capaces.

📄 Paper Intermedio 2023 Datos, tokenización y scaling laws
The Illusion of Thinking / debates sobre razonamiento en LLMs · Apple ML Research y respuestas

Sostiene que los modelos de razonamiento colapsan al aumentar la complejidad. Provocó respuestas técnicas fuertes: el intercambio completo es el mejor material sobre qué significa 'razonar'.

📄 Paper Avanzado 2025 Qué se viene
The Lottery Ticket Hypothesis · Frankle & Carbin

Dentro de una red grande hay subredes chicas que entrenan igual de bien. Fundamento conceptual del pruning.

📄 Paper Avanzado 2018 Deep learning
The Pile: An 800GB Dataset of Diverse Text · EleutherAI

El primer corpus abierto grande y documentado. Referencia histórica sobre composición de datos.

📄 Paper Intermedio 2020 Datos, tokenización y scaling laws
Titans: Learning to Memorize at Test Time · Behrouz et al. (Google)

Memoria neuronal a largo plazo que se actualiza durante la inferencia. Empuja hacia el aprendizaje continuo.

📄 Paper Avanzado 2025 Arquitecturas
Toolformer: Language Models Can Teach Themselves to Use Tools · Meta AI

Los modelos aprenden solos cuándo llamar a una API. Antecedente del tool use nativo actual.

📄 Paper Intermedio 2023 RAG, agentes y contexto
Transformers are SSMs (Mamba-2) · Dao & Gu

Unifica atención y modelos de espacio de estados bajo un mismo marco teórico. Uno de los papers conceptualmente más importantes de los últimos años.

📄 Paper Avanzado 2024 Arquitecturas
Tree of Thoughts · Yao et al. (Princeton/DeepMind)

Búsqueda deliberada sobre estados de razonamiento en lugar de una sola cadena lineal.

📄 Paper Avanzado 2023 Post-training, RLHF y razonamiento
Universal and Transferable Adversarial Attacks on Aligned LMs · Zou et al. (CMU)

Sufijos adversariales que rompen el alineamiento y transfieren entre modelos. Lectura obligada antes de confiar en filtros de seguridad.

📄 Paper Intermedio 2023 Alineamiento y seguridad
Unsolved Problems in ML Safety · Hendrycks et al.

Robustez, monitoreo, alineamiento y riesgo sistémico como cuatro problemas separados. Buen marco mental.

📄 Paper Intermedio 2021 Alineamiento y seguridad
Video generation models as world simulators (Sora) · OpenAI

El reporte técnico que instaló la idea de 'modelos del mundo' como camino hacia el razonamiento físico.

📄 Paper Avanzado 2024 Multimodal y generativos
Visual Instruction Tuning (LLaVA) · Liu et al.

La receta abierta para convertir un LLM en un modelo de visión: encoder + proyector + instrucciones. Base de casi todo VLM abierto.

📄 Paper Intermedio 2023 Multimodal y generativos
Weak-to-Strong Generalization · OpenAI (Superalignment)

¿Puede un supervisor débil alinear a un modelo más capaz que él? La pregunta central de la supervisión escalable.

📄 Paper Avanzado 2023 Alineamiento y seguridad
Will we run out of data? Limits of LLM scaling based on human-generated data · Villalobos et al. (Epoch AI)

Proyección cuantitativa del agotamiento del texto humano de calidad. La razón por la que datos sintéticos y RL pasaron al centro de la escena.

📄 Paper Intermedio 2022 Qué se viene
ZeRO: Memory Optimizations Toward Training Trillion Parameter Models · Rajbhandari et al. (Microsoft)

La idea detrás de DeepSpeed y FSDP: repartir estados del optimizador, gradientes y parámetros entre GPUs.

📄 Paper Avanzado 2019 Entrenar desde cero

Preguntas frecuentes

¿Por dónde empiezo a leer papers de IA?

Por «Attention Is All You Need», pero acompañado: leelo junto a The Illustrated Transformer y The Annotated Transformer, que lo explican visualmente y con código. Leer el paper solo, sin apoyo, es innecesariamente difícil la primera vez.

¿Cómo se lee un paper de machine learning?

En tres pasadas. Primero resumen, introducción y conclusiones para saber si te sirve. Después figuras y tablas de resultados, que suelen contar la historia completa. Recién entonces el método en detalle, y solo si vas a implementarlo o a criticarlo. Casi nadie lee papers de forma lineal.

¿Dónde se publican los papers de IA?

Mayoritariamente en arXiv, en abierto y antes de cualquier revisión por pares. Las conferencias que importan son NeurIPS, ICML y ICLR, pero en la práctica el campo se mueve por arXiv y por los reportes técnicos que publican los laboratorios.