Transformers y modelos de lenguaje (LLMs)

Si tuvieras que entender una sola arquitectura, es esta. El transformer reemplazó la recurrencia por atención pura en 2017 y desde entonces es el sustrato de casi todo: texto, código, imagen, audio y los sistemas de agentes que se construyen encima.

El camino que mejor funciona es en tres pasos. Primero la intuición visual —The Illustrated Transformer y los videos de Karpathy—, después el paper original leído en serio, y recién entonces los reportes técnicos de los modelos actuales. Esos reportes, los de Llama y DeepSeek especialmente, enseñan más sobre cómo se construye un modelo real que la mayoría de los cursos, porque documentan las decisiones y no solo el resultado.

Un detalle que suele omitirse: un modelo de lenguaje pre-entrenado no es un asistente. Es un autocompletador de internet. Todo lo que lo vuelve conversacional y útil ocurre después, en el post-entrenamiento.

18 recursos de transformers y LLMs

Ordenados con los imprescindibles primero y agrupados por tipo. Los marcados con ★ son los que recomendaría alguien que ya recorrió el camino; los que dicen «gratis» no cuestan nada.

🎓 Curso

▶️ Video

📄 Paper

DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via RL ★ · DeepSeek AI

Demostró en abierto que el razonamiento emerge de RL con recompensas verificables, sin SFT previo. Cambió el rumbo del campo en 2025.

📄 Paper Avanzado 2025 Transformers y LLMs
DeepSeek-V3 Technical Report ★ · DeepSeek AI

MoE de 671B, Multi-head Latent Attention, entrenamiento en FP8, predicción multi-token. Ingeniería de eficiencia de altísimo nivel, documentada en detalle.

📄 Paper Avanzado 2024 Transformers y LLMs
Language Models are Few-Shot Learners (GPT-3) ★ · Brown et al. (OpenAI)

El paper que demostró in-context learning y disparó la carrera de escala.

📄 Paper Intermedio 2020 Transformers y LLMs
The Llama 3 Herd of Models ★ · Meta AI

92 páginas con detalles reales de datos, infraestructura, fallos de hardware y post-training. El reporte técnico más útil publicado por un laboratorio grande.

📄 Paper Intermedio 2024 Transformers y LLMs
Emergent Abilities of Large Language Models · Wei et al.

Leelo junto a su refutación: 'Are Emergent Abilities a Mirage?' (arXiv:2304.15004). El debate en sí enseña más que cualquiera de los dos.

📄 Paper Intermedio 2022 Transformers y LLMs
LLaMA: Open and Efficient Foundation Language Models · Touvron et al. (Meta)

El paper que abrió el ecosistema open-weights. Todo el mundo local corriendo modelos empieza acá.

📄 Paper Intermedio 2023 Transformers y LLMs
Language Models are Unsupervised Multitask Learners (GPT-2) · Radford et al. (OpenAI)

El origen del decoder-only puro. Es la arquitectura que se sigue reimplementando en todos los tutoriales.

📄 Paper Intermedio 2019 Transformers y LLMs
OLMo: Accelerating the Science of Language Models · Allen Institute for AI

Modelo verdaderamente abierto: pesos, datos, código de entrenamiento, checkpoints intermedios y logs. Oro puro para investigar.

📄 Paper Intermedio 2024 Transformers y LLMs
Pythia: A Suite for Analyzing LLMs Across Training and Scaling · EleutherAI

154 checkpoints por modelo, en 8 escalas, con el orden de datos exacto. La herramienta estándar para estudiar dinámicas de entrenamiento.

📄 Paper Avanzado 2023 Transformers y LLMs

✍️ Blog/Post

Preguntas frecuentes sobre transformers y LLMs

¿Cómo funciona un LLM en pocas palabras?

Un modelo de lenguaje predice el siguiente token de una secuencia. Entrenado sobre cantidades enormes de texto, esa tarea aparentemente trivial lo obliga a representar gramática, hechos, estilo y razonamiento parcial. La generación es repetir esa predicción una y otra vez, realimentando lo generado.

¿Qué es el mecanismo de atención?

Es la operación que permite que cada token mire a todos los demás y decida de cuáles tomar información, ponderando según su relevancia. Reemplazó a la recurrencia porque se paraleliza: todas las posiciones se calculan a la vez en vez de una por una.

¿Qué es un token?

Es la unidad mínima que el modelo procesa: aproximadamente entre media palabra y una palabra en inglés, y algo menos en español, porque los tokenizadores están entrenados mayoritariamente sobre texto en inglés. Por eso el mismo texto en castellano suele costar más tokens —y más dinero— que su equivalente en inglés.