Transformers y modelos de lenguaje (LLMs)
Si tuvieras que entender una sola arquitectura, es esta. El transformer reemplazó la recurrencia por atención pura en 2017 y desde entonces es el sustrato de casi todo: texto, código, imagen, audio y los sistemas de agentes que se construyen encima.
El camino que mejor funciona es en tres pasos. Primero la intuición visual —The Illustrated Transformer y los videos de Karpathy—, después el paper original leído en serio, y recién entonces los reportes técnicos de los modelos actuales. Esos reportes, los de Llama y DeepSeek especialmente, enseñan más sobre cómo se construye un modelo real que la mayoría de los cursos, porque documentan las decisiones y no solo el resultado.
Un detalle que suele omitirse: un modelo de lenguaje pre-entrenado no es un asistente. Es un autocompletador de internet. Todo lo que lo vuelve conversacional y útil ocurre después, en el post-entrenamiento.
18 recursos de transformers y LLMs
Ordenados con los imprescindibles primero y agrupados por tipo. Los marcados con ★ son los que recomendaría alguien que ya recorrió el camino; los que dicen «gratis» no cuestan nada.
🎓 Curso
▶️ Video
3h30 que explican TODO el pipeline: pretraining, tokenización, alucinaciones, SFT, RLHF, modelos de razonamiento. Si solo podés ver un video, es este.
Un GPT completo, línea por línea, en dos horas. Es el rito de iniciación del campo.
La tokenización es la fuente de la mitad de las rarezas de los LLMs (aritmética, deletreo, idiomas no ingleses). Este video las explica todas.
La charla que instaló la analogía 'LLM = sistema operativo'. Excelente panorama de una hora.
Uso práctico: cuándo razonamiento, cuándo herramientas, cuándo desconfiar. Complemento aplicado del anterior.
📄 Paper
Demostró en abierto que el razonamiento emerge de RL con recompensas verificables, sin SFT previo. Cambió el rumbo del campo en 2025.
MoE de 671B, Multi-head Latent Attention, entrenamiento en FP8, predicción multi-token. Ingeniería de eficiencia de altísimo nivel, documentada en detalle.
El paper que demostró in-context learning y disparó la carrera de escala.
92 páginas con detalles reales de datos, infraestructura, fallos de hardware y post-training. El reporte técnico más útil publicado por un laboratorio grande.
Leelo junto a su refutación: 'Are Emergent Abilities a Mirage?' (arXiv:2304.15004). El debate en sí enseña más que cualquiera de los dos.
El paper que abrió el ecosistema open-weights. Todo el mundo local corriendo modelos empieza acá.
El origen del decoder-only puro. Es la arquitectura que se sigue reimplementando en todos los tutoriales.
Modelo verdaderamente abierto: pesos, datos, código de entrenamiento, checkpoints intermedios y logs. Oro puro para investigar.
154 checkpoints por modelo, en 8 escalas, con el orden de datos exacto. La herramienta estándar para estudiar dinámicas de entrenamiento.
✍️ Blog/Post
Libro online sobre el rendimiento real de TPUs/GPUs: paralelismo, roofline, comunicación colectiva. Muy poco material de esta calidad existe en abierto.
Las cuentas reales: memoria, ancho de banda, latencia, KV cache. Te enseña a estimar costos antes de gastarlos.
Ruta de lectura curada de papers, ordenada pedagógicamente. Excelente punto de partida bibliográfico.
Preguntas frecuentes sobre transformers y LLMs
¿Cómo funciona un LLM en pocas palabras?
Un modelo de lenguaje predice el siguiente token de una secuencia. Entrenado sobre cantidades enormes de texto, esa tarea aparentemente trivial lo obliga a representar gramática, hechos, estilo y razonamiento parcial. La generación es repetir esa predicción una y otra vez, realimentando lo generado.
¿Qué es el mecanismo de atención?
Es la operación que permite que cada token mire a todos los demás y decida de cuáles tomar información, ponderando según su relevancia. Reemplazó a la recurrencia porque se paraleliza: todas las posiciones se calculan a la vez en vez de una por una.
¿Qué es un token?
Es la unidad mínima que el modelo procesa: aproximadamente entre media palabra y una palabra en inglés, y algo menos en español, porque los tokenizadores están entrenados mayoritariamente sobre texto en inglés. Por eso el mismo texto en castellano suele costar más tokens —y más dinero— que su equivalente en inglés.