Arquitecturas de modelos de IA

El transformer domina, pero no es el final de la historia y conviene no estudiarlo como si lo fuera. Esta sección arma el mapa: las piezas que casi todos los modelos actuales comparten (RoPE, RMSNorm, SwiGLU, atención agrupada), las apuestas de eficiencia (mezcla de expertos, profundidad variable) y las alternativas que dejaron de ser curiosidades académicas.

Los modelos de espacio de estados aparecen hoy como capas intercaladas dentro de modelos de producción, no como reemplazos completos. Es el patrón típico del campo: las ideas nuevas entran como híbridos antes de ganar o desaparecer. Entender esa dinámica vale más que memorizar el diagrama de cada variante.

27 recursos de arquitecturas

Ordenados con los imprescindibles primero y agrupados por tipo. Los marcados con ★ son los que recomendaría alguien que ya recorrió el camino; los que dicen «gratis» no cuestan nada.

Attention Is All You Need ★ · Vaswani et al. (Google)

El paper que define la era actual. Todo LLM de hoy es una variación de estas 15 páginas. Leelo al menos tres veces en tu vida.

📄 Paper Intermedio 2017 Arquitecturas
Mamba: Linear-Time Sequence Modeling with Selective State Spaces ★ · Gu & Dao

La alternativa más seria a la atención cuadrática. Modelos de espacio de estados con selectividad, complejidad lineal en la longitud.

📄 Paper Avanzado 2023 Arquitecturas
Switch Transformers (Mixture of Experts a escala) ★ · Fedus, Zoph, Shazeer (Google)

MoE: activar solo una fracción de los parámetros por token. Base de casi todos los modelos frontera actuales.

📄 Paper Avanzado 2021 Arquitecturas
The Annotated Transformer ★ · Sasha Rush (Harvard NLP)

El paper original línea por línea, con el código PyTorch al lado de cada párrafo.

✍️ Blog/Post Intermedio 2022 Arquitecturas
The Illustrated Transformer ★ · Jay Alammar

La explicación visual definitiva de self-attention, multi-head y encoder-decoder. Leelo antes del paper original.

✍️ Blog/Post Inicial 2018 Arquitecturas
A Gentle Introduction to Graph Neural Networks · Distill.pub

GNNs explicadas interactivamente. Relevantes para química, biología, grafos de conocimiento y sistemas de recomendación.

✍️ Blog/Post Intermedio 2021 Arquitecturas
ALiBi: Train Short, Test Long · Press, Smith, Lewis

Sesgos lineales en atención que permiten extrapolar a secuencias más largas que las de entrenamiento.

📄 Paper Avanzado 2021 Arquitecturas
An Image is Worth 16x16 Words (Vision Transformer) · Dosovitskiy et al. (Google)

Los transformers se comen la visión por computadora. El puente hacia los modelos multimodales.

📄 Paper Intermedio 2020 Arquitecturas
Auto-Encoding Variational Bayes (VAE) · Kingma & Welling

El espacio latente. Sin VAEs no hay Stable Diffusion (que difunde en latente, no en píxeles).

📄 Paper Intermedio 2013 Arquitecturas
BERT: Pre-training of Deep Bidirectional Transformers · Devlin et al. (Google)

La rama encoder-only. Sigue siendo el caballo de batalla de clasificación, embeddings y búsqueda.

📄 Paper Intermedio 2018 Arquitecturas
Byte Latent Transformer: Patches Scale Better Than Tokens · Meta AI

Elimina el tokenizador y agrupa bytes dinámicamente según entropía. Una de las líneas más prometedoras para superar las limitaciones de la tokenización.

📄 Paper Avanzado 2024 Arquitecturas
GLU Variants Improve Transformer (SwiGLU) · Noam Shazeer

Paper de dos páginas cuya conclusión honesta es 'no sabemos por qué funciona'. Está en casi todos los LLMs actuales.

📄 Paper Avanzado 2020 Arquitecturas
GQA: Grouped-Query Attention · Ainslie et al. (Google)

El compromiso entre multi-head y multi-query que usan Llama, Mistral y casi todos. Reduce el KV cache drásticamente.

📄 Paper Avanzado 2023 Arquitecturas
Generative Adversarial Networks · Goodfellow et al.

La era pre-difusión de la generación de imágenes. Históricamente clave y aún útil conceptualmente.

📄 Paper Intermedio 2014 Arquitecturas
Jamba: A Hybrid Transformer-Mamba Language Model · AI21 Labs

Los híbridos (capas de atención + capas SSM) son hoy la apuesta más probable para contexto largo. Ver también Griffin (arXiv:2402.19427).

📄 Paper Avanzado 2024 Arquitecturas
Large Concept Models: Language Modeling in a Sentence Representation Space · Meta AI

Predecir conceptos (oraciones en espacio de embeddings) en lugar de tokens. Apuesta de Meta contra el paradigma token-por-token.

📄 Paper Avanzado 2024 Arquitecturas
Mixtral of Experts · Mistral AI

El paper que hizo el MoE disperso accesible en abierto. Lectura obligada para entender MoE en la práctica.

📄 Paper Avanzado 2024 Arquitecturas
Mixture-of-Depths: dynamically allocating compute · Raposo et al. (DeepMind)

No todos los tokens necesitan todas las capas. Cómputo adaptativo dentro del forward pass.

📄 Paper Avanzado 2024 Arquitecturas
RWKV: Reinventing RNNs for the Transformer Era · Peng et al.

RNN entrenable en paralelo, inferencia con memoria constante. Comunidad abierta muy activa.

📄 Paper Avanzado 2023 Arquitecturas
RoFormer: Rotary Position Embedding (RoPE) · Su et al.

Cómo casi todos los LLMs modernos codifican posición. Entender RoPE es entender por qué se puede extender el contexto.

📄 Paper Avanzado 2021 Arquitecturas
Root Mean Square Layer Normalization (RMSNorm) · Zhang & Sennrich

LayerNorm sin la media. Más barato y funciona igual. Otro estándar silencioso.

📄 Paper Avanzado 2019 Arquitecturas
T5: Exploring the Limits of Transfer Learning · Raffel et al. (Google)

'Todo es texto-a-texto'. Además, el estudio ablativo más sistemático que se hizo sobre decisiones de arquitectura.

📄 Paper Intermedio 2019 Arquitecturas
The Annotated S4 / Mamba · Sasha Rush y otros

Modelos de espacio de estados implementados y anotados paso a paso.

✍️ Blog/Post Avanzado 2024 Arquitecturas
The Transformer Family v2.0 · Lilian Weng

Taxonomía completa de variantes: contexto largo, atención eficiente, recurrencia, memoria externa. Mapa mental del ecosistema.

✍️ Blog/Post Intermedio 2023 Arquitecturas
Titans: Learning to Memorize at Test Time · Behrouz et al. (Google)

Memoria neuronal a largo plazo que se actualiza durante la inferencia. Empuja hacia el aprendizaje continuo.

📄 Paper Avanzado 2025 Arquitecturas
Transformers are SSMs (Mamba-2) · Dao & Gu

Unifica atención y modelos de espacio de estados bajo un mismo marco teórico. Uno de los papers conceptualmente más importantes de los últimos años.

📄 Paper Avanzado 2024 Arquitecturas
Transformers from Scratch · Brandon Rohrer

Desde matrices one-hot hasta attention completa, sin saltos. Larguísimo y excelente.

✍️ Blog/Post Intermedio 2023 Arquitecturas

Preguntas frecuentes sobre arquitecturas

¿Qué arquitectura usan los modelos de IA actuales?

Casi todos los modelos de lenguaje frontera son transformers de tipo decoder, con mezcla de expertos para activar solo una fracción de los parámetros por token, embeddings posicionales rotatorios y atención agrupada. Los modelos de imagen y video usan mayoritariamente difusión, cada vez más sobre un backbone transformer.

¿Va a reemplazar algo al transformer?

Es una de las discusiones abiertas del campo. La inercia de hardware y software es enorme y el transformer se sigue modificando por dentro sin cambiar de nombre. Las apuestas más serias hoy son los híbridos con capas de espacio de estados y los modelos sin tokenizador.