Arquitecturas de modelos de IA
El transformer domina, pero no es el final de la historia y conviene no estudiarlo como si lo fuera. Esta sección arma el mapa: las piezas que casi todos los modelos actuales comparten (RoPE, RMSNorm, SwiGLU, atención agrupada), las apuestas de eficiencia (mezcla de expertos, profundidad variable) y las alternativas que dejaron de ser curiosidades académicas.
Los modelos de espacio de estados aparecen hoy como capas intercaladas dentro de modelos de producción, no como reemplazos completos. Es el patrón típico del campo: las ideas nuevas entran como híbridos antes de ganar o desaparecer. Entender esa dinámica vale más que memorizar el diagrama de cada variante.
27 recursos de arquitecturas
Ordenados con los imprescindibles primero y agrupados por tipo. Los marcados con ★ son los que recomendaría alguien que ya recorrió el camino; los que dicen «gratis» no cuestan nada.
El paper que define la era actual. Todo LLM de hoy es una variación de estas 15 páginas. Leelo al menos tres veces en tu vida.
La alternativa más seria a la atención cuadrática. Modelos de espacio de estados con selectividad, complejidad lineal en la longitud.
MoE: activar solo una fracción de los parámetros por token. Base de casi todos los modelos frontera actuales.
El paper original línea por línea, con el código PyTorch al lado de cada párrafo.
La explicación visual definitiva de self-attention, multi-head y encoder-decoder. Leelo antes del paper original.
GNNs explicadas interactivamente. Relevantes para química, biología, grafos de conocimiento y sistemas de recomendación.
Sesgos lineales en atención que permiten extrapolar a secuencias más largas que las de entrenamiento.
Los transformers se comen la visión por computadora. El puente hacia los modelos multimodales.
El espacio latente. Sin VAEs no hay Stable Diffusion (que difunde en latente, no en píxeles).
La rama encoder-only. Sigue siendo el caballo de batalla de clasificación, embeddings y búsqueda.
Elimina el tokenizador y agrupa bytes dinámicamente según entropía. Una de las líneas más prometedoras para superar las limitaciones de la tokenización.
Paper de dos páginas cuya conclusión honesta es 'no sabemos por qué funciona'. Está en casi todos los LLMs actuales.
El compromiso entre multi-head y multi-query que usan Llama, Mistral y casi todos. Reduce el KV cache drásticamente.
La era pre-difusión de la generación de imágenes. Históricamente clave y aún útil conceptualmente.
Los híbridos (capas de atención + capas SSM) son hoy la apuesta más probable para contexto largo. Ver también Griffin (arXiv:2402.19427).
Predecir conceptos (oraciones en espacio de embeddings) en lugar de tokens. Apuesta de Meta contra el paradigma token-por-token.
El paper que hizo el MoE disperso accesible en abierto. Lectura obligada para entender MoE en la práctica.
No todos los tokens necesitan todas las capas. Cómputo adaptativo dentro del forward pass.
RNN entrenable en paralelo, inferencia con memoria constante. Comunidad abierta muy activa.
Cómo casi todos los LLMs modernos codifican posición. Entender RoPE es entender por qué se puede extender el contexto.
LayerNorm sin la media. Más barato y funciona igual. Otro estándar silencioso.
'Todo es texto-a-texto'. Además, el estudio ablativo más sistemático que se hizo sobre decisiones de arquitectura.
Modelos de espacio de estados implementados y anotados paso a paso.
Taxonomía completa de variantes: contexto largo, atención eficiente, recurrencia, memoria externa. Mapa mental del ecosistema.
Memoria neuronal a largo plazo que se actualiza durante la inferencia. Empuja hacia el aprendizaje continuo.
Unifica atención y modelos de espacio de estados bajo un mismo marco teórico. Uno de los papers conceptualmente más importantes de los últimos años.
Desde matrices one-hot hasta attention completa, sin saltos. Larguísimo y excelente.
Preguntas frecuentes sobre arquitecturas
¿Qué arquitectura usan los modelos de IA actuales?
Casi todos los modelos de lenguaje frontera son transformers de tipo decoder, con mezcla de expertos para activar solo una fracción de los parámetros por token, embeddings posicionales rotatorios y atención agrupada. Los modelos de imagen y video usan mayoritariamente difusión, cada vez más sobre un backbone transformer.
¿Va a reemplazar algo al transformer?
Es una de las discusiones abiertas del campo. La inercia de hardware y software es enorme y el transformer se sigue modificando por dentro sin cambiar de nombre. Las apuestas más serias hoy son los híbridos con capas de espacio de estados y los modelos sin tokenizador.