IA multimodal y modelos generativos

Durante años lo multimodal fue un anexo del texto. Dejó de serlo: los modelos frontera hoy nacen entrenados sobre texto, imagen y audio a la vez, y la generación de imagen y video pasó de curiosidad a industria en cinco años.

El concepto central de esta sección es la difusión: en vez de generar de una vez, se parte de ruido puro y se lo va limpiando paso a paso, guiado por una condición. Es un cambio de paradigma respecto de los modelos autorregresivos, y entenderlo abre la puerta a imagen, audio, video y buena parte de lo que se investiga en modelos del mundo.

17 recursos de IA multimodal y modelos generativos

Ordenados con los imprescindibles primero y agrupados por tipo. Los marcados con ★ son los que recomendaría alguien que ya recorrió el camino; los que dicen «gratis» no cuestan nada.

🎓 Curso

📄 Paper

CLIP: Learning Transferable Visual Models From Natural Language Supervision ★ · Radford et al. (OpenAI)

Alinear imágenes y texto en un mismo espacio de embeddings. Es el ladrillo sobre el que se apoya casi todo lo multimodal.

📄 Paper Intermedio 2021 Multimodal y generativos
Denoising Diffusion Probabilistic Models (DDPM) ★ · Ho, Jain, Abbeel

El paper que hizo funcionar la difusión. Agregar ruido y aprender a quitarlo: la idea que reemplazó a las GANs.

📄 Paper Intermedio 2020 Multimodal y generativos
High-Resolution Image Synthesis with Latent Diffusion Models ★ · Rombach et al.

Difusión en espacio latente en vez de píxeles: es Stable Diffusion. Hizo la generación de imágenes accesible a cualquiera.

📄 Paper Intermedio 2021 Multimodal y generativos
Classifier-Free Diffusion Guidance · Ho & Salimans

El truco que hace que los modelos de imagen obedezcan al prompt. El parámetro `guidance_scale` sale de acá.

📄 Paper Avanzado 2022 Multimodal y generativos
Flamingo: a Visual Language Model for Few-Shot Learning · DeepMind

Cómo intercalar imágenes y texto con cross-attention. Diseño arquitectónico influyente.

📄 Paper Intermedio 2022 Multimodal y generativos
Flow Matching for Generative Modeling · Lipman et al. (Meta)

La formulación que reemplazó a la difusión clásica en los modelos de imagen y video más recientes. Más simple y más rápida.

📄 Paper Avanzado 2022 Multimodal y generativos
Genie: Generative Interactive Environments · DeepMind

Mundos jugables generados a partir de video sin etiquetas de acción. Una de las líneas más ambiciosas hacia agentes encarnados.

📄 Paper Avanzado 2024 Multimodal y generativos
Robust Speech Recognition via Large-Scale Weak Supervision (Whisper) · OpenAI

El modelo que resolvió el reconocimiento de voz en abierto, incluido el español. Pesos libres.

📄 Paper Intermedio 2022 Multimodal y generativos
Segment Anything (SAM) · Meta AI

Modelo fundacional de segmentación. Ejemplo modelo de cómo diseñar una tarea + motor de datos + modelo a la vez.

📄 Paper Avanzado 2023 Multimodal y generativos
Video generation models as world simulators (Sora) · OpenAI

El reporte técnico que instaló la idea de 'modelos del mundo' como camino hacia el razonamiento físico.

📄 Paper Avanzado 2024 Multimodal y generativos
Visual Instruction Tuning (LLaVA) · Liu et al.

La receta abierta para convertir un LLM en un modelo de visión: encoder + proyector + instrucciones. Base de casi todo VLM abierto.

📄 Paper Intermedio 2023 Multimodal y generativos

✍️ Blog/Post

Preguntas frecuentes sobre multimodal y generativos

¿Cómo funcionan los modelos que generan imágenes?

La mayoría usa difusión: se entrena una red para quitar ruido de una imagen paso a paso. Al generar, se parte de ruido puro y se aplica ese proceso muchas veces, condicionado por el texto del prompt, hasta obtener una imagen coherente con la descripción.

¿Qué significa que un modelo sea multimodal?

Que procesa más de un tipo de dato en el mismo espacio de representación: texto e imagen, o texto, imagen y audio. En la práctica significa que puede razonar sobre una foto, escuchar y responder, o generar en una modalidad a partir de otra.