IA multimodal y modelos generativos
Durante años lo multimodal fue un anexo del texto. Dejó de serlo: los modelos frontera hoy nacen entrenados sobre texto, imagen y audio a la vez, y la generación de imagen y video pasó de curiosidad a industria en cinco años.
El concepto central de esta sección es la difusión: en vez de generar de una vez, se parte de ruido puro y se lo va limpiando paso a paso, guiado por una condición. Es un cambio de paradigma respecto de los modelos autorregresivos, y entenderlo abre la puerta a imagen, audio, video y buena parte de lo que se investiga en modelos del mundo.
17 recursos de IA multimodal y modelos generativos
Ordenados con los imprescindibles primero y agrupados por tipo. Los marcados con ★ son los que recomendaría alguien que ya recorrió el camino; los que dicen «gratis» no cuestan nada.
🎓 Curso
Transformers aplicados a audio: clasificación, ASR, síntesis de voz.
Curso práctico con la librería `diffusers`: entrenar desde cero, fine-tuning, guidance, ControlNet.
El curso de visión por computadora de referencia. Las notas públicas son un libro de texto en sí mismas.
📄 Paper
Alinear imágenes y texto en un mismo espacio de embeddings. Es el ladrillo sobre el que se apoya casi todo lo multimodal.
El paper que hizo funcionar la difusión. Agregar ruido y aprender a quitarlo: la idea que reemplazó a las GANs.
Difusión en espacio latente en vez de píxeles: es Stable Diffusion. Hizo la generación de imágenes accesible a cualquiera.
El truco que hace que los modelos de imagen obedezcan al prompt. El parámetro `guidance_scale` sale de acá.
Cómo intercalar imágenes y texto con cross-attention. Diseño arquitectónico influyente.
La formulación que reemplazó a la difusión clásica en los modelos de imagen y video más recientes. Más simple y más rápida.
Mundos jugables generados a partir de video sin etiquetas de acción. Una de las líneas más ambiciosas hacia agentes encarnados.
El modelo que resolvió el reconocimiento de voz en abierto, incluido el español. Pesos libres.
Modelo fundacional de segmentación. Ejemplo modelo de cómo diseñar una tarea + motor de datos + modelo a la vez.
El reporte técnico que instaló la idea de 'modelos del mundo' como camino hacia el razonamiento físico.
La receta abierta para convertir un LLM en un modelo de visión: encoder + proyector + instrucciones. Base de casi todo VLM abierto.
✍️ Blog/Post
La derivación matemática más clara que hay en abierto sobre difusión. Denso pero completo.
La apuesta contrapuesta a los LLMs: predecir en espacio de representaciones, no tokens. Base de I-JEPA y V-JEPA.
La versión visual e intuitiva del anterior. Leelo primero.
Preguntas frecuentes sobre multimodal y generativos
¿Cómo funcionan los modelos que generan imágenes?
La mayoría usa difusión: se entrena una red para quitar ruido de una imagen paso a paso. Al generar, se parte de ruido puro y se aplica ese proceso muchas veces, condicionado por el texto del prompt, hasta obtener una imagen coherente con la descripción.
¿Qué significa que un modelo sea multimodal?
Que procesa más de un tipo de dato en el mismo espacio de representación: texto e imagen, o texto, imagen y audio. En la práctica significa que puede razonar sobre una foto, escuchar y responder, o generar en una modalidad a partir de otra.