Inferencia y optimización de modelos
Entrenar se hace una vez; servir se hace millones de veces. Por eso el costo real de un producto con IA se define en esta etapa, y por eso es una de las áreas con mayor demanda laboral concreta y menos material didáctico decente.
El concepto que reordena todo lo demás: en inferencia autorregresiva el cuello de botella casi nunca es el cómputo, es el ancho de banda de memoria. Entender eso explica de golpe por qué existen el KV cache, la cuantización, el batching continuo y la decodificación especulativa. No son trucos sueltos: son respuestas al mismo problema.
14 recursos de inferencia y optimización
Ordenados con los imprescindibles primero y agrupados por tipo. Los marcados con ★ son los que recomendaría alguien que ya recorrió el camino; los que dicen «gratis» no cuestan nada.
🎓 Curso
📄 Paper
Memoria virtual paginada aplicada al KV cache. Multiplicó por 24 el throughput de servir modelos y se volvió el estándar.
No aproxima nada: solo reordena el cómputo para respetar la jerarquía de memoria de la GPU. La optimización más importante de la década. Ver también FlashAttention-2 (2307.08691) y -3 (2407.08608).
Un modelo chico propone tokens, el grande los verifica en paralelo. 2-3× de aceleración sin perder calidad.
Cuantización a 3-4 bits en una pasada. Junto a AWQ (2306.00978), la base de todos los modelos cuantizados que descargás.
Por qué la cuantización ingenua falla en modelos grandes y cómo se resuelve. Fundamento de bitsandbytes.
✍️ Blog/Post
🐙 Repo
Inferencia en C/C++ que corre en cualquier cosa: CPU, Mac, Raspberry Pi. Creó el formato GGUF y todo el ecosistema local.
El motor de inferencia de referencia: continuous batching, prefix caching, tensor parallel, API compatible con OpenAI.
Framework para Apple Silicon con memoria unificada. Si tenés una Mac con M-series, esto cambia lo que podés correr localmente.
RadixAttention para reutilizar prefijos + un lenguaje de programación de prompts. Muy fuerte en cargas agénticas y estructuradas.
Las otras dos pilas de serving de producción. TensorRT-LLM exprime al máximo el hardware NVIDIA.
🛠️ Herramienta
Preguntas frecuentes sobre inferencia y optimización
¿Qué es la cuantización de un modelo?
Es representar los pesos con menos bits —de 16 a 8 o 4— para que el modelo ocupe menos memoria y se lea más rápido. La pérdida de calidad, con métodos modernos, suele ser mucho menor de lo que sugiere la reducción de tamaño, y es lo que permite correr modelos grandes en hardware de consumo.
¿Qué es el KV cache?
Al generar texto token por token, el modelo recalcularía la atención sobre todo lo anterior en cada paso. El KV cache guarda las claves y valores ya calculados para no repetir ese trabajo. Es lo que hace viable la generación, y también lo que consume la mayor parte de la memoria en contextos largos.
¿Cómo corro un modelo de IA en mi computadora?
Con Ollama o llama.cpp para uso local simple, o con vLLM si necesitás servir a varios usuarios con buen rendimiento. Un modelo cuantizado de 7 a 8 mil millones de parámetros corre bien en una máquina con 16 GB de memoria, incluso sin GPU dedicada aunque más lento.