Inferencia y optimización de modelos

Entrenar se hace una vez; servir se hace millones de veces. Por eso el costo real de un producto con IA se define en esta etapa, y por eso es una de las áreas con mayor demanda laboral concreta y menos material didáctico decente.

El concepto que reordena todo lo demás: en inferencia autorregresiva el cuello de botella casi nunca es el cómputo, es el ancho de banda de memoria. Entender eso explica de golpe por qué existen el KV cache, la cuantización, el batching continuo y la decodificación especulativa. No son trucos sueltos: son respuestas al mismo problema.

14 recursos de inferencia y optimización

Ordenados con los imprescindibles primero y agrupados por tipo. Los marcados con ★ son los que recomendaría alguien que ya recorrió el camino; los que dicen «gratis» no cuestan nada.

🎓 Curso

📄 Paper

✍️ Blog/Post

🐙 Repo

🛠️ Herramienta

Preguntas frecuentes sobre inferencia y optimización

¿Qué es la cuantización de un modelo?

Es representar los pesos con menos bits —de 16 a 8 o 4— para que el modelo ocupe menos memoria y se lea más rápido. La pérdida de calidad, con métodos modernos, suele ser mucho menor de lo que sugiere la reducción de tamaño, y es lo que permite correr modelos grandes en hardware de consumo.

¿Qué es el KV cache?

Al generar texto token por token, el modelo recalcularía la atención sobre todo lo anterior en cada paso. El KV cache guarda las claves y valores ya calculados para no repetir ese trabajo. Es lo que hace viable la generación, y también lo que consume la mayor parte de la memoria en contextos largos.

¿Cómo corro un modelo de IA en mi computadora?

Con Ollama o llama.cpp para uso local simple, o con vLLM si necesitás servir a varios usuarios con buen rendimiento. Un modelo cuantizado de 7 a 8 mil millones de parámetros corre bien en una máquina con 16 GB de memoria, incluso sin GPU dedicada aunque más lento.