Fine-tuning práctico: LoRA, QLoRA y cuándo no hacerlo

El fine-tuning es la puerta de entrada más accesible al entrenamiento: con LoRA o QLoRA se puede adaptar un modelo de varios miles de millones de parámetros en una sola GPU de consumo, entrenando una fracción mínima de los pesos.

La advertencia que repite todo el mundo que lo hace a diario merece estar arriba y no al final: la mayoría de los problemas que se intentan resolver con fine-tuning se resuelven mejor con mejores prompts, con recuperación de contexto o —sobre todo— con evaluaciones decentes que muestren cuál es el problema real. El fine-tuning sirve para enseñar formato, estilo o un dominio muy específico; no para agregar conocimiento factual, que es el uso equivocado más frecuente.

12 recursos de fine-tuning práctico

Ordenados con los imprescindibles primero y agrupados por tipo. Los marcados con ★ son los que recomendaría alguien que ya recorrió el camino; los que dicen «gratis» no cuestan nada.

📄 Paper

✍️ Blog/Post

🐙 Repo

📘 Docs

Preguntas frecuentes sobre fine-tuning práctico

¿Qué es LoRA?

Es una técnica de adaptación de bajo rango: en vez de modificar todos los pesos del modelo, se entrenan matrices chicas que se suman a las capas existentes. Reduce la memoria necesaria en órdenes de magnitud y permite guardar y combinar adaptadores de pocos megabytes.

¿Cuándo conviene hacer fine-tuning y cuándo no?

Conviene cuando necesitás un formato de salida consistente, un estilo particular o un dominio muy cerrado, y tenés evaluaciones que demuestran que el prompting no alcanza. No conviene para incorporar conocimiento factual actualizable: para eso está la recuperación de contexto (RAG), que además se puede corregir sin reentrenar.

¿Qué GPU necesito para hacer fine-tuning?

Con QLoRA, una GPU de 16 GB alcanza para modelos de 7 a 8 mil millones de parámetros, y hay quien lo hace en el nivel gratuito de Colab con modelos más chicos. Sin cuantización los requisitos suben rápido.