Fine-tuning práctico: LoRA, QLoRA y cuándo no hacerlo
El fine-tuning es la puerta de entrada más accesible al entrenamiento: con LoRA o QLoRA se puede adaptar un modelo de varios miles de millones de parámetros en una sola GPU de consumo, entrenando una fracción mínima de los pesos.
La advertencia que repite todo el mundo que lo hace a diario merece estar arriba y no al final: la mayoría de los problemas que se intentan resolver con fine-tuning se resuelven mejor con mejores prompts, con recuperación de contexto o —sobre todo— con evaluaciones decentes que muestren cuál es el problema real. El fine-tuning sirve para enseñar formato, estilo o un dominio muy específico; no para agregar conocimiento factual, que es el uso equivocado más frecuente.
12 recursos de fine-tuning práctico
Ordenados con los imprescindibles primero y agrupados por tipo. Los marcados con ★ son los que recomendaría alguien que ya recorrió el camino; los que dicen «gratis» no cuestan nada.
📄 Paper
Entrenar matrices de rango bajo en vez del modelo entero. Es la razón por la que podés hacer fine-tuning en una sola GPU.
LoRA sobre un modelo base en 4 bits. Democratizó el fine-tuning de modelos de 65B en hardware de consumo.
La destilación es hoy la técnica más rentable de la industria: modelos chicos que imitan a los grandes.
Descompone magnitud y dirección. Suele superar a LoRA con el mismo presupuesto de parámetros.
✍️ Blog/Post
Hamel es la voz más sensata sobre cuándo NO hacer fine-tuning y por qué las evaluaciones importan más que el entrenamiento.
Experimentos reales sobre rank, alpha, qué capas tocar y cuándo LoRA empata con full fine-tuning.
🐙 Repo
LoRA, DoRA, IA³, prompt tuning y compañía en una línea de código. El punto de entrada estándar.
2-5× más rápido y con mucha menos memoria mediante kernels Triton propios. Sus notebooks gratuitos en Colab son el camino más corto para tu primer fine-tune.
Fine-tuning declarativo por YAML: cambiás config, no código. El favorito de la comunidad open-weights.
100+ modelos soportados, con interfaz web. Muy usado para experimentar rápido sin escribir código.
Recetas de fine-tuning nativas de PyTorch, sin abstracciones pesadas. Ideal si querés leer y modificar el código.
📘 Docs
Preguntas frecuentes sobre fine-tuning práctico
¿Qué es LoRA?
Es una técnica de adaptación de bajo rango: en vez de modificar todos los pesos del modelo, se entrenan matrices chicas que se suman a las capas existentes. Reduce la memoria necesaria en órdenes de magnitud y permite guardar y combinar adaptadores de pocos megabytes.
¿Cuándo conviene hacer fine-tuning y cuándo no?
Conviene cuando necesitás un formato de salida consistente, un estilo particular o un dominio muy cerrado, y tenés evaluaciones que demuestran que el prompting no alcanza. No conviene para incorporar conocimiento factual actualizable: para eso está la recuperación de contexto (RAG), que además se puede corregir sin reentrenar.
¿Qué GPU necesito para hacer fine-tuning?
Con QLoRA, una GPU de 16 GB alcanza para modelos de 7 a 8 mil millones de parámetros, y hay quien lo hace en el nivel gratuito de Colab con modelos más chicos. Sin cuantización los requisitos suben rápido.