Post-training, RLHF y modelos de razonamiento
Un modelo pre-entrenado no es un asistente: es un autocompletador de internet. Todo lo que lo vuelve útil ocurre en esta etapa. Ajuste supervisado sobre ejemplos de conversación, modelos de recompensa que capturan preferencias humanas, y después optimización contra esa señal.
Desde 2025 esta fase concentra la mayor parte de las ganancias visibles. El aprendizaje por refuerzo con recompensas verificables —matemática, código, tareas donde la respuesta se puede chequear automáticamente— produjo los modelos de razonamiento, y DeepSeek-R1 hizo público que se podía a un costo mucho menor del que se creía necesario.
Sigue abierta una discusión de fondo que conviene tener presente al leer: si el RL enseña capacidades nuevas o simplemente amplifica lo que el modelo base ya podía hacer con suficiente muestreo. Hay evidencia y gente seria de los dos lados.
19 recursos de post-training, RLHF y razonamiento
Ordenados con los imprescindibles primero y agrupados por tipo. Los marcados con ★ son los que recomendaría alguien que ya recorrió el camino; los que dicen «gratis» no cuestan nada.
🎓 Curso
El curso de posgrado de referencia en deep RL. Clases completas en YouTube.
RL práctico con entornos reales y modelos que subís al Hub. La entrada más amable al tema.
📚 Libro
Libro abierto y en evolución sobre RLHF: modelos de recompensa, PPO/GRPO, evaluación, fallos conocidos. No hay nada equivalente.
La biblia del RL. PDF gratis. Si vas a hacer post-training en serio, los capítulos 3-6 y 13 son obligatorios.
📄 Paper
'Pensemos paso a paso'. La observación más simple y más rentable de la historia reciente de los LLMs.
Group Relative Policy Optimization: elimina la red de valor de PPO. Es el algoritmo que entrena la mayoría de los modelos de razonamiento actuales.
Alineamiento por preferencias sin modelo de recompensa ni RL. Simple, estable y hoy el punto de partida por defecto.
El paper que formalizó el segundo eje de escalado: pensar más en inferencia puede valer más que un modelo más grande.
El paper que convirtió un modelo de texto en un asistente. SFT + modelo de recompensa + PPO. Es la receta que dio origen a ChatGPT.
RLAIF: reemplazar parte del feedback humano por principios explícitos + crítica del propio modelo.
Recompensar cada paso del razonamiento, no solo el resultado. Antecedente directo de los modelos tipo o1/o3.
El algoritmo de RL sobre el que se construyó todo el RLHF. Vale entenderlo aunque hoy uses GRPO o DPO.
Bootstrap del razonamiento: el modelo genera cadenas, filtrás las correctas, reentrenás. Base de casi todo el auto-mejoramiento actual.
Muestrear varias cadenas y votar por mayoría. La técnica de inferencia con mejor relación esfuerzo/beneficio.
Búsqueda deliberada sobre estados de razonamiento en lugar de una sola cadena lineal.
✍️ Blog/Post
🐙 Repo
SFT, DPO, GRPO, PPO, reward modeling con una API consistente. La forma más rápida de hacer post-training real.
Reproducción abierta y documentada del pipeline de DeepSeek-R1. La mejor forma de aprender RLVR leyendo código.
Frameworks de RL a escala para LLMs, pensados para clusters. Lo que se usa cuando TRL se queda corto.
Preguntas frecuentes sobre post-training, RLHF y razonamiento
¿Qué es RLHF?
Aprendizaje por refuerzo a partir de retroalimentación humana. Se recolectan comparaciones entre respuestas, se entrena un modelo de recompensa que predice qué preferiría una persona, y luego se optimiza el modelo de lenguaje contra esa recompensa. Es lo que convirtió a los modelos base en asistentes conversacionales.
¿Cuál es la diferencia entre DPO y RLHF clásico?
DPO optimiza directamente sobre pares de preferencias, sin entrenar un modelo de recompensa separado ni correr un algoritmo de refuerzo completo. Es mucho más simple y barato de implementar, y por eso se volvió el punto de partida habitual fuera de los laboratorios grandes.
¿Cómo aprenden a razonar los modelos?
Con aprendizaje por refuerzo sobre tareas de respuesta verificable: el modelo genera cadenas de razonamiento largas, se comprueba automáticamente si el resultado final es correcto y se refuerzan las trayectorias que funcionaron. El razonamiento emerge de ese proceso más que de ejemplos etiquetados a mano.