Post-training, RLHF y modelos de razonamiento

Un modelo pre-entrenado no es un asistente: es un autocompletador de internet. Todo lo que lo vuelve útil ocurre en esta etapa. Ajuste supervisado sobre ejemplos de conversación, modelos de recompensa que capturan preferencias humanas, y después optimización contra esa señal.

Desde 2025 esta fase concentra la mayor parte de las ganancias visibles. El aprendizaje por refuerzo con recompensas verificables —matemática, código, tareas donde la respuesta se puede chequear automáticamente— produjo los modelos de razonamiento, y DeepSeek-R1 hizo público que se podía a un costo mucho menor del que se creía necesario.

Sigue abierta una discusión de fondo que conviene tener presente al leer: si el RL enseña capacidades nuevas o simplemente amplifica lo que el modelo base ya podía hacer con suficiente muestreo. Hay evidencia y gente seria de los dos lados.

19 recursos de post-training, RLHF y razonamiento

Ordenados con los imprescindibles primero y agrupados por tipo. Los marcados con ★ son los que recomendaría alguien que ya recorrió el camino; los que dicen «gratis» no cuestan nada.

🎓 Curso

📚 Libro

📄 Paper

Chain-of-Thought Prompting Elicits Reasoning in LLMs ★ · Wei et al. (Google)

'Pensemos paso a paso'. La observación más simple y más rentable de la historia reciente de los LLMs.

📄 Paper Intermedio 2022 Post-training, RLHF y razonamiento
DeepSeekMath: GRPO ★ · DeepSeek AI

Group Relative Policy Optimization: elimina la red de valor de PPO. Es el algoritmo que entrena la mayoría de los modelos de razonamiento actuales.

📄 Paper Avanzado 2024 Post-training, RLHF y razonamiento
Direct Preference Optimization (DPO) ★ · Rafailov et al. (Stanford)

Alineamiento por preferencias sin modelo de recompensa ni RL. Simple, estable y hoy el punto de partida por defecto.

📄 Paper Intermedio 2023 Post-training, RLHF y razonamiento
Scaling LLM Test-Time Compute Optimally ★ · Snell et al. (DeepMind/Berkeley)

El paper que formalizó el segundo eje de escalado: pensar más en inferencia puede valer más que un modelo más grande.

📄 Paper Avanzado 2024 Post-training, RLHF y razonamiento
Training language models to follow instructions with human feedback (InstructGPT) ★ · Ouyang et al. (OpenAI)

El paper que convirtió un modelo de texto en un asistente. SFT + modelo de recompensa + PPO. Es la receta que dio origen a ChatGPT.

📄 Paper Intermedio 2022 Post-training, RLHF y razonamiento
Constitutional AI: Harmlessness from AI Feedback · Anthropic

RLAIF: reemplazar parte del feedback humano por principios explícitos + crítica del propio modelo.

📄 Paper Intermedio 2022 Post-training, RLHF y razonamiento
Let's Verify Step by Step (process supervision) · Lightman et al. (OpenAI)

Recompensar cada paso del razonamiento, no solo el resultado. Antecedente directo de los modelos tipo o1/o3.

📄 Paper Intermedio 2023 Post-training, RLHF y razonamiento
Proximal Policy Optimization (PPO) · Schulman et al. (OpenAI)

El algoritmo de RL sobre el que se construyó todo el RLHF. Vale entenderlo aunque hoy uses GRPO o DPO.

📄 Paper Intermedio 2017 Post-training, RLHF y razonamiento
STaR: Self-Taught Reasoner · Zelikman et al. (Stanford)

Bootstrap del razonamiento: el modelo genera cadenas, filtrás las correctas, reentrenás. Base de casi todo el auto-mejoramiento actual.

📄 Paper Avanzado 2022 Post-training, RLHF y razonamiento
Self-Consistency Improves Chain of Thought Reasoning · Wang et al. (Google)

Muestrear varias cadenas y votar por mayoría. La técnica de inferencia con mejor relación esfuerzo/beneficio.

📄 Paper Intermedio 2022 Post-training, RLHF y razonamiento
Tree of Thoughts · Yao et al. (Princeton/DeepMind)

Búsqueda deliberada sobre estados de razonamiento en lugar de una sola cadena lineal.

📄 Paper Avanzado 2023 Post-training, RLHF y razonamiento

✍️ Blog/Post

🐙 Repo

Preguntas frecuentes sobre post-training, RLHF y razonamiento

¿Qué es RLHF?

Aprendizaje por refuerzo a partir de retroalimentación humana. Se recolectan comparaciones entre respuestas, se entrena un modelo de recompensa que predice qué preferiría una persona, y luego se optimiza el modelo de lenguaje contra esa recompensa. Es lo que convirtió a los modelos base en asistentes conversacionales.

¿Cuál es la diferencia entre DPO y RLHF clásico?

DPO optimiza directamente sobre pares de preferencias, sin entrenar un modelo de recompensa separado ni correr un algoritmo de refuerzo completo. Es mucho más simple y barato de implementar, y por eso se volvió el punto de partida habitual fuera de los laboratorios grandes.

¿Cómo aprenden a razonar los modelos?

Con aprendizaje por refuerzo sobre tareas de respuesta verificable: el modelo genera cadenas de razonamiento largas, se comprueba automáticamente si el resultado final es correcto y se refuerzan las trayectorias que funcionaron. El razonamiento emerge de ese proceso más que de ejemplos etiquetados a mano.