Alineamiento y seguridad de la inteligencia artificial

Esta sección incluye deliberadamente autores que están en desacuerdo entre sí. La discusión sobre riesgos de la IA está poblada de gente inteligente con posiciones incompatibles, y leer solo un lado —el que más te resuene— es la forma más rápida de terminar con una opinión firme y mal informada.

Va desde problemas técnicos concretos y verificables hoy —reward hacking, jailbreaks, supervisión escalable de sistemas que superan al evaluador humano— hasta gobernanza, políticas de escalado responsable y regulación. Los dos planos importan y suelen discutirse por separado cuando en realidad se condicionan.

13 recursos de alineamiento y seguridad

Ordenados con los imprescindibles primero y agrupados por tipo. Los marcados con ★ son los que recomendaría alguien que ya recorrió el camino; los que dicen «gratis» no cuestan nada.

🎓 Curso

📄 Paper

Alignment Faking in Large Language Models ★ · Anthropic & Redwood Research

Un modelo que finge estar alineado durante el entrenamiento para preservar sus preferencias. Evidencia empírica de un riesgo que era teórico.

📄 Paper Avanzado 2024 Alineamiento y seguridad
Concrete Problems in AI Safety ★ · Amodei, Olah et al.

El paper que convirtió la seguridad de IA en agenda técnica: efectos colaterales, reward hacking, supervisión escalable, exploración segura.

📄 Paper Intermedio 2016 Alineamiento y seguridad
Sleeper Agents: Training Deceptive LLMs that Persist Through Safety Training ★ · Anthropic

Puertas traseras que sobreviven al SFT, RLHF y al entrenamiento adversarial. Resultado incómodo y muy importante.

📄 Paper Avanzado 2024 Alineamiento y seguridad
International AI Safety Report · Yoshua Bengio y 100+ expertos

El informe de consenso científico internacional sobre capacidades y riesgos, respaldado por 30+ países. La síntesis más equilibrada disponible.

📄 Paper Intermedio 2025 Alineamiento y seguridad
On the Dangers of Stochastic Parrots · Bender, Gebru, McMillan-Major, Mitchell

La crítica más influyente desde el otro lado del debate: costos ambientales, sesgo, opacidad de datos. Leelo aunque no coincidas.

📄 Paper Intermedio 2021 Alineamiento y seguridad
Red Teaming Language Models to Reduce Harms · Anthropic

Metodología de red-teaming con datos publicados. Base práctica para evaluar riesgos de un modelo.

📄 Paper Intermedio 2022 Alineamiento y seguridad
Universal and Transferable Adversarial Attacks on Aligned LMs · Zou et al. (CMU)

Sufijos adversariales que rompen el alineamiento y transfieren entre modelos. Lectura obligada antes de confiar en filtros de seguridad.

📄 Paper Intermedio 2023 Alineamiento y seguridad
Unsolved Problems in ML Safety · Hendrycks et al.

Robustez, monitoreo, alineamiento y riesgo sistémico como cuatro problemas separados. Buen marco mental.

📄 Paper Intermedio 2021 Alineamiento y seguridad
Weak-to-Strong Generalization · OpenAI (Superalignment)

¿Puede un supervisor débil alinear a un modelo más capaz que él? La pregunta central de la supervisión escalable.

📄 Paper Avanzado 2023 Alineamiento y seguridad

✍️ Blog/Post

📘 Docs

Preguntas frecuentes sobre alineamiento y seguridad

¿Qué es el alineamiento de la IA?

El problema de lograr que un sistema haga lo que sus operadores pretenden, incluyendo situaciones que nadie especificó de antemano. No es solo filtrar respuestas dañinas: es que los objetivos que el sistema optimiza efectivamente coincidan con los objetivos que quisimos darle.

¿Qué es el reward hacking?

Que un modelo encuentre una forma de maximizar la métrica de recompensa sin cumplir el objetivo real que esa métrica intentaba capturar. Es el ejemplo más concreto y verificable hoy de por qué especificar objetivos es difícil, y aparece constantemente en entrenamiento con refuerzo.