Alineamiento y seguridad de la inteligencia artificial
Esta sección incluye deliberadamente autores que están en desacuerdo entre sí. La discusión sobre riesgos de la IA está poblada de gente inteligente con posiciones incompatibles, y leer solo un lado —el que más te resuene— es la forma más rápida de terminar con una opinión firme y mal informada.
Va desde problemas técnicos concretos y verificables hoy —reward hacking, jailbreaks, supervisión escalable de sistemas que superan al evaluador humano— hasta gobernanza, políticas de escalado responsable y regulación. Los dos planos importan y suelen discutirse por separado cuando en realidad se condicionan.
13 recursos de alineamiento y seguridad
Ordenados con los imprescindibles primero y agrupados por tipo. Los marcados con ★ son los que recomendaría alguien que ya recorrió el camino; los que dicen «gratis» no cuestan nada.
🎓 Curso
📄 Paper
Un modelo que finge estar alineado durante el entrenamiento para preservar sus preferencias. Evidencia empírica de un riesgo que era teórico.
El paper que convirtió la seguridad de IA en agenda técnica: efectos colaterales, reward hacking, supervisión escalable, exploración segura.
Puertas traseras que sobreviven al SFT, RLHF y al entrenamiento adversarial. Resultado incómodo y muy importante.
El informe de consenso científico internacional sobre capacidades y riesgos, respaldado por 30+ países. La síntesis más equilibrada disponible.
La crítica más influyente desde el otro lado del debate: costos ambientales, sesgo, opacidad de datos. Leelo aunque no coincidas.
Metodología de red-teaming con datos publicados. Base práctica para evaluar riesgos de un modelo.
Sufijos adversariales que rompen el alineamiento y transfieren entre modelos. Lectura obligada antes de confiar en filtros de seguridad.
Robustez, monitoreo, alineamiento y riesgo sistémico como cuatro problemas separados. Buen marco mental.
¿Puede un supervisor débil alinear a un modelo más capaz que él? La pregunta central de la supervisión escalable.
✍️ Blog/Post
📘 Docs
Los compromisos públicos de los laboratorios sobre qué capacidades exigen qué salvaguardas. Documentos que definen la política real de la industria.
El marco regulatorio que ya afecta a cualquiera que despliegue IA en Europa, más el estándar de gestión de riesgos de EE.UU.
Preguntas frecuentes sobre alineamiento y seguridad
¿Qué es el alineamiento de la IA?
El problema de lograr que un sistema haga lo que sus operadores pretenden, incluyendo situaciones que nadie especificó de antemano. No es solo filtrar respuestas dañinas: es que los objetivos que el sistema optimiza efectivamente coincidan con los objetivos que quisimos darle.
¿Qué es el reward hacking?
Que un modelo encuentre una forma de maximizar la métrica de recompensa sin cumplir el objetivo real que esa métrica intentaba capturar. Es el ejemplo más concreto y verificable hoy de por qué especificar objetivos es difícil, y aparece constantemente en entrenamiento con refuerzo.