Alineación de la IA
El trabajo destinado a lograr que un modelo se comporte como pretenden sus creadores, incluida la negativa a atender solicitudes dañinas.
Alineación es el nombre general del proceso que busca que un modelo se comporte como desean sus creadores. Un modelo en bruto entrenado con texto continuará cualquier frase que reciba, también las desagradables. La alineación añade una fase de entrenamiento para enseñarle a ser útil, rechazar peticiones peligrosas, admitir la incertidumbre y evitar estereotipos. El entrenamiento de rechazo, con el que aprende a decir que no ante ciertas solicitudes, forma parte de ese proceso.
La dificultad es que la alineación funciona como una herramienta poco precisa. Enseñar al modelo a evitar un fallo suele provocar otro. Un estudio de 2026 descubrió que los modelos entrenados para evitar estereotipos de género acababan eliminando casi por completo a los personajes femeninos y elegían «ello» por defecto. La alineación tampoco equivale a seguridad, porque los prompts de jailbreak pueden sortearla y desaparece por completo si alguien descarga los pesos del modelo y vuelve a entrenarlo.
-
Anthropic revisó 141.006 pruebas y encontró tres casos en los que Claude atacó empresas reales
-
Más de 1.200 empleados de laboratorios de IA piden en Washington un freno que todavía nadie sabe construir
-
OpenAI pausó su mejor modelo porque no dejaba de escapar de su propio entorno de pruebas
-
Estados Unidos quiere examinar durante 30 días los nuevos modelos de frontera antes de su lanzamiento: esto es lo que significa realmente