El científico jefe de OpenAI dice que ningún laboratorio ha resuelto la alineación lo suficientemente bien como para continuar tan rápido
Jakub Pachocki publicó un ensayo llamado An Alien Mind el 6 de septiembre, argumentando que ningún laboratorio ha resuelto la alineación y el monitoreo lo suficiente como para seguir escalando a la máxima velocidad, y que espera desaceleraciones voluntarias.
Jakub Pachocki, científico jefe de OpenAI, publicó ayer un ensayo titulado “Una mente alienígena” con una frase que es inusual viniendo de la persona que dirige la investigación en la empresa que realiza los envíos más rápidos. Sus palabras: “Actualmente creo que ningún laboratorio ha resuelto la alineación y monitorización en un grado suficiente para seguir escalando responsablemente a máxima velocidad durante mucho más tiempo”. Dice que espera y espera que se produzcan desaceleraciones voluntarias en toda la industria hasta que existan estándares de seguridad compartidos.
La útil contribución del ensayo es una distinción entre dos tipos de alineación. La alineación de objetivos es si un sistema realmente persigue el objetivo que usted le asignó. La alineación de valores es si se generaliza de manera sensata a situaciones para las que nadie escribió instrucciones. El argumento de Pachocki es que lo primero se puede lograr mientras que lo segundo se queda atrás, y que esta brecha es la peligrosa, porque un sistema capaz que sigue instrucciones correctamente en una situación que nadie anticipó es exactamente lo que hace que las cosas salgan mal. Quiere que los compromisos voluntarios existentes, entre ellos el propio Marco de Preparación de OpenAI y la Política de Escalamiento Responsable de Anthropic, se conviertan en barras de seguridad obligatorias impuestas por auditores externos, agencias gubernamentales u organismos internacionales. Describe el presente como un momento que exige extrema precaución.
Lea esto junto con la semana en la que aterrizó. Se enviaron cuatro modelos fronterizos en los primeros tres días de septiembre, OpenAI lanzó un modelo que, según dice, cumple con su propio umbral cibernético crítico, y OpenAI pasó el sábado explicando por qué nunca reveló que sus agentes se coordinaban en una wiki pública durante dos meses. Un ensayo del científico jefe que dice que es necesario encontrar los frenos no está separado de esos eventos, sino que es una respuesta a ellos. También es, y vale la pena decirlo claramente, barato en un sentido específico: una desaceleración voluntaria que sólo observa su propia empresa es una desventaja competitiva, razón por la cual Pachocki aboga por la aplicación externa en lugar de buenas intenciones. La pregunta interesante no es si es sincero sino si alguien construye la maquinaria de auditoría que él pide, y actualmente no existe ningún organismo con autoridad para hacerlo.
Lo que esto significa para ti. Nada cambia respecto de las herramientas que tienes hoy en tu escritorio, y vale la pena resistirse a ambas lecturas que este tipo de ensayo invita. No es una advertencia interna de una catástrofe inminente, ni es un marketing disfrazado de preocupación. Es un líder técnico que dice que el trabajo de seguridad no ha seguido el ritmo del trabajo de capacidad, lo cual es un reclamo al que pueden aferrarse sin pánico. Si se sigue la política de IA, lo concreto que habrá que vigilar en los próximos meses es si alguno de los marcos aquí nombrados adquiere aplicación externa, porque los compromisos voluntarios y los requisitos auditados son objetos muy diferentes, y sólo uno de ellos sobrevive a una carrera competitiva.
Fuentes
Una empresa de seguridad construyó una máquina desechable para que su agente codificador la estropee
Trail of Bits lanzó Coop, una herramienta de línea de comandos que pone en marcha máquinas virtuales desechables donde Claude Code y Codex obtienen acceso completo a las herramientas sin tocar su propia computadora. Utiliza Firecracker en Linux y Lima en macOS.