Este modelo abierto se volvió tan bueno para encontrar errores que su propio fabricante aún no lo publica
GLM-5.3 de Z.ai encontró 2436 vulnerabilidades en 269 proyectos de código abierto durante las pruebas. La compañía está reteniendo los pesos descargables durante unas dos semanas mientras endurece el modelo, un retraso inusual para un lanzamiento de peso abierto.
El laboratorio chino de IA Z.ai lanzó su nuevo modelo de codificación, GLM-5.3, el 14 de agosto, pero hay un problema: aún no se puede descargar. Normalmente, un modelo “abierto” significa que la empresa publica los archivos del modelo real para que cualquiera pueda ejecutar una copia en su propio hardware. En su lugar, Z.ai lanzó GLM-5.3 a través de su servicio de codificación alojado y dijo que retendría los pesos descargables durante aproximadamente dos semanas mientras finaliza las pruebas de seguridad.
La razón es lo que arrojaron las pruebas. En CyberGym, un punto de referencia que mide qué tan bien un modelo encuentra vulnerabilidades reales en el software existente, GLM-5.3 obtuvo un 84,5 por ciento, frente al 77,2 por ciento de su predecesor. Z.ai creó un “libro mayor de seguridad” público que enumera lo que encontró el modelo: a partir de la semana del lanzamiento, 2.436 problemas marcados en 269 proyectos de código abierto, incluidos más de mil clasificados como críticos o de alta gravedad. Sólo 53 tenían correcciones públicas (CVE, los números de seguimiento estándar para fallas de software conocidas) en ese momento; el resto todavía estaba bajo embargo mientras los mantenedores de los proyectos afectados trabajaban en parches.
Qué está pasando realmente: GLM-5.3 no obtuvo un nuevo cerebro, por así decirlo. Z.ai dice que es el mismo modelo base que GLM-5.2, solo que con capacitación adicional en codificación larga y tareas “agenticas”, lo que significa que el modelo practicó ejecutar código, probarlo y corregir sus propios errores en un bucle, en lugar de simplemente describir qué debería hacer el código. Ese tipo de capacitación resulta muy buena para encontrar errores de software casi como un efecto secundario, porque detectar una vulnerabilidad y comprender cómo explotarla requiere habilidades similares. Vale la pena tener claro lo que los números muestran y lo que no: estos son los resultados de las pruebas de Z.ai, no verificados de forma independiente, y encontrar un error es una tarea diferente y más fácil que ingresar de manera confiable a un sistema en vivo.
Si bien los pesos permanecen privados, Z.ai está brindando acceso controlado a investigadores de seguridad examinados y ha lanzado una herramienta separada llamada OpenVuln que permite a los mantenedores de código abierto escanear sus propios repositorios con el modelo, antes de que alguien con malas intenciones tenga la oportunidad.
Qué significa esto para usted: si no trabaja con infraestructura de código abierto, esto es principalmente una señal de hacia dónde se dirige la investigación de seguridad de IA, no algo que afecte su día a día. Si mantiene o confía en el software de código abierto, es una vista previa de la compensación que se avecina para todos: una vez que los pesos de GLM-5.3 sean públicos, cualquiera puede ejecutar la misma capacidad de búsqueda de errores localmente, para defensa o ataque, y Z.ai ya ha dicho que no puede controlar lo que sucede después de eso. Una advertencia justa: dos semanas no es un largo camino para que cientos de encargados de mantenimiento solucionen más de mil fallas antes de que se suelte la red de seguridad.
Fuentes
Las habilidades mejoran a los agentes de IA al entregarles una lista de verificación, no hechos. Y dejan de funcionar a las 100 entradas
Princeton y UC San Diego realizaron 8.135 pruebas controladas. El procedimiento explicó el 65,7 por ciento de los beneficios, el conocimiento sólo el 4,5 por ciento. Hacer crecer la biblioteca de 5 a 100 habilidades redujo la precisión de recuperación del 29,6 al 3,3 por ciento.