CourionAI
ES
Boletín
← Todas las noticias
open-weights 3 min de lectura

Un modelo abierto está ahora a meses, no años, detrás de la frontera. Sus pruebas de seguridad no lo son.

Un informe de SaferAI encuentra que el GLM-5.2 open-weight de Z.ai se encuentra sólo unos meses detrás de los modelos cerrados líderes en capacidades cibernéticas y biológicas, y no rechazó ninguna de las tareas ofensivas que se le asignaron. Claude Opus 4.7 se negó de manera tan consistente que no se pudo completar la prueba.

Dos candados del mismo tamaño, el izquierdo cerrado y sólido, el derecho disolviéndose en partículas a la deriva sobre una caja abierta.

La organización sin fines de lucro de seguridad de IA SaferAI publicó una evaluación de GLM-5.2, el modelo open-weight del laboratorio chino Z.ai, y la cifra del titular es incómoda en ambas direcciones. En capacidades cibernéticas y biológicas, GLM-5.2 se encuentra solo unos meses detrás del GPT-5.5 de OpenAI y Claude Opus 4.7 de Anthropic. En cuanto al comportamiento de seguridad, no está en la misma conversación: al ejecutar las pruebas a través de la API pública de Z.ai, SaferAI descubrió que el modelo no rechazó ninguna de las tareas cibernéticas o biológicas ofensivas que se le asignaron. En cambio, Claude Opus 4.7 se negó tan sistemáticamente que los investigadores no pudieron completar el benchmark CyberGym en absoluto.

“Open-weight” significa que los pesos del modelo, los números que componen el modelo entrenado, se publican para que cualquiera pueda descargarlos y ejecutarlos. Ése es el objetivo del enfoque, y también es el problema aquí. Z.ai podría agregar filtros de seguridad a su propia API alojada, pero en el momento en que alguien ejecuta los pesos en su propio hardware, esas protecciones desaparecen. Pueden quitar los filtros, hacer fine-tuning del modelo o cambiar el system prompt. SaferAI dice que Z.ai no publicó ningún marco de seguridad, ni compromisos de pruebas previas a la implementación ni evaluación de riesgos para el modelo, y Z.ai no respondió a las preguntas de TechCrunch sobre evaluaciones internas o de terceros.

¿Qué está pasando realmente aquí?

“La frontera de la capacidad no es la frontera del riesgo”, dijo a TechCrunch Henry Papadatos, director ejecutivo de SaferAI. Esa frase es todo el argumento. Durante años, el debate abierto versus cerrado giró en torno a si los modelos abiertos podían competir. Esa cuestión está resuelta, por lo que el debate se ha centrado en lo que sucede después de que se sacan las pesas.

La verdadera complicación es que las salvaguardias de los laboratorios cerrados también tienen fugas. Far.ai encontró cientos de jailbreak universales, es decir, mensajes reutilizables que desbloquean las solicitudes más dañinas, en modelos fronterizos como Grok 4.5 y Gemini 3.1 Pro. Una técnica que podría ayudar es filtrar los datos de entrenamiento antes del entrenamiento, eliminando el material peligroso para que el conocimiento nunca se aprenda. Las investigaciones sugieren que esto funciona razonablemente para la biología. Funciona mal para la ciberseguridad, por una razón contundente: es muy difícil entrenar un modelo que sea excelente en codificación pero malo en piratería, y en la codificación es donde está el dinero.

Hay un verdadero contraargumento, expresado en voz alta esta semana. Hugging Face utilizó GLM-5.2 para defenderse durante la infracción de los modelos previos al lanzamiento de OpenAI en julio, y el director ejecutivo Clem Delangue argumentó que los mismos sistemas que detuvieron un ataque impulsado por IA pueden defenderse contra millones. Papadatos cree que el beneficio es exagerado y señala que los atacantes adoptan nuevas herramientas más rápido que los defensores: un grupo de ransomware puede cambiar sus métodos en una semana, un hospital no.

Qué significa esto para ti: si ejecutas modelos abiertos en local, tu rutina no cambia. Los modelos pequeños que usa la mayoría de la gente ni siquiera se acercan a este nivel de capacidad. Si trabajas en TI o seguridad dentro de una pequeña empresa, la lectura práctica es que las herramientas de los atacantes han vuelto a abaratarse. Las defensas de siempre, como los parches, las copias de seguridad y la autenticación multifactor, importan más que cualquier producto nuevo de IA que puedas comprar.

Fuentes

Fuentes: https://www.safer-ai.org/research/glm-5-2-evaluation-report

Siguiente artículo

Meta lanza Muse Code, un agente de codificación que sigue funcionando después de fallar

Meta lanzó Muse Code en versión beta para macOS y Linux, impulsado por un nuevo modelo Muse Spark 1.2. Sus dos ideas interesantes son agentes en segundo plano que permanecen activos durante toda una sesión y un registro de eventos local que permite que un trabajo interrumpido se reanude exactamente donde se detuvo.

Un banco de trabajo de carpintero vacío dentro de un marco de pantalla, una cuerda anudada sobre él y linternas de aceite encendidas constantemente en ambos extremos.