CourionAI
ES
Boletín
← Glosario Término

CWE-Bench

Un punto de referencia externo realizado por Collinear que mide qué tan bien los modelos de IA pueden escribir parches correctos para vulnerabilidades de software conocidas.

Encontrar una falla de seguridad y solucionarla son habilidades diferentes, y CWE-Bench prueba la segunda. A los modelos se les proporciona un código vulnerable y se les puntúa según si el parche que escriben realmente cierra el agujero sin romper nada más. Los resultados suelen indicarse como pass@1, lo que significa que el porcentaje se arregló correctamente en el primer intento.

Se ha convertido en un punto de referencia común en 2026 porque los laboratorios comenzaron a enviar modelos dirigidos específicamente a los defensores. Google reportó un 47,2% para Gemini 3.8 Flash Cyber, cerca del 47,8% del modelo líder, pero a un costo por intento mucho menor, que es el tipo de compensación que el punto de referencia es bueno para exponer.