Nadie aprobó: el primer informe sobre cómo los laboratorios de inteligencia artificial controlan sus propios sistemas
Guidelight calificó a Anthropic, OpenAI, Google, xAI y Meta en seis prácticas básicas de control interno. La mejor puntuación fue una C plus, Meta obtuvo una F y la evaluación utilizó únicamente documentos públicos.
Una organización sin fines de lucro llamada Guidelight publicó su primera evaluación de cómo las empresas de IA controlan los sistemas de IA que ejecutan internamente, y la conclusión principal es contundente: ninguna de ellas aplica completamente ni siquiera las medidas básicas. Anthropic y OpenAI lideran con una C plus. Google le sigue con una D plus, junto con una hoja de ruta detallada para mejorar. xAI obtiene una D menos y Meta una F.
Guidelight revisó seis prácticas y la lista es menos exótica de lo que cabría esperar. ¿La empresa registra lo que hacen sus sistemas internos de IA? ¿Están las acciones riesgosas detrás de un paso de revisión? ¿Existe una parada de emergencia, conocida en el campo como disyuntor? ¿Existe un plan para contener un modelo que resulta desalineado, es decir, que persigue objetivos distintos de los previstos? El patrón en las cinco empresas fue consistente: son mejores para notar cuando algo sale mal y peores para prevenirlo o contenerlo después. Guidelight fue fundada por dos ex líderes de seguridad de OpenAI, Page Hedley y Steven Adler, y se basó únicamente en material público como tarjetas de sistema, informes de seguridad y publicaciones de blogs.
Este último detalle es válido en ambos sentidos y es la justa advertencia aquí. Calificar a una empresa según lo que ha decidido publicar premia la transparencia en lugar de la seguridad real. Un laboratorio con fuertes controles internos y el hábito de no decir nada obtendría una mala puntuación, mientras que un laboratorio que escribe largas publicaciones en blogs sobre su proceso obtendría una buena puntuación. Guidelight es sincero al respecto, y podría decirse que ese es el punto: el grupo quiere que la documentación pública se convierta en la norma precisamente para que la evaluación externa sea posible. La razón por la que todo esto importa ahora es que los laboratorios utilizan cada vez más sus modelos más capaces en sí mismos. Anthropic ha dicho que Claude escribe la mayor parte del código en sus sistemas de producción, a veces a través de agentes que se ejecutan continuamente sin que un humano observe cada paso. La empresa que obtuvo la mejor calificación solo obtuvo una C plus.
Qué significa esto para ti: para la mayoría de las personas, nada cambia esta semana. El valor de un informe como este es que sirve como marcador que se puede volver a consultar al cabo de seis meses, que es exactamente lo que Guidelight pretende. Si elige un proveedor de IA para trabajar, los seis criterios son una lista de verificación razonable para plantearle a un proveedor, y la respuesta honesta a “¿puede mostrarme sus controles internos?” dice mucho. Y si sigue el debate sobre la seguridad, observe la forma del hallazgo: la detección es la parte fácil, la prevención y la contención son las partes difíciles, y eso también se aplica a la seguridad informática ordinaria de las empresas.
Fuentes
Fuentes: https://guidelight.ai/blog/control-assessment-august-2026
OpenAI quiere detectar el uso indebido sin ver sus datos
OpenAI presentó una vista previa del procesamiento de seguridad privada, un sistema destinado a detectar patrones de abuso en varias conversaciones y al mismo tiempo mantener cero retención de datos para los clientes comerciales. Anthropic todavía requiere 30 días de registros para sus modelos más potentes.