Evaluación doble ciego
Una prueba de IA en la que el evaluador nunca ve el modelo y el propietario del modelo nunca ve las preguntas.
Tomada de la medicina, donde ni el paciente ni el médico saben quién recibió el medicamento real, una evaluación de IA doble ciego mantiene a ambas partes en la oscuridad sobre el material del otro. La organización que ejecuta la prueba nunca ve los pesos del modelo y la empresa que creó el modelo nunca ve las preguntas de la prueba. El punto es hacer que una partitura signifique algo para un extraño.
Sin él, obtienes un problema familiar. Si un laboratorio puede ver el examen, puede prepararse para el examen, y nadie fuera de él puede distinguir un modelo genuinamente capaz de uno bien perforado. Los contratos y las promesas de no talar eran la antigua respuesta, que equivalía a confianza. Google DeepMind realizó la primera evaluación de este tipo de un modelo de frontera patentado con el Instituto de Seguridad de IA de Singapur en agosto de 2026, imponiendo la separación con informática confidencial en lugar de una promesa.