CourionAI
ES
Boletín
← Todas las noticias
google 3 min de lectura

Google excluye su propio modelo de las preguntas del examen

DeepMind y el Instituto de Seguridad de IA de Singapur realizaron la primera evaluación doble ciego de un modelo de frontera patentado. El evaluador nunca ve los pesos, Google nunca ve las preguntas y la criptografía hace cumplir ambas cosas.

Dos cajas fuertes selladas, una frente a la otra, unidas por un único tubo cerrado, con cada ojo de cerradura alejado del otro.

Si conocieras las preguntas del examen de antemano, tu puntuación perfecta no significaría nada. Ese es más o menos el problema actual con los benchmarks de IA, y Google DeepMind acaba de ejecutar un piloto diseñado para solucionarlo. Junto con el Instituto de Seguridad de IA de Singapur y otros socios, llevó a cabo lo que describe como la primera evaluación doble ciego de un modelo de frontera patentado. Se probó un modelo de la línea Gemini Flash Lite con puntos de referencia que Google nunca vio.

El problema tiene un nombre: contaminación de referencia. Si las preguntas de la prueba se encontraban en algún lugar de los datos de entrenamiento de un modelo, su puntuación indica que las memorizó bien, no que razona bien. Hasta ahora, las delicadas evaluaciones externas obligaban a tomar una decisión incómoda. O el evaluador entregaba sus indicaciones de prueba, lo que significaba que el proveedor del modelo veía las preguntas y podía optimizarlas, o el proveedor entregaba los pesos de su modelo, lo que significaba arriesgar su propiedad intelectual más valiosa. Ninguna de las partes quería ir primero. DeepMind cita un ejemplo reciente de la fricción resultante: la evaluación ARC-AGI retrasada de Fable 5 de Anthropic, retrasada porque Anthropic aplica una política de retención de datos de 30 días en sus modelos más potentes.

El piloto elimina la opción de utilizar Confidential Space, parte de las herramientas informáticas confidenciales de Google Cloud. Tanto los datos de prueba como el modelo se ejecutan dentro de un entorno criptográficamente sellado que verifica que cada lado permanezca privado para su propietario. El evaluador nunca ve los pesos de Géminis. Google nunca ve las indicaciones. Hasta ahora esto se manejaba con cero promesas y contratos de tala, es decir, confianza. Añadir una garantía técnica encima es la verdadera novedad.

Qué está pasando realmente aquí: los puntos de referencia son la forma en que toda la industria habla sobre el progreso, y casi todos los números que lees en una publicación de lanzamiento fueron producidos por la compañía que fabricó el modelo, en pruebas que pudo ver. Nadie está necesariamente haciendo trampa, pero la estructura de incentivos es terrible y no hay forma de que un extraño distinga un modelo genuinamente capaz de uno bien preparado. La evaluación independiente sólo funciona si el evaluador puede mantener sus preguntas en secreto, y preguntas secretas era exactamente lo que el antiguo sistema no podía ofrecer. Esto es más importante donde hay más en juego: pruebas de ciberseguridad y evaluaciones realizadas por agencias gubernamentales que no pueden entregar su material a una empresa privada. Sin embargo, vale la pena mantener las expectativas firmes. Este es un piloto, en un modelo pequeño, y DeepMind es tanto el sujeto como la parte que anuncia el resultado.

Qué significa esto para usted: trátelo como una razón para leer los números de referencia con un poco más de escepticismo, no menos. La próxima vez que el lanzamiento de un modelo le diga que obtuvo una puntuación del 94 por ciento en algo, las preguntas a tener en cuenta son quién escribió la prueba, si el laboratorio pudo verla de antemano y si alguien fuera de la empresa la verificó. Si este método se pone de moda, algunos de esos números comenzarán a tener una garantía significativa detrás de ellos y el resto no, y valdrá la pena notar la diferencia. Para cualquiera que elija herramientas en lugar de construirlas, la versión práctica sigue siendo la misma de siempre: su propia semana de uso real le dice más que cualquier tabla de clasificación.

Fuentes

Fuentes: https://storage.googleapis.com/deepmind-media/DeepMind.com/Blog/piloting-the-worlds-first-double-blind-ai-evaluations/double-blind-evaluations-technical-report.pdf

Siguiente artículo

El texto invisible en un correo electrónico engañó a un resumidor de IA en las 10 ejecuciones

Forcepoint ocultó instrucciones en un correo electrónico utilizando texto blanco con tamaño de fuente cero. El lector no vio nada inusual. El resumen de AI informó una factura falsa de 46.200 euros y una fecha límite falsa, cada vez.

Un sobre abierto con una carta visible y una segunda hoja en blanco deslizándose detrás de ella sin ser vista, bajo una lupa