CourionAI
ES
Boletín
← Todas las noticias
open-source 3 min de lectura

Un modelo abierto alemán contenía respuestas de pruebas en sus datos de entrenamiento, y lo sabemos gracias a su apertura

El consorcio responsable de Soofi S admitió que preguntas del benchmark científico GPQA se filtraron en su conjunto de entrenamiento. La comunidad lo detectó porque los datos eran públicos. El equipo retiró el benchmark y recalculó todos los resultados.

Ilustración en risografía de un matraz de laboratorio derramando líquido sobre una pila de exámenes en blanco, con una lupa que revela una tarjeta en la pila equivocada

Soofi S es un modelo de lenguaje abierto de 30.000 millones de parámetros, creado por un consorcio de investigación alemán y entrenado en la nube de Deutsche Telekom en Múnich. Cuando se lanzó a mediados de julio, afirmó ocupar el primer puesto entre los modelos completamente abiertos tanto en las pruebas en alemán como en inglés. En la versión 3.0 de su informe técnico, publicada esta semana, el equipo ha admitido que algunas de esas pruebas estaban comprometidas: preguntas de GPQA, un benchmark científico, habían terminado dentro de los datos de entrenamiento.

La causa resulta casi aburridamente cotidiana, y justo por eso es instructiva. En Hugging Face, GPQA no tiene una partición de entrenamiento separada. Todo su material de prueba aparece bajo la etiqueta predeterminada «train». El canal de datos del consorcio seleccionaba el material por el nombre de la partición, así que cuando incorporó lo que creía que eran preguntas de práctica, incorporó el examen. El conjunto de datos afectado solo debía contener versiones reformuladas de las particiones de entrenamiento de 25 benchmarks habituales.

¿Por qué importa? Un benchmark solo es útil si el modelo no ha visto las respuestas. Cuando las preguntas de prueba se filtran en los datos de entrenamiento, el modelo puede obtener una buena puntuación recordando en vez de razonando, y la cifra deja de medir su capacidad. Los investigadores llaman contaminación a este problema, que es una de las razones menos visibles para desconfiar de las clasificaciones en general. Suele pasar inadvertido porque la mayoría de los modelos se entrena con datos que nadie ajeno al laboratorio puede inspeccionar.

Esta es la parte de la historia en la que conviene detenerse. Nadie del consorcio detectó el error. Lo hizo la comunidad al leer los datos de entrenamiento publicados, disponibles porque el proyecto se comprometió con ese nivel de apertura. Soofi S se distribuye con los pesos del modelo, checkpoints intermedios, código de entrenamiento y evaluación, y un inventario detallado de todas las fuentes de datos, incluidas las que se revisaron y rechazaron. La respuesta consistió en eliminar GPQA por completo de la evaluación y recalcular los resultados de los 16 modelos comparados para mantener la equidad. Según los autores, el orden de la clasificación no cambió.

Conviene hacer una salvedad en ambos sentidos. Es un episodio embarazoso y significa que las cifras del lanzamiento original eran erróneas. También demuestra que el enfoque abierto hace lo que promete: los errores salen a la luz, se identifican y se corrigen en público. Un modelo cerrado con el mismo fallo conservaría sin más su puntuación. El mismo informe ya había pasado por una ronda de debate público cuando algunos críticos afirmaron que el modelo se había entrenado con muchos más datos de los que sugieren las reglas clásicas de escalado, y el equipo respondió explicando sus argumentos en lugar de guardar silencio.

Qué significa esto para ti: Hay dos conclusiones prácticas. Primero, cuando vea un modelo encabezando una clasificación, recuerde que la puntuación es una afirmación, no una medición, salvo que alguien pueda comprobar los datos de entrenamiento. Segundo, si le importa poder verificar lo que utiliza, la apertura no es solo una preferencia ideológica: es el mecanismo que produjo esta corrección. Para el uso diario no cambia nada: Soofi S sigue siendo un modelo abierto capaz y centrado en el alemán, y mantuvo su posición tras el nuevo cálculo.

Fuentes

Fuentes: https://huggingface.co/spaces/Soofi-Project/Pretraining-Tech-Report

Siguiente artículo

Los defensores ya utilizan la inyección de prompts como trampa para atacantes con IA

Tracebit ocultó breves cadenas de texto en recursos falsos de la nube para activar las reglas de seguridad del propio modelo de IA atacante. En las pruebas, una sola cadena impidió siempre que Claude Opus 4.8 lograra acceso de administrador.

Ilustración en risografía de una pequeña jaula para pájaros dentro de un laberinto de armarios de servidores, con una araña mecánica inmóvil a medio paso frente a ella