CourionAI
ES
Boletín
← Todas las noticias
ai-basics 2 min de lectura

OpenAI y Anthropic discuten por un benchmark, y la disputa resulta más útil que los resultados

GPT-5.6 Sol obtuvo un 7,8% en ARC-AGI-3 con la configuración oficial y un 38,3% con la de OpenAI. La diferencia muestra por qué cuesta tanto comparar las cifras de los benchmarks.

Dos instrumentos de medición idénticos uno junto al otro, con las agujas señalando valores radicalmente distintos

La semana pasada, Claude Opus 5 de Anthropic marcó un récord del 30,2% en ARC-AGI-3, un benchmark de rompecabezas pensado para comprobar si un modelo puede deducir reglas que nunca había visto. OpenAI respondió el 30 de julio: con dos ajustes adicionales, GPT-5.6 Sol alcanza un 38,3%. En la configuración oficial, ese mismo modelo solo había logrado un 7,8%.

No es una errata. La diferencia procede de dos funciones de la API Responses de OpenAI. «Retained Reasoning» mantiene entre pasos la cadena de razonamiento, es decir, el trabajo interno del modelo, en lugar de descartarla. «Compaction» resume el contexto antiguo en vez de eliminarlo cuando se llena la ventana. Sin ambas funciones, como ocurre en el sistema oficial, el modelo pierde el hilo después de cada movimiento. ARC Prize defendió en un primer momento que su entorno estaba estandarizado para garantizar comparaciones justas. Después, su cofundador François Chollet cedió terreno: las configuraciones diseñadas expresamente para explotar el benchmark no están permitidas, pero los ajustes generales de la API disponibles para cualquier cliente sí son válidos. En la práctica, la propia puntuación de ARC Prize podría haber perjudicado a OpenAI, quizá porque utilizó una API antigua sin funciones que la de Anthropic ya ofrecía.

Qué hay detrás

La idea merece atención aunque no vuelvas a consultar un benchmark. Ninguno mide un modelo de forma aislada, sino el modelo y todo el andamiaje que lo rodea: cómo gestiona la memoria, cómo recorta el contexto, cuántos intentos recibe y cuánta capacidad de cálculo puede gastar. Si cambias ese andamiaje, la cifra puede multiplicarse por cinco, como acaba de ocurrir. Eso no convierte en deshonesta a ninguna de las partes. Están midiendo cosas distintas y ambas llaman al resultado «la puntuación del modelo». La solución de Chollet es la más sensata: cualquier configuración es aceptable siempre que se publiquen con claridad sus ajustes y su coste.

Qué significa esto para ti: Trata una cifra aislada de un benchmark como publicidad, no como una medición concluyente. Cuando un laboratorio afirme que su modelo supera a otro, pregúntate qué configuración produjo el resultado y cuánto costó ejecutarla. Si vas a elegir un modelo para un trabajo real, una pequeña prueba con tus propias tareas te dirá más que cualquier clasificación. Para el resto, la lectura práctica es sencilla: los dos modelos están cerca, y la distancia en el marketing es mayor que la diferencia en sus capacidades.

Fuentes

Fuentes: https://openai.com/index/how-two-settings-tripled-our-arc-agi-3-scores/

Siguiente artículo

Un texto invisible en Word puede secuestrar Copilot y propagarse a los documentos que genera

Un investigador ha demostrado que unas instrucciones ocultas en un documento pueden hacer que Microsoft 365 Copilot altere cifras y copie esas órdenes en el nuevo archivo. Las medidas de Microsoft aún no cierran el problema.

Una hoja aparentemente en blanco en la que una luz rasante revela marcas ocultas, mientras se duplica detrás en una cadena interminable