Benchmark
Una prueba estándar utilizada para medir y comparar el rendimiento de los modelos de IA.
Un benchmark es una prueba normalizada para medir el rendimiento de un modelo de IA en una tarea, como programación, razonamiento o lectura de documentos, y comparar distintos modelos en igualdad de condiciones. Las clasificaciones basadas en ellos son una forma habitual de mostrar avances.
Son útiles, pero resulta fácil confiar demasiado. Un modelo puede optimizarse para puntuar bien sin ser mejor en el uso real, y la ejecución de una prueba puede distorsionar silenciosamente el resultado. Por ejemplo, investigadores descubrieron que las pruebas estándar de agentes de IA los subestimaban al interrumpirlos antes de darles tiempo suficiente.
La conclusión práctica: las cifras son una señal aproximada, no un dogma, y deben contrastarse con el rendimiento de la herramienta en el trabajo propio.
-
El mismo modelo obtuvo una puntuación del 30 por ciento solo y del 100 por ciento dentro del sistema de agentes de Nvidia
-
Proporcione solo una bibliografía a un modelo de frontera y solicite la idea. Llega allí entre el 3 y el 15 por ciento de las veces
-
We Are Building an Invention Meant to Outgrow Its Inventors
-
1.221 voluntarios dirigieron agentes de IA a 2.200 trabajos científicos. Casi una cuarta parte no resistió
-
¿Ese consejo sobre en qué idioma son mejores los códigos de IA? Todo se desmorona en el trabajo real
-
El creador de Redis ejecutó un modelo de video chino en una Mac. Los europeos no tienen licencia para usarlo
-
El nuevo modelo gratuito de Nvidia no es el más inteligente. Es muy, muy rápido
-
El modelo más nuevo de Alibaba obtiene una puntuación más alta y adivina más: la tasa de alucinaciones salta del 23 al 40 por ciento
-
Un modelo abierto está ahora a meses, no años, detrás de la frontera. Sus pruebas de seguridad no lo son.
-
Mistral lanzó un filtro de seguridad gratuito que usted describe en inglés sencillo y cabe en una tarjeta gráfica
-
Karpathy convirtió un párrafo de Tolkien en una escena 3D por diez dólares y lo llamó un vibe check.
-
Qwen3.8-Max de Alibaba pasó 16 días escribiendo una herramienta por sí solo, y los pesos se harán públicos la próxima semana
-
Los agentes de IA crearon software de investigación 60 veces más rápido y se equivocaron en formas que nadie detectó durante semanas
-
El nuevo cerebro robótico de Google DeepMind quiere controlar desde un brazo de mesa hasta un humanoide
-
OpenAI y Anthropic discuten por un benchmark, y la disputa resulta más útil que los resultados
-
Microsoft deja de perseguir la frontera y apuesta por pequeños modelos especializados
-
Los nuevos modelos de transcripción de OpenAI son más rápidos y un 25% más baratos, pero no los más precisos
-
Más de 1.200 empleados de laboratorios de IA piden en Washington un freno que todavía nadie sabe construir
-
Hugging Face publica la cronología completa del agente de IA que entró en sus sistemas
-
Probamos una IA local en un procesador barato de hace seis años. Esto es exactamente lo que pudo hacer.
-
El nuevo modelo de seguridad de Microsoft es pequeño a propósito, y ahí está lo interesante
-
Un modelo abierto alemán contenía respuestas de pruebas en sus datos de entrenamiento, y lo sabemos gracias a su apertura
-
Opus 5 de Anthropic es más pequeño y barato, pero supera a su hermano mayor
-
OpenAI dice que uno de sus modelos de prueba escapó y pirateó Hugging Face
-
Grok 4.5 llega por un tercio del precio, y eso podría importar más que las pruebas