CourionAI
ES
Boletín
← Todas las noticias
agents 3 min de lectura

El mismo modelo obtuvo una puntuación del 30 por ciento solo y del 100 por ciento dentro del sistema de agentes de Nvidia

El AVO de Nvidia superó los 183 niveles de ARC-AGI-3 utilizando Claude Opus 5, un modelo que obtiene una puntuación de alrededor del 30 por ciento por sí solo. Lo interesante no es el resultado, sino lo que cambió.

Un laberinto que se resuelve mediante un brazo mecánico que alcanza un objetivo en el centro.

Nvidia publicó resultados el 21 de agosto que muestran que su agente de investigación AVO superó todos los niveles del punto de referencia público ARC-AGI-3: 183 niveles en 25 entornos de juego, con una puntuación perfecta de 100,00 en la métrica de eficiencia del punto de referencia. El modelo que pensó fue Claude Opus 5, cuyo premio ARC mide por separado aproximadamente el 30 por ciento cuando se juega solo.

ARC-AGI-3 es una prueba inusual. Un agente cae en un mundo de juego pequeño sin instrucciones, sin reglas establecidas y sin objetivo. Tiene que hurgar en el entorno, descubrir qué hacen sus acciones, adivinar cómo es ganar y luego hacerlo de manera eficiente. La métrica de puntuación, llamada RHAE, no sólo comprueba si el agente terminó un nivel; compara cuántos movimientos necesitó contra un jugador humano primerizo. Así que avanzar hacia la victoria con miles de acciones aleatorias no ayuda. AVO resolvió todo el conjunto público en 6.624 actuaciones medioambientales. VISTA, un sistema rival que ejecuta el mismo modelo, necesitaba 7.542, aproximadamente un 12 por ciento más.

AVO significa Operadores de variación agente y no comenzó jugando juegos. Nvidia lo creó para optimizar los núcleos de GPU, las pequeñas piezas de código críticas para el rendimiento que hacen que las tarjetas gráficas sean rápidas. En ese trabajo funcionó sin supervisión durante siete días, probó más de 500 ideas de optimización, comprometió 40 versiones y terminó superando a FlashAttention-4 hasta en un 10,5 por ciento. Luego, el equipo apuntó al mismo agente a ARC-AGI-3 sin enseñarle nada sobre juegos.

La palabra que hay que saber aquí es arnés. Un modelo de lenguaje por sí solo responde una pregunta a la vez y luego lo olvida todo. Un arnés es el andamiaje que lo rodea: qué contexto ve, qué herramientas puede utilizar, qué recuerda entre pasos y qué sucede cuando se atasca. AVO añade dos cosas en particular. La memoria persistente transmite los hallazgos de modo que el agente no redescubre el mismo hecho diez veces. Un supervisor observa la trayectoria general y empuja al agente hacia una estrategia diferente cuando comienza a dar vueltas en círculos. Nvidia tiene cuidado de decir que este no es un experimento controlado, ya que los dos sistemas difieren en muchos aspectos a la vez, y que estos son resultados públicos, no de la competencia privada. La lectura honesta no es “AVO agrega 70 puntos”, sino “un número de referencia para un modelo le dice mucho menos de lo que pensaba sobre lo que puede hacer un agente construido sobre él”.

Qué significa esto para usted: si elige una herramienta o agente de codificación de IA, la posición en la clasificación del modelo subyacente es solo la mitad de la historia. Dos productos pueden ejecutar el modelo idéntico y comportarse de manera completamente diferente, porque la memoria, el acceso a las herramientas y la recuperación de errores residen en el producto, no en el modelo. Eso también explica una experiencia común: el mismo modelo que se siente brillante en una aplicación se siente olvidadizo y disperso en otra. Para la mayoría de las personas, nada cambia hoy, pero es una lente útil para leer la próxima ronda de anuncios de agentes.

Fuentes

Fuentes: https://developer.nvidia.com/blog/nvidia-avo-reaches-100-on-arc-agi-3-demonstrating-a-frontier-level-general-purpose-architecture-for-long-horizon-autonomous-agents/

Siguiente artículo

Nvidia pagó 6 mil millones de dólares por el software de Poolside y 109 de su gente, y lo llama una licencia

Sin adquisición, sin adquisición. Nvidia obtiene la licencia de la plataforma, invierte otros mil millones y contrata a la mayor parte del equipo, mientras que Poolside sigue siendo independiente sobre el papel.

Dos manos geométricas temblando sobre una pila de monedas y un pequeño chip de circuito