CourionAI
ES
Boletín
← Todas las noticias
benchmarks 3 min de lectura

Karpathy convirtió un párrafo de Tolkien en una escena 3D por diez dólares y lo llamó un vibe check.

Andrej Karpathy le dio a Claude Opus 5 la apertura de El Señor de los Anillos y recuperó 5.500 líneas de código de navegador 3D funcional en dos horas. Tiene cuidado de decir que esto no es un benchmark, que es la parte más útil de la historia.

Una montaña de papel en miniatura que surge de un libro abierto sobre un escritorio, iluminada por una pequeña lámpara de escenario, con una manivela y una lupa al lado.

Andrej Karpathy entregó a Claude Opus 5 un solo párrafo del comienzo de El Señor de los Anillos y pidió una escena en 3D. Dos horas y aproximadamente un millón de tokens después, por un valor de unos diez dólares, el modelo produjo 5.500 líneas de código que representaban la escena en Three.js, una biblioteca JavaScript para gráficos 3D que se ejecuta en un navegador normal. Publicó la fuente para que otros puedan reproducirla y modificarla. Once Labs proporcionó el audio. El modelo colocó y animó todo lo demás por sí solo.

La razón declarada por Karpathy para hacer esto es que las viejas pruebas informales están desgastadas. La más conocida es la prueba del pelícano de Simon Willison, en la que se pide a un modelo que dibuje un SVG de un pelícano andando en bicicleta. Se eligió el tema porque ya es bastante absurdo que no exista una imagen completa del mismo en los datos de entrenamiento, por lo que el modelo tiene que componerlo. Ese aviso ha quedado más o menos solucionado. Antes, Microsoft hizo que GPT-4 dibujara un unicornio en TikZ en su artículo Sparks of AGI de 2023 y señaló el resultado como evidencia de razonamiento espacial, en un momento en que GPT-4 solo había visto texto.

Un defecto surgió de inmediato. El modelo no puede ver su propia salida de vídeo. Comprobó su funcionamiento mediante capturas de pantalla fijas, razón por la cual partes de la animación salieron mal. Karpathy dice que todo es tosco pero divertido, y señala que nadie construiría un mundo de esta manera, mientras que con un modelo no cuesta casi nada. Él ve una ruta hacia mundos de juego generados bajo demanda, donde ingresas como un personaje secundario.

Qué hay detrás de esto. Hay dos formas de medir un modelo y responden preguntas diferentes. Un benchmark es un conjunto fijo de tareas con respuestas correctas conocidas, de modo que las puntuaciones se pueden comparar entre modelos y a lo largo del tiempo. Su debilidad es que una vez que un benchmark es público, se filtra a los datos de entrenamiento y los laboratorios lo optimizan, por lo que una puntuación alta deja de significar lo que solía tener. Un vibe check es lo contrario: una persona le da a un modelo algo extraño y mira lo que regresa. No se puede comparar, no se puede puntuar y es una selección trivial, ya que nunca se ven los cuatro intentos que fracasaron. Lo que sí capta es lo que los benchmarks pasan por alto, es decir, si un modelo puede mantener una tarea larga y poco especificada sin desmoronarse. Karpathy es explícito en que se trata de un vibe check y no de un benchmark, y que la honestidad vale más que la demostración.

Qué significa esto para ti: trata esto como una lección de lectura en lugar de un producto. Cuando ves una demostración impresionante de IA, las preguntas útiles son cuántos intentos fueron necesarios, quién eligió la tarea y si puedes volver a ejecutarla tú mismo. Karpathy al publicar el código pasa esa última prueba, que es más de lo que la mayoría de las demostraciones logran. La conclusión práctica para cualquiera que use estas herramientas a diario es el modo de fallo: el modelo se equivocó específicamente en lo que no pudo ver el resultado de su propio trabajo. Ésa es la regla general. Siempre que un modelo no pueda comprobar su resultado, compruébalo tú mismo.

Fuentes

Fuentes: https://karpathy.ai/lotr-movie/

Siguiente artículo

El nuevo anuncio Qwen de Alibaba dice que la IA le quitará el trabajo y lo hace parecer unas vacaciones

Un video de marketing para Qwen 3.8 vende entregar su trabajo a una IA como una libertad en lugar de una amenaza. Es una ruptura deliberada con los mensajes que usaban los laboratorios occidentales, y ambas versiones simplifican demasiado lo mismo.

Una tumbona a rayas y una sombrilla colocadas encima de un escritorio de oficina, la silla de oficina apartada, mientras una pila de papeles se clasifica en bandejas al lado