CourionAI
FR
Newsletter
← Toutes les actus
benchmarks 3 min de lecture

Karpathy a transformé un paragraphe de Tolkien en scène 3D pour dix dollars et a appelé cela un vibe check.

Andrej Karpathy a donné à Claude Opus 5 l'ouverture du Seigneur des Anneaux et a récupéré 5 500 lignes de code de navigateur 3D fonctionnel en deux heures. Il prend soin de préciser qu’il ne s’agit pas d’une référence, ce qui constitue la partie la plus utile de l’histoire.

Une chaîne de montagnes miniature en papier s'élevant d'un livre ouvert sur un bureau, éclairée par une seule petite lampe de scène, avec une manivelle et une loupe à côté

Andrej Karpathy a remis à Claude Opus 5 un seul paragraphe du début du Seigneur des Anneaux et a demandé une scène en 3D. Deux heures et environ un million de jetons plus tard, soit une valeur d’environ dix dollars, le modèle a produit 5 500 lignes de code rendant la scène dans Three.js, une bibliothèque JavaScript pour graphiques 3D qui s’exécute dans un navigateur ordinaire. Il a publié la source afin que d’autres puissent la rejouer et la modifier. Eleven Labs a fourni l’audio. Le modèle a placé et animé tout le reste tout seul.

La raison invoquée par Karpathy pour faire cela est que les anciens tests informels sont épuisés. Le plus connu est le test du pélican de Simon Willison, qui demande à un modèle de dessiner un SVG d’un pélican faisant du vélo. Le sujet a été choisi parce qu’il est suffisamment absurde qu’aucune image définitive de celui-ci n’existe dans les données d’entraînement, le modèle doit donc le composer. Cette invite a été plus ou moins résolue. Avant cela, Microsoft avait demandé à GPT-4 de dessiner une licorne dans TikZ dans son article Sparks of AGI de 2023 et avait souligné le résultat comme une preuve de raisonnement spatial, à une époque où GPT-4 n’avait jamais vu que du texte.

Un défaut est apparu immédiatement. Le modèle ne peut pas regarder sa propre sortie vidéo. Il a vérifié son travail à l’aide de captures d’écran fixes, c’est pourquoi certaines parties de l’animation se sont révélées erronées. Karpathy qualifie le tout de rude mais amusant, et note que personne ne construirait un monde de cette façon, alors qu’avec un modèle, cela ne coûte presque rien. Il voit une route vers des mondes de jeu générés à la demande, dans lesquels vous intervenez en tant que personnage secondaire.

Qu’est-ce qui se cache derrière cela. Il existe deux façons de mesurer un modèle et elles répondent à des questions différentes. Un benchmark est un ensemble fixe de tâches avec des réponses correctes connues, de sorte que les scores peuvent être comparés entre les modèles et au fil du temps. Sa faiblesse est qu’une fois qu’un benchmark est public, il s’infiltre dans les données de formation et les laboratoires l’optimisent, de sorte qu’un score élevé ne signifie plus ce qu’il était auparavant. Un vibe check est le contraire : une personne donne à un modèle quelque chose d’étrange et regarde ce qui revient. Cela ne peut pas être comparé, cela ne peut pas être noté, et c’est trivialement choisi, car on ne voit jamais les quatre tentatives qui ont échoué. Ce qu’il détecte, c’est ce que les benchmarks oublient, à savoir si un modèle peut mener à bien une tâche longue et sous-spécifiée sans s’effondrer. Karpathy précise clairement qu’il s’agit d’un test d’ambiance et non d’une référence, et que l’honnêteté vaut plus que la démo.

Ce que cela signifie pour vous: considérez cela comme une leçon de lecture plutôt que comme un produit. Lorsque vous voyez une démonstration d’IA impressionnante, les questions utiles sont de savoir combien de tentatives cela a pris, qui a choisi la tâche et si vous pouvez la réexécuter vous-même. Karpathy publiant le code réussit ce dernier test, ce qui est plus que ce que la plupart des démos réussissent. Le point pratique à retenir pour quiconque utilise ces outils au quotidien est le mode d’échec : le modèle s’est trompé spécifiquement là où il n’a pas pu voir le résultat de son propre travail. C’est la règle générale. Partout où un modèle ne peut pas vérifier sa sortie, vérifiez-le vous-même.

Sources

Sources: https://karpathy.ai/lotr-movie/

Article suivant

La nouvelle publicité Qwen d'Alibaba dit que l'IA prendra votre travail et donne l'impression que c'est des vacances

Une vidéo marketing pour Qwen 3.8 présente le fait de confier votre travail à une IA comme une liberté plutôt que comme une menace. Il s’agit d’une rupture délibérée avec la messagerie utilisée par les laboratoires occidentaux, et les deux versions simplifient à l’excès la même chose.

Une chaise longue rayée et un parasol installés sur un bureau, la chaise de bureau repoussée, tandis qu'une pile de documents se trie dans des plateaux à côté