CourionAI
FR
Newsletter
← Toutes les actus
benchmark 3 min de lecture

Deux laboratoires de référence ont mesuré GPT-6 Astra et sont parvenus à des conclusions opposées

Epoch AI place Astra clairement en première place sur 50 tests. Artificial Analysis le classe au niveau de son prédécesseur et derrière Claude Fable 5.1. Le seul chiffre que les deux parties trouvent remarquable est celui d’ARC-AGI-3.

Deux balances identiques pesant la même étoile à huit branches et inclinant dans des directions opposées

Une semaine après qu’OpenAI ait livré GPT-6 Astra, deux laboratoires d’évaluation indépendants ont publié des notes globales, et ils ne sont pas d’accord. Epoch AI, qui regroupe plus de 50 benchmarks individuels, classe Astra au premier rang sur 267 modèles avec 169 points. L’analyse artificielle, qui teste les connaissances, le codage et la compréhension de textes, lui donne 61 points, exactement au même niveau que son prédécesseur GPT-5.6 Sol et derrière Claude Fable 5.1 à 66.

Les deux sont des tenues soignées et appréciées. Ils ne mesurent tout simplement pas la même chose, et les détails ci-dessous expliquent pourquoi. Les chiffres individuels d’Epoch montrent qu’Astra est leader en mathématiques, en connaissances et en énigmes. Fable 5.1 détient la meilleure note dans presque tous les tests de codage. Epoch n’a jusqu’à présent enregistré qu’un seul score de codage pour Astra, issu d’une exécution avec un effort de raisonnement moyen. Les deux chiffres principaux dépendent donc en grande partie de ce qui a été pondéré.

Quelques chiffres concrets tirés du même rapport : le taux d’hallucinations d’Astra au test AA-Omniscience chute de 92 à 51 pour cent, mais il perd environ 80 points Elo sur GDPval-AA v2 et glisse sur le support bancaire et le raisonnement en contexte long. Il coûte deux fois et demie plus cher par unité de texte que Sol, mais pour les tâches de codage, il égale le score de Claude Fable 5 à moins de la moitié du coût par tâche, car il utilise environ un tiers des étapes.

Qu’est-ce qu’il y a derrière ça

Le résultat dont tout le monde parle est ARC-AGI-3, qui dépose un modèle dans de petits mondes de jeu inconnus et n’explique rien. Il faut qu’elle établisse les règles en essayant des choses. Astra a obtenu un score de 62,7 pour cent au test neutre, contre 7,8 pour cent pour Sol et 30,2 pour cent pour Claude Opus 5. Plus frappant que le score est l’efficacité : sur 96 pour cent des niveaux, Astra a eu besoin de moins de mouvements que le testeur humain médian qui a résolu ce niveau.

Il y est arrivé en inventant son propre sténographie, une notation de type algébrique pour enregistrer des objets, des coordonnées et des plans, car tout ce qu’il n’écrit pas dans ses propres notes, il l’oublie. Le fondateur du Prix ARC, François Chollet, appelle cela « une modélisation symbolique du monde à la volée » et note qu’un tel comportement nécessitait autrefois un échafaudage externe élaboré. Maintenant, c’est dans le modèle.

Deux mises en garde s’imposent. OpenAI a rapporté 99,9 % sur le même test en utilisant son propre harnais, et ARC Prize affirme que seul le chiffre de 62,7 % permet une comparaison équitable entre les fournisseurs. Il s’agit du même conflit de harnais qui a produit le résultat accrocheur de Nvidia AVO en août. Et Chollet précise que rien de tout cela ne prouve une intelligence générale : les jeux sont courts, fermés et minuscules à côté de tâches réelles. Ce qu’il dit, c’est que les progrès ont été environ deux fois plus rapides que prévu et qu’il avance ses prévisions AGI avant 2030.

Ce que cela signifie pour vous : Considérez les chiffres de référence uniques comme du marketing jusqu’à ce que vous sachiez ce qu’ils contiennent. Lorsque vous choisissez un modèle, le seul classement qui compte est le vôtre : prenez trois tâches que vous effectuez réellement, exécutez-les sur deux modèles et comparez. Cela prend vingt minutes et bat n’importe quel classement.

Sources

Sources: https://the-decoder.com/benchmarks-disagree-on-gpt-6-astra-but-its-human-beating-efficiency-on-arc-agi-3-pulls-chollets-agi-forecast-forward/

Article suivant

ChatGPT représente à nouveau 55,5 % du trafic Web des chatbots, mais il en détenait 73 % il y a un an

Les chiffres d'août de Similarweb montrent que ChatGPT regagne sa part de 52,7 % il y a trois mois, tandis que Gemini retombe à 25,6 %. Claude a augmenté de 1,9 à 9,3 pour cent en un an. Les applications ne sont pas comptées.

Quatre bulles superposées de tailles très différentes, une dominante et trois rétrécissantes, imprimées sous forme d'anneaux concentriques