CourionAI
FR
Newsletter
← Toutes les actus
models 3 min de lecture

Grok 4.7 réfléchit plus longtemps pour le même prix et remporte un benchmark étrange

xAI a expédié Grok 4.7 lundi à des prix inchangés de 2 dollars entrants et 6 dollars sortants par million de jetons. Il affiche 71 % sur DeepSWE et un score inhabituellement élevé sur un point de référence juridique où les rivaux s'effondrent.

Une balance maintenue à niveau, une petite pile de pièces de monnaie sur un plateau et une tour d'engrenages sur l'autre

xAI a publié Grok 4.7 lundi, et le titre n’a pas changé : il coûte le même prix que Grok 4.6, à 2 dollars par million de jetons d’entrée et 6 dollars par million de jetons de sortie, avec une variante plus rapide au double du prix pour le double de la vitesse. Un jeton représente environ les trois quarts d’un mot, donc un million d’entre eux représente un long après-midi de travail pour un assistant de codage. Sous le capot, il s’agit d’un modèle de base plus grand, entraîné avec un apprentissage par renforcement plus long, axé sur des problèmes qui prennent des heures plutôt que des minutes.

Le tableau de référence donne une image mitigée, ce qui est plus utile qu’un tableau rasant. Sur DeepSWE v1.1, un test d’ingénierie logicielle, Grok 4.7 obtient 71,0 % à effort élevé, contre 65,2 pour son prédécesseur et juste devant Claude Fable 5.1 Max à 70,0, tandis que GPT-5.6 Sol Max est en tête avec 72,7. Sur Terminal-Bench 4.0, qui mesure le travail en ligne de commande sur plusieurs heures, Grok 4.7 double presque le score de son prédécesseur à 38,0 %, mais Fable 5.1 Max est loin devant avec 57,9. Le nombre le plus impair est le Harvey Legal Agent Benchmark, où Grok 4,7 affiche 19,6 % contre 2,5 pour GPT-5.6 Sol et 6,7 pour Fable 5.1 Max. Sur le plan clinique, il est à la traîne des deux. xAI affirme également qu’il s’agit de son modèle le plus puissant à ce jour pour refuser les demandes véritablement dangereuses tout en contribuant au travail de sécurité légitime, laissant passer 3,3 % des invites risquées lors de son propre test HackerBench.

Qu’est-ce qu’il y a derrière ça

Deux choses méritent d’être retirées. Premièrement, les prix ne baissent pas autant que la capacité augmente en dessous d’un prix fixe, ce qui est la tendance dans l’ensemble du secteur cette année et la raison pour laquelle un modèle d’il y a six mois commence à paraître cher plutôt que de devenir moins cher. Deuxièmement, la répartition entre ces critères vous dit quelque chose de réel : il n’existe plus de « meilleur modèle » unique, il existe des modèles adaptés à des emplois particuliers. Un score de 19,6 pour cent signifie néanmoins que quatre tâches juridiques sur cinq ont échoué. La bonne lecture est donc que ces agents sont en avance dans leur travail professionnel, et non que Grok a résolu le droit. Des tests de référence sont également effectués par le fournisseur, sauf indication contraire, et chaque laboratoire sélectionne les tests qui semblent bons.

Ce que cela signifie pour vous : Pour une utilisation quotidienne du chat, cela change très peu. Si vous écrivez du code ou payez pour l’IA par jeton, cela vaut la peine d’essayer, en particulier parce qu’il se trouve dans des outils que vous utilisez peut-être déjà tels que Cursor et l’API Grok, et parce que rien dans votre facture ne change lorsque vous changez. La leçon plus générale : lorsqu’un modèle s’améliore au même prix, votre budget existant achète tranquillement plus, mais seulement si vous déménagez réellement. Vérifiez tous les quelques mois sur quel modèle vos outils sont par défaut.

Sources

Sources: https://x.ai/news/grok-4-7

Article suivant

Lorsque les agents sont devenus bavards, les marges de cette startup sont tombées à moins 50 %

Bloomberg rapporte que la société juridique d'IA Harvey a vu ses marges brutes chuter d'environ 50 % à moins 50 en juin, alors que l'utilisation des jetons a été multipliée par vingt. Il s'est rétabli en construisant un modèle interne sur le Kimi K3 ouvert de Moonshot.

Un ruban de papier plié en forme de ligne graphique plongeant vers le bas puis se repliant vers le haut sur une grille