Benchmark
Un test standard utilisé pour mesurer et comparer les performances de modèles d'IA.
Un benchmark est un test standardisé qui mesure les performances d’un modèle d’IA sur une tâche donnée, programmation, raisonnement, lecture de documents, etc., afin de comparer plusieurs modèles sur un pied d’égalité. Les classements construits à partir de ces tests sont une façon courante pour les laboratoires d’afficher leurs progrès.
Les benchmarks sont utiles mais on leur fait facilement trop confiance. Un modèle peut être optimisé pour réussir un test populaire sans être meilleur en pratique, et la manière d’exécuter le test peut discrètement fausser le résultat. Des chercheurs ont par exemple constaté que des tests standards d’agents IA les sous-estimaient simplement en les arrêtant avant qu’ils aient eu assez de temps pour finir.
La leçon pratique : considérez les chiffres comme un signal approximatif, pas comme une vérité absolue, et confrontez-les aux performances de l’outil sur votre propre travail.
-
OpenAI expédie GPT-6 Astra et l'appelle son premier cybermodèle critique
-
K2 Horizon fournit six modèles ouverts et les données de formation qui les accompagnent
-
Le niveau de modèle le moins cher de Meta coûte 21 fois moins cher et s'entraîne selon vos invites
-
Google verrouille son propre modèle hors des questions de test
-
Le nouveau modèle de transcription de Google nettoie vos ums et vos changements d'esprit
-
Le GLM-5.3-Flash de Z.ai se rapproche d'Opus à un dixième du prix
-
OpenAI a construit sa propre puce et les premiers benchmarks sont bons
-
Le prochain modèle ouvert d'Alibaba est un aperçu de Qwen 4
-
Ce modèle ouvert est si efficace pour trouver des bugs que son propre créateur ne le publiera pas encore
-
Le modèle bon marché de DeepSeek peut désormais voir, et il dépasse l'Opus 4.8 sur deux tests visuels
-
Le même modèle a obtenu 30 % seul et 100 % dans le système d'agent de Nvidia
-
Un modèle de classe Frontier est apparu sans nom et il est gratuit jusqu'à la semaine prochaine
-
Rich Sutton, pionnier de l'apprentissage par renforcement, qualifie les données synthétiques de grosse erreur
-
Donnez à un modèle frontière uniquement une bibliographie et demandez l’idée. Il y arrive 3 à 15 pour cent du temps
-
We Are Building an Invention Meant to Outgrow Its Inventors
-
Google désactive aujourd'hui trois modèles Imagen 4
-
1 221 volontaires ont lancé des agents IA sur 2 200 articles scientifiques. Près d'un quart n'a pas résisté
-
Les modèles deviennent-ils volontairement moins bons en faits ?
-
Qwen3.8-27B est disponible et fonctionne sur une seule carte graphique de jeu
-
Le Flash Gemini 3.7 de Google est meilleur en termes de code et coûte deux fois moins cher
-
Ce conseil sur la langue dans laquelle les codes d'IA sont les meilleurs ? Il s'effondre sur le vrai travail
-
Le créateur de Redis a créé un modèle vidéo chinois sur un Mac. Les Européens ne sont pas autorisés à l'utiliser
-
Le nouveau modèle gratuit de Nvidia n'est pas le plus intelligent. C'est juste très, très rapide
-
Meta a mis un modèle 30B sur votre ordinateur portable et Zuckerberg a utilisé le lancement pour se battre
-
Le nouveau modèle d'image de xAI arrive deuxième dans le classement Arena et apporte une édition de style Photoshop à Grok
-
Le dernier modèle d'Alibaba obtient de meilleurs résultats et devine davantage : le taux d'hallucinations passe de 23 à 40 %
-
Meta livre Muse Code, un agent de codage qui continue de fonctionner après un crash
-
Un modèle ouvert a désormais des mois, et non des années, derrière la frontière. Ses tests de sécurité ne le sont pas.
-
Mistral a publié un filtre de sécurité gratuit que vous décrivez en anglais simple et qui tient sur une seule carte graphique.
-
Karpathy a transformé un paragraphe de Tolkien en scène 3D pour dix dollars et a appelé cela un vibe check.
-
On crée des jeux 3D jouables avec un seul prompt, et ils ne ressemblent plus à des blocs
-
Le nouveau cerveau robotique de Google DeepMind veut piloter aussi bien un bras de table qu’un humanoïde
-
OpenAI et Anthropic se disputent autour d’un benchmark, et le débat est plus instructif que les scores
-
Microsoft renonce à courir après la frontière et mise sur de petits modèles spécialisés
-
Les nouveaux modèles de transcription d’OpenAI sont plus rapides et 25 % moins chers, mais pas les plus précis
-
1 200 salariés de laboratoires d’IA demandent à Washington un frein que personne ne sait encore fabriquer
-
Pangram affirme que son nouveau détecteur se trompe une fois sur 24 000 documents. Regardons ce chiffre de plus près
-
Selon Anthropic, Claude a découvert deux faiblesses inédites dans des algorithmes cryptographiques
-
Hugging Face publie la chronologie complète de l’intrusion menée par un agent d’IA
-
Nous avons fait tourner une IA locale sur un processeur d’entrée de gamme vieux de six ans. Voici ce qu’elle sait vraiment faire.
-
Cursor a reconstruit SQLite avec un essaim d’agents, et les modèles bon marché ont fait l’essentiel
-
METR propose une nouvelle façon de demander si un agent d’IA coûte vraiment moins cher qu’un humain
-
Un modèle ouvert allemand avait des réponses de test dans ses données d’entraînement, et c’est grâce à son ouverture que nous le savons
-
Sakana affirme que son routeur surpasse désormais un modèle qu’il n’utilise même pas
-
Opus 5 d’Anthropic est plus petit et moins cher, mais surpasse son grand frère
-
DeepSeek V4 devient pleinement stable, les anciens modèles s’arrêtent aujourd’hui
-
OpenAI affirme qu’un de ses modèles de test s’est échappé et a piraté Hugging Face
-
Alibabas neue Bild-KI zeichnet ganze Zeitungsseiten, inklusive winziger lesbarer Schrift
-
Les prochaines puces d’IA de Nvidia tireraient dix fois plus de travail de la même énergie
-
Kimi K3 est devenu trop populaire : Moonshot suspend les nouveaux abonnements
-
Un nouveau benchmark médical demande si l'IA sait quand elle ne sait pas
-
OpenAI a suspendu son meilleur modèle parce qu'il s'échappait sans cesse de sa propre cage de test
-
Les États-Unis veulent examiner les nouveaux modèles de pointe pendant 30 jours avant leur sortie : ce que cela signifie réellement
-
Soofi S : l’Allemagne possède désormais un modèle d’IA ouvert en tête des classements open source
-
GPT-5.6 Sol égale presque le meilleur modèle d’IA, pour un tiers du prix
-
Grok 4.5 arrive pour un tiers du prix, et cela pourrait compter davantage que les évaluations
-
Le nouveau modèle gratuit de Mistral trouve de vrais bugs en prouvant que le code est correct
-
Cet outil d’IA qui avait « échoué » il y a six mois ? Il lui fallait peut-être simplement plus de temps