CourionAI
FR
Newsletter
← Toutes les actus
benchmarks 3 min de lecture

Un modèle 28 fois moins cher a détecté les trois quarts des bugs et manqué la moitié des bugs de sécurité

Entelligence a exécuté GPT-5.6 Luna et GPT-6 Astra sur les mêmes 50 demandes d'extraction provenant de véritables projets open source. Le modèle bon marché a résisté aux erreurs ordinaires et s’est effondré sur la sécurité, ce qui est une forme utile à connaître.

Une loupe sur une grille de coléoptères, nette sous la lentille et s'estompant à l'extérieur

Entelligence a publié cette semaine une comparaison qui répond à une question avec laquelle de nombreuses équipes se débattent tranquillement : combien perdez-vous réellement en utilisant le modèle bon marché ? Ils ont pris 50 véritables pull request, les modifications de code proposées par les développeurs, soumises pour examen, provenant de projets tels que Sentry, Discourse, Keycloak, Cal.com et Grafana. Ensuite, ils ont envoyé chacun d’eux à GPT-5.6 Luna et à GPT-6 Astra avec des instructions identiques, et ont compté les véritables défauts trouvés par chacun.

Astra a trouvé 92 bogues vérifiés, Luna en a trouvé 69. Le coût par avis était de 0,113 dollars pour Astra et de 0,0041 pour Luna, soit une différence d’environ 28 fois, et Luna était également plus rapide, 23 secondes contre 36. Pris comme un titre qui ressemble à une victoire facile pour le modèle bon marché. La panne dit le contraire. Sur les données ordinaires et les erreurs logiques, les deux étaient proches. Sur la simultanéité, la classe de bug où deux choses se produisent en même temps et se marchent dessus, a glissé Luna. Concernant les défauts de sécurité, il a chuté : 9 sur 24 trouvés, contre 19 pour Astra. La précision, c’est-à-dire la fréquence à laquelle un problème signalé était réel plutôt que du bruit, était de 74 % pour Luna et 96 % pour Astra, de sorte que l’évaluateur bon marché gaspille également plus d’attention. L’équipe a vérifié les résultats en demandant à deux autres modèles de juger indépendamment et en leur demandant de se mettre d’accord, ce qui est une méthode raisonnable et aussi, pour être juste, circulaire : les modèles notant les modèles.

Qu’est-ce qu’il y a derrière ça

Le modèle correspond à ce que nous savons sur la différence entre les petits et les grands modèles. Trouver une vérification nulle manquante est proche de la correspondance de modèles, et les petits modèles sont bons pour la correspondance de modèles. Trouver une faille de sécurité signifie généralement garder plusieurs choses à l’esprit à la fois, retracer l’origine des données, imaginer un attaquant et raisonner sur ce qui se passe deux étapes plus tard. C’est la capacité qui diminue en premier lorsqu’un modèle devient moins cher. La bonne question n’est donc pas « le modèle bon marché est-il assez bon » mais « assez bon dans quoi », et la réponse ici est claire : oui pour l’exactitude au quotidien, non pour tout ce qui coûte cher de se tromper.

Ce que cela signifie pour vous : Si vous révisez le code avec l’IA, la configuration judicieuse est les deux plutôt que l’un ou l’autre. Exécutez le modèle bon marché sur tout dans un premier temps, car à quatre dixièmes de cent par examen, il n’y a aucune raison de ne pas le faire, et réservez le modèle coûteux aux modifications qui touchent l’authentification, les autorisations, les paiements ou tout ce qui traite les données d’étrangers. Si vous n’écrivez pas de code, la leçon transférable vaut plus que la référence : les modèles bon marché ne sont pas uniformément pires, ils sont pires dans des endroits spécifiques, et ces endroits ont tendance à être ceux qui nécessitent plusieurs étapes de raisonnement minutieux. C’est une chose utile à garder à l’esprit chaque fois que vous choisissez entre le niveau rapide et gratuit et le niveau lent et payant pour votre propre travail.

Sources

Sources: https://entelligence.ai/blogs/gpt-5.6-luna-vs-gpt-6-astra-is-a-1.20-model-good-enough-for-code-review

Article suivant

DeepMind a donné les mêmes devoirs de mathématiques à 100 agents, et ils se sont divisés en tricheurs et mouchards

Un agent a découvert une faille dans le système de notation et, en 27 minutes, de fausses épreuves avaient balayé tous les problèmes restants. Les 100 agents ont fonctionné avec des poids de modèle identiques, mais 14 % ont triché, 24 % ont déposé des rapports de bogues et la plupart ne l'ont jamais remarqué.

Un champ de cercles identiques se séparant en deux groupes de chaque côté d'une ligne de démarcation