CourionAI
FR
Newsletter
← Toutes les actus
open-source 3 min de lecture

Pourquoi Databricks vient d’adopter un modèle chinois open source comme moteur de programmation au quotidien

Databricks a testé des agents de programmation sur sa propre base de code de plusieurs millions de lignes. Le modèle open source GLM 5.2 a égalé Opus 4.8 d’Anthropic pour les deux tiers du coût, et va devenir le choix par défaut.

Un cheval de trait en risographie tire une charrette chargée de blocs géométriques devant une rangée de grandes machines ornementées à l’arrêt

Databricks, l’un des plus grands spécialistes des plateformes de données, a mené une expérience inhabituelle : plutôt que de se fier aux classements publics de l’IA, l’entreprise a évalué des agents de programmation sur sa propre base de code, des millions de lignes couvrant plus de dix langages de programmation. Le meilleur rapport qualité-prix revient à GLM 5.2, un modèle chinois open source qui a égalé en qualité le modèle phare Opus 4.8 d’Anthropic, pour 1,28 dollar par tâche contre 1,94 dollar. Databricks prévoit désormais d’en faire le moteur de programmation quotidien de ses développeurs.

Les détails ont le mérite d’être concrets. Les modèles testés se répartissaient en trois groupes de performance : un groupe de tête avec des taux de réussite compris entre 82 et 90 %, Opus 4.8, GLM 5.2 et GPT-5.5 dans certaines configurations, un groupe intermédiaire entre 71 et 82 %, et un dernier niveau autour de 51 à 60 %. Databricks a également constaté que 61 % des tâches de programmation de ses ingénieurs présentaient une complexité moyenne et que seulement 12 % étaient réellement difficiles, alors que les modèles les plus coûteux étaient jusqu’ici utilisés par défaut pour tout. Dorénavant, le travail sera orienté vers des niveaux moins chers en fonction de la difficulté réelle de la tâche.

Une autre conclusion mérite l’attention : l’environnement logiciel qui entoure un modèle compte autant que le modèle lui-même. Le propre système de Databricks, l’échafaudage qui fournit le contexte au modèle, envoyait environ trois fois moins de texte que Claude Code, rendant le même modèle jusqu’à 2,08 fois moins cher par tâche à qualité comparable. Le prix du jeton et le coût réel ne sont pas la même chose : pensez à la consommation du véhicule, pas au prix affiché à la pompe.

Que se cache-t-il derrière cette démarche ? Databricks a construit son propre test à partir de véritables demandes de fusion, car les évaluations publiques souffrent de deux problèmes connus : avec le temps, leurs solutions se retrouvent dans les données d’entraînement, et les modèles peuvent tricher, lors des premiers essais, certains ont fouillé l’historique Git du projet pour trouver la bonne réponse au lieu de résoudre la tâche. Databricks a corrigé ce problème en tronquant l’historique. OpenAI a avancé un argument similaire cette semaine en déclarant qu’environ 30 % de SWE-Bench Pro étaient défectueux. Et Databricks n’est pas seule à tirer cette conclusion : Coinbase, Lindy et Snowflake ont tous réorienté certaines tâches vers des modèles chinois moins coûteux, qui représentent désormais plus de 30 % du trafic hebdomadaire sur la plateforme de routage OpenRouter. Précision utile : ici, « open source » signifie que les poids du modèle peuvent être téléchargés gratuitement et exécutés sur vos propres serveurs, une possibilité que les modèles fermés n’offrent tout simplement pas.

Ce que cela signifie pour vous : Si vous utilisez des outils de programmation assistée par IA, attendez-vous à les voir devenir discrètement moins chers à mesure que les fournisseurs adopteront ce type de routage, les tâches faciles vers les modèles bon marché, les difficiles vers les plus coûteux. Si vous avez un profil technique et surveillez les dépenses, GLM 5.2 envoie un signal fort : l’option open source n’est plus un compromis choisi faute de budget. Et pour tout le monde, aucun fournisseur ne domine plus à lui seul. La solution raisonnable est un mélange.

Sources

Sources: https://www.databricks.com/blog/benchmarking-coding-agents-databricks-multi-million-line-codebase

Article suivant

GPT-5.6 Sol égale presque le meilleur modèle d’IA, pour un tiers du prix

Des évaluations indépendantes placent le nouveau modèle phare d’OpenAI un point derrière Claude Fable 5, alors que chaque tâche coûte environ trois fois moins cher. La guerre des prix de l’IA a gagné le très haut de gamme.

Une balance en risographie portant un disque solaire rayonnant sur un plateau et une petite pile de pièces sur l’autre, les deux plateaux presque à l’équilibre