Les chiffres indépendants sont arrivés : Muse Spark 1.1 de Meta offre un rapport qualité-prix sérieux
Selon les tests d’Artificial Analysis, Muse Spark 1.1 de Meta devance GLM 5.2 en programmation pour un prix inférieur, tandis que son taux d’hallucination a presque diminué de moitié.
Lorsque Meta a lancé Muse Spark 1.1 cette semaine avec des tarifs d’API agressifs, une question s’est naturellement posée : le modèle est-il réellement bon, ou seulement bon marché ? La société indépendante d’évaluation Artificial Analysis vient de publier ses chiffres, qui suggèrent la réponse suivante : il est véritablement performant pour son prix.
Dans l’indice d’intelligence, un score combinant de nombreuses tâches, Muse Spark 1.1 obtient 51, à égalité avec GLM 5.2 de Zhipu, GPT-5.4 d’OpenAI et GPT-5.6 Luna. Il gagne huit points en seulement trois mois, principalement grâce à la programmation et aux tâches intellectuelles de type agent. Dans l’indice de programmation, il obtient précisément 71,3, dépassant de peu GLM 5.2 (68,8) et se plaçant juste derrière GPT-5.6 Luna (71,4). Le sommet reste hors de portée : GPT-5.6 Sol (77,4), Terra (76,7) et Claude Fable 5 (76,5).
L’économie du modèle rend le résultat intéressant. Artificial Analysis estime que Muse Spark 1.1 coûte environ 0,26 dollar par tâche, contre 0,37 dollar pour GLM-5.2 et 0,89 dollar pour GPT-5.4. Cela tient en partie à sa plus grande concision : il a utilisé 94 millions de jetons de sortie sur l’ensemble des tests, contre 141 millions pour GLM-5.2. Deux autres progrès sont notables. Le taux d’hallucination, la fréquence à laquelle le modèle invente avec assurance au lieu d’admettre son ignorance, est passé de 73 à 38 %, principalement parce qu’il refuse désormais plus souvent de répondre. Sa fenêtre de contexte, la quantité approximative de texte qu’il garde simultanément en mémoire, a quadruplé pour atteindre un million de jetons.
Que se joue-t-il derrière ces chiffres ? En clair, une guerre des prix. Des modèles chinois à code source ouvert comme GLM 5.2 proposent depuis le début de l’année des tarifs inférieurs aux grands laboratoires américains, et Meta se bat désormais sur le même terrain : non pour la couronne, mais pour la meilleure intelligence par dollar. Pour Meta, dont la relance dans l’IA a suscité du scepticisme, la confirmation par une entreprise indépendante de progrès réels en trois mois compte presque autant que les résultats eux-mêmes. La réserve habituelle s’applique, et Artificial Analysis le reconnaît : les scores des bancs d’essai ne reflètent pas toujours les performances réelles. Pour l’instant, le modèle n’est disponible que par l’intermédiaire de l’API de Meta : pas de poids ouverts, ni d’exécution sur votre propre matériel.
Ce que cela signifie pour vous : si vous discutez occasionnellement avec un assistant d’IA, rien ne change. Mais si vous construisez avec l’IA ou payez chaque appel d’API, le milieu de gamme regorge soudain d’options bonnes et abordables, tandis que le coût du passage de l’une à l’autre continue de baisser. La bonne stratégie consiste à tester vos propres tâches réelles sur deux ou trois de ces modèles plutôt que de faire confiance à un seul classement : à 0,26 dollar par tâche, essayer coûte moins cher que deviner.
Sources
Sources: https://x.com/ArtificialAnlys/status/2075677416295739660
OpenAI reconnaît les ratés du grand lancement de Work : voici les correctifs prévus
Après une vague de critiques visant ChatGPT Work et GPT-5.6 Sol, limites d’utilisation épuisées, refonte confuse et signalements de données supprimées, OpenAI promet des corrections sous une semaine.