Le laboratoire de Mira Murati réduit son modèle aux trois dixièmes de sa taille et ne perd qu’un point
Thinking Machines publie Inkling Small, un modèle de raisonnement à poids ouverts de 276 milliards de paramètres. Il obtient 40 points, contre 41 pour l’original de 975 milliards.
Deux semaines après son premier modèle, Thinking Machines en lance un second, bien plus petit et presque aussi performant. Inkling Small compte 276 milliards de paramètres, dont 12 milliards actifs, et ses poids sont publiés sous licence Apache 2.0. Il obtient 40 dans l’Intelligence Index d’Artificial Analysis, contre 41 pour Inkling et ses 975 milliards de paramètres.
Les paramètres sont les valeurs apprises pendant l’entraînement ; leur nombre augmente généralement la taille et le coût. La distinction entre total et actif vient de l’architecture en mélange d’experts : seule une partie du réseau intervient à chaque requête, donc le coût suit surtout le chiffre actif. Les poids ouverts permettent de télécharger, modifier et exécuter le modèle, au lieu de passer uniquement par une API. Apache 2.0 autorise l’usage commercial, même dans un produit fermé, à condition de conserver les mentions d’attribution.
Inkling Small bat même son aîné sur certains tests : 32 % contre 30 à Humanity’s Last Exam, et 89 contre 87 à GPQA Diamond. Il recule sur les tâches d’agents et le rappel factuel. Surtout, il consomme environ 24 000 jetons de sortie par tâche, contre 45 000 pour DeepSeek V4 Flash et 78 000 pour GPT-5.4 mini, différence directement facturée. Il accepte texte, image et voix, possède une fenêtre de 256 000 jetons et se trouve sur Hugging Face. Selon Artificial Analysis, aucun modèle ouvert de taille égale ou inférieure ne fait mieux.
Ce qui se joue. La réponse « agrandir le modèle » à toute demande de progrès s’efface. Plusieurs sorties récentes montrent que l’architecture, les données et la sobriété en jetons valent davantage que l’échelle brute. Thinking Machines veut fournir une base que les clients affinent avec leurs données. Une entreprise sérieuse peut encore adapter et héberger 276 milliards de paramètres ; 975 milliards sont hors de portée. L’ambition est d’être le modèle sur lequel on construit, pas celui que l’on loue.
Ce que cela signifie pour vous : Rien ne change dans une application de chat. Pour les équipes techniques jusque-là exclues de l’auto-hébergement, la distance entre modèle ouvert exploitable et modèle de pointe loué vient de diminuer. Mais 276 milliards restent très au-delà d’un ordinateur portable : ces poids ouverts visent une entreprise équipée de GPU, pas un particulier avec un MacBook. La tendance compte pour tous : les petits modèles rattrapent les grands et poussent les prix du marché vers le bas.
Sources
OpenAI ajoute désormais un filigrane aux voix générées, avec un outil public pour les vérifier
Les sons générés par GPT-Live dans ChatGPT Voice ou via l’API contiennent maintenant un filigrane SynthID invisible, lisible par l’outil public de vérification d’OpenAI.