Les modèles deviennent-ils volontairement moins bons en faits ?
Un billet largement partagé soutient que les laboratoires échangent la connaissance factuelle contre un raisonnement plus efficace. Les chiffres des benchmarks sont réels, même si l'intention est plus difficile à prouver.
Un billet de Walter van der Giessen intitulé « Models Are Getting Dumber on Purpose » a passé le dimanche en première page de Hacker News. Son argument mérite d’être compris même si l’on conteste sa formulation : les laboratoires de pointe retireraient délibérément de la connaissance factuelle brute de leurs modèles afin de gagner en raisonnement et en vitesse.
Les chiffres cités sont frappants. GLM-5.2 obtient 99,2 % à AIME 2026, difficile concours de mathématiques, avec 40 milliards de paramètres actifs. Qwen 3.5 atteint 91,3 % avec 17 milliards. Les paramètres actifs sont la partie du modèle réellement activée pour chaque mot, bien plus petite que le total dans un mélange d’experts. Pendant ce temps, SimpleQA, qui pose de courtes questions factuelles et vérifie les réponses, est dominé par Gemini 2.5 Pro autour de 53 %. Des modèles presque parfaits en mathématiques d’olympiade se trompent sur la moitié des questions factuelles simples.
L’intention reste la partie contestée. Une explication beaucoup plus banale existe : les faits mémorisés occupent des paramètres, les paramètres coûtent de l’argent à chaque requête et un modèle réglé pour les benchmarks de raisonnement finit naturellement avec moins d’anecdotes en mémoire. Personne n’a besoin de décider en réunion de faire oublier le modèle. Le résultat pratique est identique, et la conclusion de van der Giessen s’ensuit : si la mémoire du modèle n’est pas fiable, l’architecture logique est un modèle plus petit avec recherche documentaire, où les faits résident dans une base que le modèle consulte plutôt que dans ses poids.
L’idée générale est régulièrement redécouverte. Un score indique ce pour quoi le modèle a été optimisé, pas tout ce qu’il sait bien faire. Un chiffre qui monte parce qu’un laboratoire l’a ciblé ne signifie pas une amélioration générale, tandis que les compétences non mesurées se dégradent discrètement. Le rappel factuel en fait partie, car il est peu spectaculaire et difficile à transformer en joli graphique.
Ce que cela signifie pour vous : traitez les réponses factuelles assurées avec la même méfiance qu’un inconnu sûr de lui au comptoir, quelle que soit l’intelligence apparente du raisonnement. La solution est simple et gratuite : donnez la source au modèle. Collez le document, activez la recherche web ou envoyez le PDF. Les réponses ancrées dans un texte fourni sont nettement plus fiables que celles tirées de la mémoire ; c’est l’habitude qui améliore le plus les résultats quotidiens. Pour les développeurs, c’est un encouragement à choisir la recherche documentaire plutôt qu’un modèle plus gros : un petit modèle local avec un bon index bat souvent un modèle de pointe qui devine de mémoire, pour une fraction du coût.
Sources
Sources: https://w4g1.dev/blog/models-are-getting-dumber-on-purpose
Stripe rachète OpenRouter pour plus de 7 milliards de dollars
Le spécialiste des paiements veut posséder la couche qui choisit le modèle d'IA répondant à votre requête, puis vous le facture. La valorisation d'OpenRouter a plus que quintuplé en trois mois.