Apprentissage par renforcement
Une méthode de formation dans laquelle un modèle est récompensé pour ses bonnes tentatives plutôt que de recevoir des réponses correctes.
L’apprentissage par renforcement s’entraîne par essais, erreurs et récompenses. Au lieu d’afficher les bonnes réponses à copier, vous évaluez les essais et déplacez le modèle vers des résultats plus rémunérateurs. Le récent gain de qualité dans les Modèles de raisonnement vient principalement de cela, et non de modèles plus grands.
La méthode nécessite un signal vrai ou faux fiable. Le code compile ou non, les preuves mathématiques sont correctes ou non. Les e-mails ou les décisions commerciales pleins de tact manquent d’évaluation automatique. C’est pourquoi les modèles semblent inégaux : la formation était particulièrement intensive, ce qui était facile à noter.
-
Grok 4.7 réfléchit plus longtemps pour le même prix et remporte un benchmark étrange
-
Xiaomi possède désormais le modèle ouvert le plus puissant au monde et vous pouvez simplement le télécharger
-
De vraies personnes lisent de vraies conversations ChatGPT, et la plupart des utilisateurs n'en ont aucune idée
-
Un modèle de 2,5 milliards de paramètres qui bat les plus grands et fonctionne sur votre ordinateur portable
-
Granite 4.2 d'IBM est gratuit, suffisamment petit pour fonctionner localement et conçu pour penser avant tout
-
Rich Sutton, pionnier de l'apprentissage par renforcement, qualifie les données synthétiques de grosse erreur
-
Regarder son propre modèle coûte désormais 20 % de plus à OpenAI, et il a suspendu une session de formation pour le faire
-
OpenAI a gelé sa propre formation pendant deux semaines et surveille désormais ses modèles comme un faucon
-
Google a transformé un modèle fini en un modèle beaucoup plus rapide et a publié la recette
-
Qwen3.8-Max d'Alibaba a passé 16 jours à écrire un outil par lui-même, et les poids seront rendus publics la semaine prochaine
-
Un chercheur quitte OpenAI après huit mois, convaincu que les données comptent plus que la taille des modèles
-
Avec 500 dollars d’entraînement, un modèle 9B surpasse tous les ténors sur une tâche ingrate
-
Un lauréat du prix Turing parie contre l’apprentissage profond avec sa nouvelle entreprise, Oak Lab
-
Mistral se lance dans la robotique : une seule caméra suffit pour diriger un robot