Apprentissage par renforcement
Une méthode de formation dans laquelle un modèle est récompensé pour ses bonnes tentatives plutôt que de recevoir des réponses correctes.
L’apprentissage par renforcement s’entraîne par essais, erreurs et récompenses. Au lieu d’afficher les bonnes réponses à copier, vous évaluez les essais et déplacez le modèle vers des résultats plus rémunérateurs. Le récent gain de qualité dans les Modèles de raisonnement vient principalement de cela, et non de modèles plus grands.
La méthode nécessite un signal vrai ou faux fiable. Le code compile ou non, les preuves mathématiques sont correctes ou non. Les e-mails ou les décisions commerciales pleins de tact manquent d’évaluation automatique. C’est pourquoi les modèles semblent inégaux : la formation était particulièrement intensive, ce qui était facile à noter.
-
Regarder son propre modèle coûte désormais 20 % de plus à OpenAI, et il a suspendu une session de formation pour le faire
-
OpenAI a gelé sa propre formation pendant deux semaines et surveille désormais ses modèles comme un faucon
-
Google a transformé un modèle fini en un modèle beaucoup plus rapide et a publié la recette
-
Qwen3.8-Max d'Alibaba a passé 16 jours à écrire un outil par lui-même, et les poids seront rendus publics la semaine prochaine
-
Un chercheur quitte OpenAI après huit mois, convaincu que les données comptent plus que la taille des modèles
-
Avec 500 dollars d’entraînement, un modèle 9B surpasse tous les ténors sur une tâche ingrate
-
Un lauréat du prix Turing parie contre l’apprentissage profond avec sa nouvelle entreprise, Oak Lab
-
Mistral se lance dans la robotique : une seule caméra suffit pour diriger un robot