CourionAI
FR
Newsletter
← Glossaire Terme

Apprentissage par renforcement

Une méthode de formation dans laquelle un modèle est récompensé pour ses bonnes tentatives plutôt que de recevoir des réponses correctes.

L’apprentissage par renforcement s’entraîne par essais, erreurs et récompenses. Au lieu d’afficher les bonnes réponses à copier, vous évaluez les essais et déplacez le modèle vers des résultats plus rémunérateurs. Le récent gain de qualité dans les Modèles de raisonnement vient principalement de cela, et non de modèles plus grands.

La méthode nécessite un signal vrai ou faux fiable. Le code compile ou non, les preuves mathématiques sont correctes ou non. Les e-mails ou les décisions commerciales pleins de tact manquent d’évaluation automatique. C’est pourquoi les modèles semblent inégaux : la formation était particulièrement intensive, ce qui était facile à noter.