CourionAI
FR
Newsletter
← Glossaire Terme

Modèle de préférence de recherche en IA

Une méthode de Meta FAIR qui classe les expériences d'apprentissage automatique proposées les unes par rapport aux autres, plutôt que de prédire les scores, pour décider lesquelles valent la peine de consacrer du temps au GPU.

Les agents de recherche peuvent suggérer bien plus d’expériences que n’importe qui ne peut se permettre d’en réaliser, car la proposition prend quelques secondes et la formation prend des jours. Un RPM se place devant cette file d’attente et met les candidats dans l’ordre, puis choisit le premier à exécuter.

Le choix de conception qui le fait fonctionner est un refus : il n’essaie jamais de prédire les résultats d’une expérience, car les modèles de langage s’avèrent peu fiables pour prévoir des chiffres absolus. Comparer deux options est une question beaucoup plus facile que d’évaluer l’une ou l’autre, ce qui est une astuce qui mérite d’être empruntée chaque fois que vous demandez à un modèle de juger quelque chose.