CourionAI
FR
Newsletter
← Toutes les actus
research 3 min de lecture

Donnez à un modèle frontière uniquement une bibliographie et demandez l’idée. Il y arrive 3 à 15 pour cent du temps

Un nouveau benchmark appelé Reconstruction supprime tout sauf la liste de références d'un article et demande aux modèles de récupérer ses conclusions principales. Sept modèles frontières ont obtenu des scores compris entre 3 et 15 pour cent. Un tournoi multi-agents a atteint 42.

Une feuille de papier vide en haut, avec un bloc dense de courtes barres de références en bas et le contour en pointillés d'une ampoule dans l'espace vide

Un benchmark publié sur arXiv le 17 août définit les modèles de langage comme une tâche qui semble presque facile et qui s’avère ne pas l’être. Prenez un document de recherche. Supprimez tout sauf la liste des ouvrages cités avant la publication. Remettez un modèle de cette liste et demandez-lui de récupérer l’idée principale du document. Sur 643 articles dans six domaines scientifiques, sept modèles frontières ont réussi à obtenir des taux de correspondance compris entre 3 et 15 pour cent. La référence, issue d’une équipe dirigée par Shaolong Chen et Yanlin Fei, s’appelle Reconstruction.

Le design est la partie intéressante. Une bibliographie pointe vers un espace problématique, mais le saut créatif de la littérature existante à une nouvelle hypothèse est exactement ce que l’article lui-même fournit, de sorte que ce saut est la seule voie vers une réponse correcte. Pour empêcher les modèles de simplement se souvenir de l’article, les auteurs ont construit trois défenses : aucune référence citée ne peut être postérieure à l’horizon de connaissances de l’article, les noms d’auteur et les métadonnées d’identification sont supprimés des références, et chaque bibliographie est gelée afin que rien ne soit divulgué au moment du test. Un modèle indépendant fait office de juge, comparant les hypothèses proposées aux hypothèses réelles.

Ce qui rend les scores faibles significatifs, c’est leur degré de regroupement. Si la tâche était résolue par le raisonnement, on s’attendrait à ce que des modèles plus solides progressent. Au lieu de cela, les meilleurs ont à peine atteint 15 pour cent et le reste s’est regroupé en dessous, ce qui exclut toute explication sur les invites ou la taille du modèle et pointe vers quelque chose de structurel. Une méthode a mieux fonctionné : un pipeline multi-agents qui collecte les hypothèses de plusieurs modèles, les fait se critiquer les uns les autres, puis élimine les candidats les plus faibles via un tournoi de type bracket, atteignant 23 à 42 %, soit environ 2,4 fois le meilleur modèle unique. Aucune recherche externe n’a été impliquée, l’amélioration est donc venue uniquement de la diversité et de l’argumentation. Les auteurs notent qu’il s’agit d’un substitut informatique approximatif à l’examen par les pairs, ce qui n’est pas une coïncidence : il s’agit du même mécanisme de correction d’erreurs que les scientifiques utilisent.

Certaines mises en garde ont leur place ici. Il s’agit d’une prépublication qui n’a pas fait l’objet d’un examen par les pairs. L’approche du tournoi nécessite de nombreux appels de modèles et une infrastructure de coordination, et le document ne détaille pas le coût de calcul. Et 42 pour cent, bien que bien meilleurs, laissent toujours la plupart des idées non récupérées.

Ce que cela signifie pour vous : il existe désormais une industrie importante vendant des modèles de langage comme moteurs de génération d’hypothèses, et bon nombre de ces affirmations reposent sur des tests dans lesquels le modèle pourrait voir le texte intégral d’un article, les noms d’auteurs ou des signaux post-publication. Les scores obtenus dans ces conditions ne vous disent pas grand-chose sur l’étape d’inférence. Si vous évaluez un outil scientifique d’IA, la question à poser est de savoir si l’évaluation était résistante à la contamination, c’est-à-dire si la réponse aurait pu être récupérée plutôt que raisonnée. Pour tous les autres, c’est un lest utile contre l’ambiance actuelle. Le même mois a apporté de vrais résultats sur les preuves mathématiques et la conception des protéines, et ceux-ci n’en sont pas diminués. Mais résumer brillamment la littérature et inventer la prochaine idée sont des tâches différentes, et les modèles actuels sont visiblement bien meilleurs au début.

Sources

Sources: https://arxiv.org/abs/2608.16645

Article suivant

Anthropic aurait payé 7 milliards de dollars pour un logiciel permettant aux puces d'aller plus loin

Anthropic et Decart échangent des traites avancées pour une acquisition de 7 milliards de dollars, principalement en actions, avec une signature prévue pour début septembre. Decart affirme que les modèles peuvent fonctionner jusqu'à 8 fois plus rapidement sur le même matériel.

Un large éventail de lignes fluides canalisées dans un jet étroit et rapide s'élevant à partir d'une seule puce de processeur