CourionAI
FR
Newsletter
← Toutes les actus
world-models 3 min de lecture

Un robot qui suit uniquement les objets prédit le mauvais mouvement. Quelqu'un a enfin mesuré par combien

L’ajout de croyances, d’intentions et de normes sociales à un modèle mondial a fait passer la prédiction d’action de 63,3 à 87,9 F1. GPT-4.1 avec le framework a battu GPT-5.6 Sol sans celui-ci.

Un robot avec une bulle de pensée contenant de petites figures humaines et des flèches de prédiction

Voici une scène. Quelqu’un met sa tasse dans le placard pendant que vous êtes hors de la pièce. Tu reviens. Où regardes-tu ? À table, bien sûr, car c’est là que vous en êtes restés. Un système qui ne suit que les objets se trompe à chaque fois, car physiquement, la tasse est dans l’armoire et c’est tout ce qu’elle voit.

Un article publié le 22 août transforme cette expérience de pensée en mesure. Les auteurs soutiennent que les modèles du monde actuels, c’est-à-dire les systèmes qui prédisent comment une scène change lorsqu’une personne agit, modélisent uniquement la couche physique : les objets, les positions, le mouvement, ce qui est caché derrière quoi. Sora, Genie 3, JEPA et Marble sont tous regroupés dans la même famille et critiqués pour la même omission. Ce que les gens sur la scène croient, veulent ou considèrent comme socialement approprié n’entre jamais du tout dans l’État.

Leur cadre, Mental World Modeling, ajoute ces variables : croyances, attention, objectifs, intentions, émotions, normes et relations. Chaque action est divisée en un support physique et une charge utile mentale. Faire glisser une tasse sur une table est le même geste, qu’il s’agisse d’excuses, de tromperie ou d’acte de sollicitude, et seule la couche mentale les distingue. Les auteurs prennent soin de préciser qu’ils ne simulent pas la conscience. Les états mentaux sont ici des hypothèses déduites du comportement, et les systèmes devraient garder cette incertitude visible.

Les chiffres

Pour le tester, ils ont construit MENTIS, un pipeline qui ne nécessite aucune formation supplémentaire, et Menti-Bench, un ensemble de 448 scènes de décision composées de 320 descriptions textuelles, 100 histoires d’images et 28 clips audio et vidéo. Chaque scène propose six options de réponse plus une réponse de référence humaine.

Sur huit modèles, les réponses directes ont obtenu un score de 63,3 sur F1, une mesure de précision standard. En posant la même question six fois et en prenant la réponse la plus courante, on obtient 77,9. Le pipeline complet a atteint 87,9. Les humains ont atteint 98,5 avec le même protocole.

Le résultat le plus frappant est que vous ne pouvez pas acheter cela avec un calcul supplémentaire. Le modèle le plus faible exécutant le framework, GPT-4.1 à 84,9, a battu le modèle le plus puissant répondant directement par échantillonnage répété, GPT-5.6 Sol à 83,6. La structure surpasse les capacités brutes. Supprimez le canal mental et les modèles perdent 12,1 points en moyenne ; supprimez le canal physique et ils perdent 16,5. Les deux sont nécessaires, et les prédire ensemble plutôt que séparément vaut 6,4 supplémentaires.

Les gains arrivent là où la théorie dit qu’ils devraient : 26,4 points sur les scènes entre personnes, seulement 14,0 sur celles centrées sur des objets. Environ 80 pour cent de l’écart restant avec les humains provient d’une seule étape, simulant la façon dont l’état physique et mental couplé change ensuite.

Ce que cela signifie pour vous : Rien que vous puissiez utiliser aujourd’hui. Mais cela explique une frustration que vous connaissez peut-être déjà, lorsqu’un assistant fait exactement ce que vous avez littéralement demandé et passe complètement à côté de ce que vous vouliez dire. Cet écart n’est pas un problème de politesse, c’est un problème de modélisation, et cet article est l’un des premiers à le chiffrer. Pour tous ceux qui suivent l’évolution de l’IA après les chatbots, les modèles mondiaux constituent le grand pari, et le domaine ne s’est même pas encore mis d’accord sur une définition.

##Sources

Sources: https://github.com/mental-world/Mentis

Article suivant

Anthropic a embauché l'homme qui a construit les puces IA de Google, et la raison n'est pas subtile

Amir Salek a expédié sept générations de TPU de Google. Il rejoint désormais l'équipe informatique d'Anthropic, tandis que Broadcom aligne plus de 60 milliards de dollars de dettes pour la capacité des puces.

Une puce de circuit imprimé traversée par une clé avec deux mains géométriques se réunissant au-dessus