CourionAI
FR
Newsletter
← Toutes les actus
research 3 min de lecture

Orca : une nouvelle forme d’IA qui apprend le fonctionnement du monde en l’observant

La BAAI de Pékin a lancé Orca, un « modèle du monde » entraîné sur 125 000 heures de vidéo qui égale des systèmes robotiques spécialisés sans avoir vu la moindre action de robot étiquetée lors de son préentraînement.

Tête de robot sympathique observant un ruban de film sinueux composé de scènes quotidiennes à la maison qui défilent vers elle

La Beijing Academy of Artificial Intelligence, ou BAAI, a publié Orca, un modèle d’IA fondé sur un principe différent des agents conversationnels que vous connaissez. Au lieu de prédire le mot suivant d’une phrase ou l’image suivante d’une vidéo, Orca prédit le prochain état du monde : une représentation interne abstraite de ce qui va se passer. Et il rivalise avec des systèmes robotiques spécialisés, bien qu’il n’ait vu aucune action de robot étiquetée pendant son entraînement principal.

Orca apprend de deux manières. La première, appelée « apprentissage inconscient » par les chercheurs, repose sur l’observation : 125 000 heures de vidéos brutes et non étiquetées, dont le modèle tire la façon dont les scènes évoluent habituellement, le déplacement des objets, ce qui se produit lorsqu’un élément est masqué. La seconde, « l’apprentissage conscient », ajoute du langage : les vidéos sont découpées en segments, chacun accompagné d’une description de l’action ayant provoqué un changement. Les deux alimentent la même représentation interne du monde. Sur ce noyau figé viennent se greffer de petits modules de sortie interchangeables : l’un produit du texte, un autre des images, et un troisième, baptisé Action Expert, des mouvements de robot.

Les résultats sont la partie intéressante. Dans cinq tâches de manipulation réelles réalisées avec un robot humanoïde à deux bras, ranger des livres, empiler des bols, prélever du sucre, Orca égale π0.5, un système spécialement conçu à partir de données robotiques. Le module de contrôle du robot n’a ensuite eu besoin que de 200 démonstrations enregistrées par tâche. L’article montre même Orca se remettre d’une prise ratée et réessayer, tandis que le système spécialisé restait bloqué en répétant la même erreur. Pour la prédiction d’images, « montre-moi la scène après la fermeture du four à micro-ondes », il surpasse les générateurs dédiés.

Que se joue-t-il derrière ces résultats ? La robotique souffre d’un manque chronique de données. Les modèles de langage peuvent absorber tout Internet, mais il n’existe pas un volume comparable d’actions de robots étiquetées : leur collecte est lente et coûteuse. Si un robot peut acquérir l’essentiel de sa compréhension du monde à partir de vidéos ordinaires, puis recevoir seulement une petite dose d’entraînement robotique spécifique, ce goulet d’étranglement se desserre fortement. Gardons toutefois des attentes raisonnables : Orca est petit, 0,8 et 4 milliards de paramètres, ne peut ni entendre ni ressentir le toucher et la force, et la communauté scientifique débat encore de la définition même d’un « modèle du monde ». C’est une piste prometteuse, pas un produit fini.

Ce que cela signifie pour vous : il n’y a rien à installer aujourd’hui, car il s’agit de recherche. Mais elle offre une fenêtre sur le passage de l’IA des écrans au monde physique : non pas en agrandissant les agents conversationnels, mais grâce à des modèles qui apprennent les causes et les effets par l’observation. Si des robots domestiques et d’entrepôt performants apparaissent dans les prochaines années, des approches de ce type, entraînées sur des vidéos plutôt que sur des millions d’actions robotiques étiquetées à la main, expliqueront probablement en grande partie pourquoi.

Sources

Sources: https://arxiv.org/abs/2606.30534

Article suivant

Les chiffres indépendants sont arrivés : Muse Spark 1.1 de Meta offre un rapport qualité-prix sérieux

Selon les tests d’Artificial Analysis, Muse Spark 1.1 de Meta devance GLM 5.2 en programmation pour un prix inférieur, tandis que son taux d’hallucination a presque diminué de moitié.

Ancienne balance comparant un éclair et une pile de pièces, devant des silhouettes de graphiques en barres qui s’élèvent