← Glossaire Terme
Modèle Vision-Langage-Action
Un modèle de contrôle de robot qui convertit les images de la caméra et les instructions vocales en mouvements concrets.
Un modèle vision-langage-action, ou VLA en abrégé, effectue trois tâches dans un réseau : il voit à travers les caméras du robot, comprend le langage normal et génère des commandes motrices pour les articulations et les pinces. Le nom décrit le principe.
Auparavant, les trois parties étaient des systèmes distincts qui tombaient souvent en panne à cause de leurs connexions. Leur combinaison permet des commandes comme « mettre la tasse dans l’évier » sans programmer chaque centimètre. Gemini Robotics de Google DeepMind et Isaac GR00T de Nvidia en sont des exemples actuels.
Mentionné dans