Le nouveau cerveau robotique de Google DeepMind veut piloter aussi bien un bras de table qu’un humanoïde
Gemini Robotics 2 et Gemini Robotics ER 2 séparent réflexion et mouvement. Ce que recouvre un modèle vision-langage-action, et ce qui reste accessible uniquement sur liste d’attente.
Google DeepMind présente Gemini Robotics 2, son modèle vision-langage-action le plus avancé, accompagné de Gemini Robotics ER 2. Un même système doit piloter des machines très différentes, du petit bras fixé à une table à l’humanoïde complet, pour les mouvements du corps entier, la motricité fine et la coopération entre plusieurs robots.
Un modèle vision-langage-action, ou VLA, réunit les trois éléments de son nom. Il reçoit les images des caméras du robot et des consignes en langage courant, puis produit les commandes motrices qui actionnent articulations et pinces. Auparavant, ces fonctions relevaient généralement de systèmes séparés dont l’assemblage constituait le point faible. Leur réunion permet de demander « mets la tasse dans l’évier » sans programmer chaque centimètre du geste.
Gemini Robotics ER 2 assure une autre fonction. ER signifie embodied reasoning : comprendre une scène physique et décider de la prochaine étape. Placé au-dessus du modèle d’action, il sert de planificateur et remplace Gemini Robotics ER 1.6 d’avril. ER 2 est testable dans Google AI Studio. Gemini Robotics 2 n’est pas disponible généralement ; les développeurs doivent s’inscrire sur liste d’attente.
Ce qui se joue. La séparation en deux modèles reflète une tendance générale : un système puissant, lent et cher réfléchit ; un autre, rapide et spécialisé, agit. Microsoft défend la même organisation pour le texte et Anthropic fait de Fable 5 un gestionnaire qui délègue. En robotique, l’attente de plusieurs secondes est encore moins acceptable. Gardons toutefois les attentes mesurées : les chiffres viennent des démonstrations de DeepMind, aucun benchmark indépendant ne mesure la capacité d’un humanoïde à faire la lessive et une liste d’attente n’est pas un produit.
Ce que cela signifie pour vous : Aucun humanoïde Gemini n’arrivera dans un appartement cette année. Les curieux peuvent réellement essayer ER 2 dans AI Studio pour observer son interprétation d’une scène physique. Pour les professionnels, l’enjeu n’est pas la vidéo d’un humanoïde, mais la promesse de contrôler de nombreux corps robotiques avec un seul modèle. La robotique repose historiquement sur une pile de contrôle par machine ; une couche générale transférable entre matériels bouleverserait davantage son économie qu’une démonstration spectaculaire.
Sources
Le laboratoire de Mira Murati réduit son modèle aux trois dixièmes de sa taille et ne perd qu’un point
Thinking Machines publie Inkling Small, un modèle de raisonnement à poids ouverts de 276 milliards de paramètres. Il obtient 40 points, contre 41 pour l’original de 975 milliards.