El nuevo cerebro robótico de Google DeepMind quiere controlar desde un brazo de mesa hasta un humanoide
Gemini Robotics 2 y Gemini Robotics ER 2 separan pensar y moverse. Qué es realmente un modelo de visión, lenguaje y acción, y qué sistema sigue limitado a una lista de espera.
Google DeepMind ha presentado Gemini Robotics 2, su modelo de visión, lenguaje y acción más avanzado, junto a Gemini Robotics ER 2. Un solo sistema pretende controlar máquinas muy distintas, desde un pequeño brazo fijado a una mesa hasta un humanoide completo, ocupándose del movimiento corporal, la motricidad fina y la colaboración de varios robots.
Un VLA reúne las tres partes del nombre. Recibe imágenes de las cámaras e instrucciones corrientes y produce acciones: órdenes de motor para articulaciones y pinzas. Antes eran sistemas separados y la unión solía fallar. Al juntarlos puedes decir «pon la taza en el fregadero» sin programar cada centímetro del movimiento.
ER 2 hace otro trabajo. ER significa razonamiento encarnado: comprender una escena física y decidir qué debe ocurrir después. Actúa como planificador sobre el modelo de acción y sustituye a ER 1.6 de abril. Se puede probar en Google AI Studio. Robotics 2 no está disponible de forma general; los desarrolladores deben apuntarse a una lista de espera.
Qué hay detrás. Dos modelos reparten el trabajo: uno grande, lento y caro piensa; otro rápido y especializado actúa. Microsoft defiende lo mismo para texto y Anthropic utiliza Fable 5 como gestor que delega. En robótica es aún más necesario, porque un brazo no puede esperar varios segundos. Aun así, los datos son demostraciones internas, no existe un benchmark independiente para tareas domésticas y una lista de espera dista mucho de un producto.
Qué significa esto para ti: Este año ningún humanoide Gemini llegará a una vivienda. Sí puedes probar ER 2 en AI Studio para observar cómo interpreta una escena. Profesionalmente importa más la promesa de controlar cuerpos robóticos distintos con un único modelo. La robótica siempre ha necesitado un sistema específico por máquina; una capa general transferible cambiaría los costes más que cualquier vídeo espectacular.
Fuentes
El laboratorio de Mira Murati reduce su modelo a menos de un tercio y solo pierde un punto
Thinking Machines publica Inkling Small, un modelo de razonamiento con pesos abiertos y 276.000 millones de parámetros. Obtiene 40 puntos frente a los 41 del original de 975.000 millones.