CourionAI
ES
Boletín
← Glosario Término

Modelo Visión-Lenguaje-Acción

Un modelo de control de robot que convierte imágenes de cámaras e instrucciones de voz en movimientos concretos.

Un modelo de visión, lenguaje y acción, o VLA para abreviar, realiza tres tareas en una red: ve a través de cámaras robóticas, comprende el lenguaje normal y genera comandos motores para articulaciones y pinzas. El nombre describe el principio.

Anteriormente, las tres partes eran sistemas separados que a menudo fallaban debido a sus conexiones. Su combinación permite comandos como “poner la taza en el fregadero” sin programar cada centímetro. Gemini Robotics de Google DeepMind e Isaac GR00T de Nvidia son ejemplos actuales.