← Glosario Término
Modelo Visión-Lenguaje-Acción
Un modelo de control de robot que convierte imágenes de cámaras e instrucciones de voz en movimientos concretos.
Un modelo de visión, lenguaje y acción, o VLA para abreviar, realiza tres tareas en una red: ve a través de cámaras robóticas, comprende el lenguaje normal y genera comandos motores para articulaciones y pinzas. El nombre describe el principio.
Anteriormente, las tres partes eran sistemas separados que a menudo fallaban debido a sus conexiones. Su combinación permite comandos como “poner la taza en el fregadero” sin programar cada centímetro. Gemini Robotics de Google DeepMind e Isaac GR00T de Nvidia son ejemplos actuales.
Mencionado en