CourionAI
IT
Newsletter
← Glossario Termine

Modello Visione-Linguaggio-Azione

Un modello di controllo del robot che converte le immagini della telecamera e le istruzioni vocali in movimenti concreti.

Un modello di visione-linguaggio-azione, o VLA in breve, esegue tre compiti in una rete: vede attraverso le telecamere del robot, comprende il linguaggio normale e genera comandi motori per articolazioni e pinze. Il nome descrive il principio.

In precedenza, le tre parti erano sistemi separati che spesso fallivano a causa delle loro connessioni. La loro combinazione consente comandi come “metti la tazza nel lavandino” senza programmare ogni centimetro. Gemini Robotics di Google DeepMind e Isaac GR00T di Nvidia sono esempi attuali.