← Glossar Begriff
Vision-Language-Action-Modell
Ein Robotersteuerungsmodell, das Kamerabilder und Sprachanweisungen in konkrete Bewegungen umsetzt.
Ein Vision-Language-Action-Modell, kurz VLA, erledigt drei Aufgaben in einem Netz: Es sieht durch Roboterkameras, versteht normale Sprache und erzeugt Motorbefehle für Gelenke und Greifer. Der Name beschreibt damit das Prinzip.
Zuvor waren die drei Teile getrennte Systeme, die an ihren Verbindungen oft scheiterten. Ihre Kombination ermöglicht Befehle wie „Stell die Tasse ins Spülbecken“, ohne jeden Zentimeter zu programmieren. Gemini Robotics von Google DeepMind und Isaac GR00T von Nvidia sind aktuelle Beispiele.
Erwähnt in