Il nuovo cervello robotico di Google DeepMind vuole controllare bracci da tavolo e umanoidi
Gemini Robotics 2 e Gemini Robotics ER 2 separano pensiero e movimento. Ecco che cos'è un modello visione-linguaggio-azione e quale sistema resta in lista d'attesa.
Google DeepMind presenta Gemini Robotics 2, il suo modello visione-linguaggio-azione più avanzato, e Gemini Robotics ER 2. Un solo sistema dovrebbe guidare macchine diverse, da un piccolo braccio a un umanoide, coordinando corpo intero, movimenti fini e più robot.
Un VLA riceve immagini dalle telecamere e istruzioni normali, poi genera comandi per articolazioni e pinze. Prima erano tre sistemi separati, spesso fragili nei collegamenti. Riunirli permette di dire «metti la tazza nel lavello» senza programmare ogni movimento.
ER 2 svolge l’embodied reasoning: interpreta la scena e pianifica il seguito sopra il modello d’azione. Sostituisce ER 1.6 di aprile ed è disponibile in Google AI Studio. Robotics 2 richiede invece l’iscrizione a una lista d’attesa.
Che cosa c’è dietro. Un modello grande e lento pensa, uno rapido e specializzato agisce: la stessa divisione proposta da Microsoft per il testo e usata da Anthropic con Fable 5. In robotica è indispensabile, ma i dati sono dimostrazioni interne, manca un benchmark indipendente e una lista d’attesa non è un prodotto.
Cosa significa per te: Nessun umanoide Gemini arriverà in casa quest’anno. Puoi però provare ER 2 in AI Studio. Per i professionisti conta soprattutto l’idea di controllare hardware diversi con un solo modello: una base generale cambierebbe i costi della robotica più di un video spettacolare.
Fonti
Il laboratorio di Mira Murati riduce il modello a meno di un terzo e perde un solo punto
Thinking Machines pubblica Inkling Small, modello di ragionamento open weights da 276 miliardi di parametri: ottiene 40 punti contro i 41 dell'originale da 975 miliardi.