Ce robot apprend une nouvelle tâche à partir d'une courte vidéo, aucune formation requise
Le GEN-1.5 de Generalist AI prend une démonstration de trois à douze secondes comme invite et exécute la tâche avec un taux de réussite de 59 %, atteignant 83 % après cinq minutes de données. Tous les chiffres proviennent de l'entreprise.
La startup de robotique Generalist AI a dévoilé le 20 août GEN-1.5, un modèle qui reprend une nouvelle tâche physique à partir d’une seule démonstration. Vous lui montrez un clip de trois à douze secondes, le clip entre dans la fenêtre contextuelle du modèle comme ce que l’entreprise appelle une invite physique, et le robot tente ensuite la tâche sans aucune étape de formation. Sur dix tests, y compris l’ouverture d’un pot et le retrait de l’argent d’un portefeuille, Generalist rapporte un taux de réussite moyen de 59 %. Ajoutez dix étapes de formation sur cinq minutes de données et cela monte à 83 pour cent.
La fenêtre contextuelle mérite d’être traduite, car elle fait le gros du travail ici. Il s’agit simplement de la quantité d’informations qu’un modèle peut retenir simultanément pendant son fonctionnement, l’équivalent machine de la mémoire à court terme. Normalement, vous apprenez une tâche à un robot en collectant des heures d’exemples et en le reformant, ce qui prend des jours. GEN-1.5 traite plutôt la démonstration comme faisant partie de la question, de la même manière que vous pourriez coller un document dans un chatbot plutôt que d’affiner le modèle dessus. Le généraliste affirme que le système peut enchaîner deux invites en séquences plus longues, accepter des démonstrations enregistrées dans une simulation plutôt que dans le monde réel et imiter en partie les mouvements de la main humaine. L’entreprise affirme également que ces capacités n’ont jamais été explicitement formées, mais sont apparues au cours de plus de huit mois de pré-formation sur les données d’interaction.
Cette dernière affirmation est celle à prendre à la légère. La technique elle-même, appelée apprentissage en contexte, est bien établie dans les modèles de langage et d’autres groupes l’ont déjà montrée pour des robots, mais seulement pour une poignée de types de tâches. L’affirmation du généraliste est que cela fonctionne désormais largement. Mais les tâches démontrées sont courtes et simples, chaque chiffre provient des propres tests de l’entreprise et rien n’a été vérifié de manière indépendante. Un taux de réussite de 59 % semble également meilleur qu’il n’y paraît : un pot qui s’ouvre six fois sur dix n’est pas un pot que vous laisseriez un robot ouvrir dans votre cuisine. Ce qui rend cela intéressant, c’est la direction plutôt que le score, car si la démonstration remplace le recyclage, le coût d’apprendre quoi que ce soit à un robot passe de quelques jours à quelques secondes.
Ce que cela signifie pour vous : rien aujourd’hui, et c’est très bien. Il n’y a pas de produit ici, pas de prix et pas de date d’expédition. La raison pour laquelle il faut y prêter attention est que la robotique est coincée depuis des années sur le simple coût de la collecte de données d’entraînement pour chaque tâche, et “montrez-le une fois” est la solution que tout le monde recherchait. Si vous travaillez déjà avec des outils d’IA, le transfert utile est conceptuel : mettre un exemple directement dans l’invite est souvent préférable à essayer de recycler quelque chose, et cela vaut autant pour le texte et les images que pour les bras de robot.
##Sources
Google ajoute un bouton qui permet aux lecteurs de choisir leurs propres sources préférées
Les éditeurs peuvent désormais intégrer un bouton Sources préférées sur leur propre site. Google affirme que les lecteurs sont deux fois plus susceptibles de cliquer sur une source qu'ils ont marquée comme préférée.