Ce robot apprend une tâche de dix minutes en regardant une vidéo
Skild AI a publié S1, un modèle de robot qui copie une tâche après avoir assisté à une seule démonstration humaine, sans recyclage. Il a retourné une crêpe même s'il n'a jamais vu de crêpe se retourner à l'entraînement.
Skild AI a publié un modèle robotique appelé S1 le 25 août avec une affirmation inhabituelle : montrez-lui une vidéo d’une personne faisant quelque chose, et le robot fait cette chose, même si la tâche prend dix minutes et même si rien de tel n’apparaît dans la formation du modèle. Pas de reconversion, pas de session de collecte de données, pas d’ingénieur au courant.
Les démonstrations publiées par Skild couvrent le retournement des crêpes, le versement du café, l’empotage d’une plante et l’assemblage d’un kit, autant de tâches en plusieurs étapes avec de nombreuses petites décisions au milieu. La société affirme que lorsque S1 a retourné une crêpe pour la première fois, l’équipe a parcouru les données d’entraînement et n’a trouvé aucun exemple de retournement, ce qui signifie que le modèle l’a résolu à partir d’une seule invite vidéo. Sur des tâches qu’il n’avait jamais vues, Skild rapporte un taux de réussite de 66 pour cent contre 9 pour cent pour les modèles VLA guidés par le langage, abréviation de modèles vision-langage-action, l’approche standard actuelle où l’on décrit une tâche avec des mots au lieu de la montrer. Formé à la même échelle d’environ 100 000 heures de données robotiques. Le propre cadrage de l’écart par Skild : pour atteindre ce que S1 fait à partir d’une seule vidéo, un modèle conventionnel aurait d’abord besoin de 50 à 100 heures de démonstrations collectées, puis d’un cycle de mise au point, ce qui signifie une série de formation supplémentaire sur cette tâche spécifique.
Que se passe-t-il réellement ici : il s’agit d’une robotique qui emprunte une astuce que les modèles de langage ont apprise il y a des années. Lorsque vous collez un exemple dans un chatbot et que celui-ci copie le modèle pour le reste de la conversation, il s’agit d’un apprentissage en contexte : le modèle s’adapte à partir de ce qui se trouve devant lui sans qu’aucun de ses paramètres internes ne change. La robotique n’a généralement pas fonctionné de cette façon. Chaque nouvelle tâche signifiait de nouvelles données et un nouveau cycle de formation, c’est précisément pourquoi les robots utiles restaient bloqués dans les usines à faire une seule chose pour toujours. Remplacer l’invite d’une phrase par une vidéo permet également d’éviter un problème tenace, à savoir que le langage est un terrible moyen de spécifier le mouvement physique. “Flip the pancake” laisse de côté tout ce qui compte. Un clip de cinq secondes ne le fait pas.
Ce que cela signifie pour vous : rien dans votre cuisine ne change cette année, et il convient de noter qu’il s’agit de démos publiées par l’entreprise plutôt que de tests indépendants, avec un taux de réussite qui signifie toujours un échec sur trois. Mais la direction est le point important. Si enseigner un nouveau travail à un robot cesse d’être un projet d’ingénierie et devient une question de se filmer en train de le faire une seule fois, l’économie de l’ensemble du domaine change, tout comme la liste des emplois qui impliquent des mains. Si vous travaillez à proximité d’entrepôts, de fabrication, de restauration ou de soins, c’est le fil de recherche qui mérite d’être suivi au cours des deux prochaines années, et non les vidéos de robots humanoïdes qui sont partagées pour leur aspect science-fiction.
Sources
Sources: https://www.skild.ai/blogs/s1
Le prochain modèle ouvert d'Alibaba est un aperçu de Qwen 4
Qwen3.8-Flash-Next est un modèle ouvert de 125 milliards de paramètres qui n'en utilise que six milliards par mot. Il atterrit aujourd’hui et est construit sur l’architecture de la prochaine famille Qwen 4.