Este robot aprende una tarea de diez minutos viendo un vídeo
Skild AI lanzó S1, un modelo de robot que copia una tarea después de ver una sola demostración humana, sin necesidad de volver a entrenar. Volteó un panqueque a pesar de que nunca vio un panqueque volteado en el entrenamiento.
Skild AI lanzó un modelo de robótica llamado S1 el 25 de agosto con una afirmación inusual: muéstrele un video de una persona haciendo algo y el robot hace eso, incluso si la tarea lleva diez minutos e incluso si nada parecido apareció en el entrenamiento del modelo. Sin reentrenamiento, sin sesiones de recopilación de datos, sin ingenieros al tanto.
Las demostraciones que Skild publicó cubren cómo voltear panqueques, servir café, plantar una planta en una maceta y ensamblar un kit, todas tareas de varios pasos con muchas pequeñas decisiones en el medio. La compañía dice que cuando S1 volteó un panqueque por primera vez, el equipo revisó los datos de entrenamiento y no encontró ningún ejemplo de volteo, lo que significa que el modelo lo resolvió a partir de un único mensaje de video. En tareas que nunca había visto, Skild reporta una tasa de éxito del 66 por ciento contra el 9 por ciento para los modelos VLA impulsados por lenguaje, abreviatura de modelos de visión-lenguaje-acción, el enfoque estándar actual en el que se describe una tarea con palabras en lugar de mostrarla. Entrenado a la misma escala de aproximadamente 100.000 horas de datos de robots. El propio enfoque de Skild sobre la brecha: para alcanzar lo que hace S1 a partir de un video, un modelo convencional necesitaría primero entre 50 y 100 horas de demostraciones recopiladas y luego una ejecución de ajuste, lo que significa una ronda de capacitación adicional en esa tarea específica.
Qué está pasando realmente aquí: esto es robótica que toma prestado un truco que los modelos de lenguaje aprendieron hace años. Cuando pegas un ejemplo en un chatbot y este copia el patrón para el resto de la conversación, eso es aprendizaje en contexto: el modelo se adapta a lo que tiene delante sin que cambie ninguna de sus configuraciones internas. En general, la robótica no ha funcionado de esa manera. Cada nueva tarea significaba nuevos datos y una nueva ejecución de capacitación, que es precisamente la razón por la que los robots útiles permanecían atrapados en las fábricas haciendo una cosa para siempre. Cambiar el mensaje de una oración a un video también evita un problema persistente, que es que el lenguaje es una forma terrible de especificar el movimiento físico. “Flip the pancake” deja de lado todo lo que importa. Un clip de cinco segundos no.
Lo que esto significa para usted: nada en su cocina cambia este año, y vale la pena señalar que se trata de demostraciones publicadas por la empresa en lugar de pruebas independientes, con una tasa de éxito que todavía significa que uno de cada tres intentos falla. Pero la dirección es el punto. Si enseñarle a un robot un nuevo trabajo deja de ser un proyecto de ingeniería y se convierte en una cuestión de filmarse a uno mismo haciéndolo una vez, la economía de todo el campo cambia, al igual que la lista de trabajos que involucran manos. Si trabaja cerca del almacenamiento, la fabricación, el catering o el cuidado, este es el hilo de investigación que vale la pena seguir durante los próximos dos años, no los videos de robots humanoides que se comparten para darles un aspecto de ciencia ficción.
Fuentes
Fuentes: https://www.skild.ai/blogs/s1
El próximo modelo abierto de Alibaba es una vista previa de Qwen 4
Qwen3.8-Flash-Next es un modelo abierto de 125 mil millones de parámetros que solo utiliza seis mil millones de ellos por palabra. Aterriza hoy y está construido sobre la arquitectura detrás de la próxima familia Qwen 4.