CourionAI
ES
Boletín
← Todas las noticias
robotics 3 min de lectura

Este robot aprende una nueva tarea con un vídeo breve, no requiere formación

El GEN-1.5 de Generalist AI toma una demostración de tres a doce segundos como indicación y realiza la tarea con un 59 por ciento de éxito, aumentando al 83 por ciento después de cinco minutos de datos. Todos los números provienen de la empresa.

Un brazo robótico que imita un gesto mostrado en una pequeña pantalla con líneas de movimiento.

La startup de robótica Generalist AI presentó GEN-1.5 el 20 de agosto, un modelo que realiza una nueva tarea física a partir de una sola demostración. Le muestra un clip de tres a doce segundos, el clip pasa a la ventana contextual del modelo como lo que la compañía llama una indicación física, y luego el robot intenta la tarea sin ningún paso de entrenamiento. En diez pruebas, incluida la apertura de un frasco y la extracción de dinero de una billetera, Generalist informa una tasa de éxito promedio del 59 por ciento. Agregue diez pasos de entrenamiento en cinco minutos de datos y eso aumenta al 83 por ciento.

Vale la pena traducir la ventana de contexto, porque aquí hace el trabajo pesado. Se trata simplemente de cuánta información puede retener un modelo en mente a la vez mientras funciona, el equivalente mecánico de la memoria a corto plazo. Normalmente, se le enseña una tarea a un robot recopilando horas de ejemplos y volviéndolo a entrenar, lo que lleva días. En cambio, GEN-1.5 trata la demostración como parte de la pregunta, de la misma manera que podría pegar un documento en un chatbot en lugar de ajustar el modelo en él. Generalist dice que el sistema puede encadenar dos indicaciones en secuencias más largas, aceptar demostraciones grabadas en simulación en lugar del mundo real e imitar en parte los movimientos de la mano humana. La compañía también afirma que estas habilidades nunca fueron entrenadas explícitamente, sino que surgieron durante más de ocho meses de capacitación previa sobre datos de interacción.

Esta última afirmación es la que debe tomarse a la ligera. La técnica en sí, llamada aprendizaje en contexto, está bien establecida en modelos de lenguaje y otros grupos la han demostrado antes con robots, aunque sólo en un puñado de tipos de tareas. La afirmación de Generalist es que ahora funciona de manera amplia. Pero las tareas demostradas son breves y simples, cada número proviene de las pruebas propias de la empresa y nada ha sido verificado de forma independiente. Una tasa de éxito del 59 por ciento también suena mejor de lo que parece: un frasco que se abre seis de cada diez veces no es un frasco que dejarías que un robot abriera en tu cocina. Lo que hace que esto sea interesante es la dirección más que la puntuación, porque si mostrar reemplaza el reentrenamiento, el costo de enseñarle algo a un robot se reduce de días a segundos.

Lo que esto significa para ti: nada hoy, y está bien. Aquí no hay producto, ni precio ni fecha de envío. La razón para prestar atención es que la robótica ha estado estancada durante años en el enorme costo de recopilar datos de entrenamiento para cada tarea, y “sólo muéstralo una vez” es la forma de la solución que todos han estado buscando. Si ya trabaja con herramientas de inteligencia artificial, la transferencia útil es conceptual: poner un ejemplo directamente en el mensaje a menudo es mejor que intentar volver a entrenar algo, y eso se aplica tanto a texto e imágenes como a brazos robóticos.

Fuentes

Fuentes: https://generalistai.com/blog/gen-1.5

Siguiente artículo

Google agrega un botón que permite a los lectores elegir sus propias fuentes favoritas

Los editores ahora pueden insertar un botón de Fuentes preferidas en su propio sitio. Google dice que los lectores tienen el doble de probabilidades de hacer clic en una fuente que han marcado como preferida.

Una mano presionando un botón en forma de estrella al lado de una ventana del navegador