CourionAI
ES
Boletín
← Todas las noticias
world-models 3 min de lectura

Un robot que solo rastrea objetos predice el movimiento equivocado. Alguien finalmente midió por cuánto

Agregar creencias, intenciones y normas sociales a un modelo mundial elevó la predicción de acciones de 63,3 a 87,9 F1. GPT-4.1 con el marco venció a GPT-5.6 Sol sin él.

Un robot con una burbuja de pensamiento que contiene pequeñas figuras humanas y flechas de predicción.

Aquí hay una escena. Alguien pone su taza en el armario mientras estás fuera de la habitación. Vuelves. ¿Dónde miras? En la mesa, claro, porque ahí es donde lo dejaste. Un sistema que solo rastrea objetos siempre falla, porque físicamente la taza está en el gabinete y eso es todo lo que ve.

Un artículo publicado el 22 de agosto convierte ese experimento mental en una medición. Los autores sostienen que los modelos del mundo actual, es decir, sistemas que predicen cómo cambia una escena cuando alguien actúa, sólo modelan la capa física: objetos, posiciones, movimiento, qué se esconde detrás de qué. Sora, Genie 3, JEPA y Marble se agrupan en la misma familia y son criticados por la misma omisión. Lo que la gente en la escena cree, quiere o considera socialmente apropiado nunca ingresa al estado en absoluto.

Su marco, Mental World Modeling, agrega esas variables: creencias, atención, metas, intenciones, emociones, normas y relaciones. Cada acción se divide en un portador físico y una carga útil mental. Deslizar una taza sobre una mesa es el mismo gesto, ya sea una disculpa, un engaño o un acto de atención, y sólo la capa mental los distingue. Los autores tienen cuidado de decir que no están simulando conciencia. Los estados mentales aquí son hipótesis que se infieren del comportamiento, y los sistemas deberían mantener esa incertidumbre visible.

Los números

Para probarlo, crearon MENTIS, un canal que no necesita capacitación adicional, y Menti-Bench, un conjunto de 448 escenas de decisión compuestas por 320 descripciones de texto, 100 historias con imágenes y 28 clips de sonido y video. Cada escena ofrece seis opciones de respuesta más una respuesta de referencia humana.

En ocho modelos, las respuestas directas obtuvieron una puntuación de 63,3 en F1, una medida de precisión estándar. Al hacer la misma pregunta seis veces y elegir la respuesta más común se obtuvo 77,9. La cartera completa alcanzó 87,9. Los humanos alcanzaron 98,5 con el mismo protocolo.

El resultado más sorprendente es que no se puede comprar con cómputo adicional. El modelo más débil que ejecuta el marco, GPT-4.1 con 84,9, superó al modelo más fuerte que respondió directamente con muestreo repetido, GPT-5.6 Sol con 83,6. La estructura venció a la capacidad bruta. Si se elimina el canal mental, los modelos pierden 12,1 puntos de media; quitan el canal fisico y pierden 16.5. Ambos son necesarios, y predecirlos juntos en lugar de por separado vale otro 6,4.

Las ganancias aterrizan donde la teoría dice que deberían: 26,4 puntos en escenas entre personas, sólo 14,0 en escenas centradas en objetos. Alrededor del 80 por ciento de la brecha restante con los humanos proviene de un paso, simulando cómo cambia el estado físico y mental acoplado a continuación.

Qué significa esto para ti: Nada que puedas usar hoy. Pero explica una frustración que quizás ya reconozcas, cuando un asistente hace exactamente lo que literalmente le pediste y no entiende por completo lo que querías decir. Esa brecha no es un problema de cortesía, es un problema de modelado, y este artículo es uno de los primeros en ponerle un número. Para cualquiera que siga hacia dónde se dirige la IA después de los chatbots, los modelos mundiales son la gran apuesta, y el campo ni siquiera se ha puesto de acuerdo sobre una definición todavía.

Fuentes

Fuentes: https://github.com/mental-world/Mentis

Siguiente artículo

Anthropic contrató al hombre que construyó los chips de inteligencia artificial de Google y no es sutil sobre por qué

Amir Salek envió siete generaciones de TPU de Google. Ahora se une al equipo de computación de Anthropic, mientras que Broadcom acumula más de 60 mil millones de dólares de deuda por capacidad de chip.

Un chip de placa de circuito atravesado por una llave con dos manos geométricas reunidas encima