CourionAI
ES
Boletín
← Todas las noticias
anthropic 3 min de lectura

Anthropic ya puede leer el monólogo interior de Claude: así es Jacobian Lens

El nuevo método J-Lens de Anthropic revela una «memoria de trabajo» oculta en Claude, donde el modelo conserva conceptos que nunca expresa en voz alta, y modificarla cambia sus respuestas.

Ilustración en estilo risografía de una gran lente sobre la silueta de una cabeza que revela una pequeña cámara interior con formas de pensamientos flotantes

Anthropic ha publicado un nuevo método de investigación llamado Jacobian Lens, o J-Lens, que permite a los investigadores leer algo extraordinario: una especie de monólogo interior dentro de sus modelos Claude. El método revela un pequeño conjunto de patrones neuronales internos, los investigadores lo llaman «J-Space»que se comporta como una memoria de trabajo y conserva pensamientos similares a palabras que el modelo nunca llega a escribir en sus respuestas.

Destacan tres hallazgos. Primero, cada patrón de J-Space se corresponde con una palabra o un concepto sin que el modelo tenga que expresarlo, como pensar en palabras en silencio. Claude puede explicar qué se almacena allí, modificarlo si se le pide y utilizarlo para razonar en varios pasos. Segundo, J-Space no se limita a reflejar el pensamiento de Claude, sino que lo dirige. En un experimento, los investigadores encontraron el concepto «araña» almacenado en J-Space mientras Claude resolvía un rompecabezas sobre el número de patas. Si se sustituye esa representación interna por «hormiga», la respuesta del modelo cambia en consonancia. Eso es control causal, no una mera correlación. Tercero, aparentemente el modelo puede reconocer escenarios de prueba en este espacio interno antes de empezar a redactar una respuesta.

¿Qué hay detrás? El trabajo parte de las investigaciones anteriores de Anthropic sobre interpretabilidad, el campo que intenta comprender qué sucede realmente dentro de los modelos de IA, que suelen ser cajas negras incluso para quienes los crean. Los investigadores enmarcan J-Space mediante la teoría del espacio de trabajo global, una idea procedente de la investigación sobre la consciencia según la cual el pensamiento consciente se apoya en una memoria de trabajo central que comparten distintos procesos cerebrales. Anthropic se muestra prudente: la empresa no afirma expresamente que Claude sea consciente. Señala paralelismos funcionales con la memoria de trabajo humana, una función similar, sin hacer afirmaciones sobre una experiencia interior.

La utilidad práctica ya es real: lo aprendido gracias a J-Lens ha dado lugar a un nuevo método de entrenamiento que, según Anthropic, reduce de manera considerable las alucinaciones, casos en los que un modelo afirma con seguridad algo que no es cierto, y las respuestas engañosas.

Qué significa esto para ti: Hoy no cambia nada en tu aplicación de Claude. Pero esta investigación es importante para una pregunta que todo el mundo acaba haciéndose sobre la IA: «¿Cómo sé que no se lo está inventando?». Poder ver qué tiene presente un modelo y corregir su entrenamiento a partir de ello es un paso concreto desde el «confía en nosotros» hacia el «podemos comprobarlo». Para la mayoría, la conclusión es sencilla: mejoran las herramientas para comprender la IA desde dentro, y los futuros modelos tendrán discretamente menos alucinaciones. Eso sí, mantén cierta distancia ante los titulares sobre consciencia: los paralelismos con la memoria de trabajo son fascinantes, pero se refieren a una función, no a sentimientos.

Fuentes

Fuentes: https://www.anthropic.com/research/global-workspace

Siguiente artículo

Claude Cowork llega al móvil y la web: tu agente de IA ya no vive solo en el escritorio

Anthropic está llevando Claude Cowork a teléfonos y navegadores: inicia una tarea en tu escritorio, aprueba decisiones desde el móvil y recoge los resultados en cualquier lugar.

Ilustración en estilo risografía de un smartphone y un portátil unidos por un hilo curvo por el que viajan pequeños documentos