CourionAI
ES
Boletín
← Todas las noticias
research 3 min de lectura

Proporcione solo una bibliografía a un modelo de frontera y solicite la idea. Llega allí entre el 3 y el 15 por ciento de las veces

Un nuevo punto de referencia llamado Reconstrucción elimina todo excepto la lista de referencias de un artículo y pide a los modelos que recuperen su hallazgo principal. Siete modelos fronterizos obtuvieron entre el 3 y el 15 por ciento. Un torneo de múltiples agentes llegó a 42.

Una hoja de papel vacía en la parte superior, con un bloque denso de barras de referencia abajo y el contorno discontinuo de una bombilla en el espacio vacío

Un punto de referencia publicado en arXiv el 17 de agosto establece que los modelos de lenguaje son una tarea que parece casi fácil pero resulta que no lo es. Realiza un trabajo de investigación. Elimine todo excepto la lista de trabajos citados antes de la publicación. Entregue a un modelo esa lista y pídale que recupere la idea central del artículo. En 643 artículos en seis campos científicos, siete modelos de frontera lograron tasas de coincidencia entre el 3 y el 15 por ciento. El punto de referencia, de un equipo liderado por Shaolong Chen y Yanlin Fei, se llama Reconstrucción.

El diseño es la parte interesante. Una bibliografía apunta a un espacio problemático, pero el salto creativo de la literatura existente a una nueva hipótesis es exactamente lo que el artículo mismo proporciona, de modo que ese salto es la única ruta hacia una respuesta correcta. Para evitar que los modelos simplemente recuerden el artículo, los autores construyeron tres defensas: ninguna referencia citada puede ser posterior al propio horizonte de conocimiento del artículo, los nombres de los autores y los metadatos de identificación se eliminan de las referencias, y cada bibliografía se congela para que no se filtre nada en el momento de la prueba. Un modelo independiente actúa como juez, comparando las hipótesis propuestas con las reales.

Lo que hace que las puntuaciones bajas sean significativas es lo estrechamente que se agrupan. Si la tarea se resolviera mediante el razonamiento, se esperaría que salieran adelante modelos más fuertes. En cambio, los mejores apenas alcanzaron el 15 por ciento y el resto se agrupó por debajo, lo que descarta explicaciones sobre las indicaciones o el tamaño del modelo y apunta a algo estructural. Una ruta funcionó mejor: un proceso de múltiples agentes que recopila hipótesis de varios modelos, hace que se critiquen entre sí y luego elimina a los candidatos más débiles a través de un torneo estilo bracket que alcanzó entre el 23 y el 42 por ciento, aproximadamente 2,4 veces el mejor modelo individual. No hubo ninguna búsqueda externa, por lo que la mejora provino puramente de la diversidad y la discusión. Los autores señalan que se trata de un sustituto computacional aproximado de la revisión por pares, lo cual no es una coincidencia: es el mismo mecanismo de corrección de errores que utilizan los científicos.

Algunas advertencias pertenecen aquí. Esta es una preimpresión que no ha pasado por revisión por pares. El enfoque del torneo necesita muchas llamadas modelo e infraestructura de coordinación, y el documento no detalla el costo de cómputo. Y el 42 por ciento, aunque mucho mejor, todavía deja la mayoría de las ideas sin recuperar.

Qué significa esto para usted: ahora existe una industria considerable que vende modelos de lenguaje como motores de generación de hipótesis, y muchas de esas afirmaciones se basan en pruebas en las que el modelo podría ver el texto completo del artículo, los nombres de los autores o las señales posteriores a la publicación. Las puntuaciones obtenidas en esas condiciones no dicen mucho sobre el paso inferencial. Si está evaluando una herramienta científica de IA, la pregunta que debe hacerse es si la evaluación fue resistente a la contaminación, es decir, si la respuesta podría haberse recuperado en lugar de razonarse. Para todos los demás, este es un lastre útil contra el estado de ánimo actual. El mismo mes se obtuvieron resultados reales en pruebas matemáticas y diseño de proteínas, y esto no disminuye. Pero resumir brillantemente la literatura e inventar la siguiente idea son trabajos diferentes, y los modelos actuales son visiblemente mucho mejores al principio.

Fuentes

Fuentes: https://arxiv.org/abs/2608.16645

Siguiente artículo

Se informa que Anthropic está pagando 7 mil millones de dólares por un software que hace que los chips lleguen más lejos

Anthropic y Decart están intercambiando borradores anticipados de una adquisición por valor de 7.000 millones de dólares, principalmente en acciones, cuya firma está prevista para principios de septiembre. Decart afirma que los modelos pueden funcionar hasta 8 veces más rápido en el mismo hardware.

Un amplio abanico de líneas fluidas canalizadas en un chorro estrecho y rápido que se eleva desde un único chip procesador.