Los investigadores preguntaron por qué los chatbots son malos con las hojas de cálculo y la respuesta es más extraña de lo esperado
Un nuevo artículo prueba cinco explicaciones de por qué los modelos de lenguajes grandes pierden frente a métodos de predicción tabular que tienen décadas de antigüedad. En dimensiones bajas, el modelo se comporta como un clasificador simple basado en distancias. En dimensiones superiores nada clásico lo explica.
Los modelos de lenguaje escriben código, resumen contratos y aprueban exámenes. Son notablemente malos en uno de los trabajos más comunes en todo el aprendizaje automático: mirar una tabla de filas y columnas y predecir el valor faltante. Un artículo publicado el 3 de agosto por Marta Garnelo y Wojciech Czarnecki se propone descubrir por qué, y lo interesante es hasta qué punto descarta la explicación obvia.
La configuración es deliberadamente desnuda. Los investigadores entregan a un frontier model un único mensaje que contiene toda la tabla de entrenamiento y las filas de prueba, y solicitan predicciones en un paso de generación. Sin herramientas, sin ejecución de código, sin ajustes, sin bucle de agente. Luego prueban cinco posibles explicaciones: que el modelo no puede manejar datos ruidosos o no lineales; que aplanar una tabla en texto separado por comas destruye la estructura de columnas; que la forma en que los números se dividen en tokens los destroza; que pedir demasiadas predicciones por consulta degrada la calidad; y que el número de columnas es el problema. También comparan el comportamiento del modelo con 252 modelos clásicos configurados, el tipo de métodos estadísticos de décadas de antigüedad que aún ganan estas tareas.
Qué hay detrás de esto. El hallazgo que destaca es el desajuste entre dos regímenes. Con sólo dos columnas, el modelo se comporta notablemente como un método simple basado en la distancia, del tipo que predice un punto mirando lo que está más cerca de él, con hasta un 91,6 por ciento de acuerdo en una cuadrícula de predicción. Agregue más columnas y esa semejanza se rompe: ningún modelo clásico reproduce las predicciones, incluso cuando los investigadores agregan deliberadamente ruido sintonizado para intentar imitarlas. En otras palabras, el modelo no está haciendo una mala versión de las estadísticas. Está haciendo otra cosa, y esa otra cosa no escala. Esto importa más allá de la curiosidad, porque es la premisa fundamental de los modelos de base tabular, todo un campo de investigación joven que construye modelos específicamente para tablas, y hasta ahora el “por qué” se asumía en gran medida.
Qué significa esto para ti: la regla práctica es simple y vale la pena seguirla. Si su pregunta es “predecir este número a partir de esta tabla”, un chatbot es la herramienta equivocada, y un método antiguo y aburrido, como el gradient boosting o incluso la regresión logística, lo superará, a menudo por mucho. Donde un modelo de lenguaje ayuda con los datos tabulares es en los bordes: explicando lo que significa una columna, escribiendo el código que ejecuta el modelo real, detectando problemas de formato, describiendo los resultados en un lenguaje sencillo. Este es un buen ejemplo de un hábito general que vale la pena desarrollar. La impresionante amplitud de estas herramientas hace que sea fácil asumir competencia en todas partes, y la respuesta honesta es que los fracasos son irregulares y rara vez se anuncian por sí solos.
Fuentes
Fuentes: https://arxiv.org/abs/2608.02412
Mistral lanzó un filtro de seguridad gratuito que usted describe en inglés sencillo y cabe en una tarjeta gráfica
Shieldstral es un modelo de open weights de 3 mil millones de parámetros que compara texto e imágenes con una política que usted mismo escribe, en oraciones comunes, sin ningún reentrenamiento. Se ejecuta en una única GPU de 16 GB con una licencia Apache 2.0.