CourionAI
ES
Boletín
← Todas las noticias
models 2 min de lectura

¿Empeoran los modelos en datos a propósito?

Una publicación muy compartida sostiene que los laboratorios intercambian conocimiento factual por eficiencia de razonamiento. Los datos de los benchmarks son reales, aunque la intención es más difícil de demostrar.

Una estantería con forma de cerebro medio vacía, cuyos libros vuelan hacia un archivador abierto

Una entrada de Walter van der Giessen titulada «Models Are Getting Dumber on Purpose» pasó el domingo en la portada de Hacker News. El argumento merece entenderse aunque discrepes del enfoque: los laboratorios punteros estarían exprimiendo deliberadamente el conocimiento factual de sus modelos para ganar razonamiento y velocidad.

Las cifras que cita son llamativas. GLM-5.2 logra un 99,2 % en AIME 2026, una difícil competición matemática, con 40.000 millones de parámetros activos. Qwen 3.5 alcanza el 91,3 % con 17.000 millones. Los parámetros activos son la parte del modelo que se enciende para una palabra concreta y que en una mezcla de expertos es muy inferior al total. Mientras tanto, SimpleQA, que formula preguntas factuales breves, tiene como líder a Gemini 2.5 Pro con cerca del 53 %. Modelos capaces de bordar las matemáticas olímpicas fallan la mitad de preguntas sencillas.

Lo discutido es si ocurre a propósito. Hay una explicación más aburrida: los datos memorizados ocupan parámetros, los parámetros cuestan dinero en cada consulta y un modelo optimizado para pruebas de razonamiento acaba naturalmente con menos trivia. Nadie necesita reunirse para decidir que el modelo olvide. El resultado práctico es el mismo, y de ahí se sigue la conclusión de van der Giessen: si no se puede confiar en la memoria del modelo, la arquitectura sensata es un modelo menor con recuperación, donde los datos viven en un almacén documental que consulta en vez de estar dentro de sus pesos.

La idea amplia se redescubre una y otra vez. Una puntuación muestra para qué se optimizó un modelo, no todo aquello en lo que es bueno. Que una cifra suba porque un laboratorio la persiguió no equivale a mejora general, y lo que nadie mide puede empeorar en silencio. El recuerdo factual es una de esas cosas, porque resulta poco vistoso y difícil de convertir en un gráfico llamativo.

Qué significa para ti: recibe las respuestas factuales seguras con la misma sospecha que a un desconocido seguro de sí mismo en un bar, por muy inteligente que parezca el razonamiento. La solución es sencilla y gratis: dale la fuente. Pega el documento, activa la búsqueda web o sube el PDF. Las respuestas basadas en texto aportado son mucho más fiables que las extraídas de memoria; este hábito es el que más mejora los resultados diarios. Para quien construye productos, es un empujón hacia la recuperación en vez de modelos mayores: un modelo local pequeño con un buen índice documental suele superar a uno puntero que adivina de memoria y cuesta mucho menos.

Fuentes

Fuentes: https://w4g1.dev/blog/models-are-getting-dumber-on-purpose

Siguiente artículo

Stripe compra OpenRouter por más de 7.000 millones de dólares

La empresa de pagos quiere la capa que decide qué modelo de IA responde a tu consulta y después la factura. La valoración de OpenRouter se multiplicó por más de cinco en tres meses.

Muchos carriles de autopista convergen en un único arco de peaje atravesado por distintas formas de carga