Por qué Databricks acaba de convertir un modelo chino de código abierto en su motor de programación diario
Databricks probó agentes de programación en su propia base de código, con millones de líneas. GLM 5.2, de código abierto, igualó a Opus 4.8 de Anthropic con dos tercios del coste y se convertirá en la opción predeterminada.
Databricks, una de las mayores empresas de plataformas de datos, llevó a cabo un experimento poco habitual: en lugar de confiar en las clasificaciones públicas de IA, evaluó agentes de programación en su propia base de código, formada por millones de líneas repartidas entre más de diez lenguajes de programación. El ganador en relación calidad-precio fue GLM 5.2, un modelo chino de código abierto que igualó en calidad al buque insignia de Anthropic, Opus 4.8, con un coste de $1.28 por tarea frente a $1.94. Databricks planea ahora desplegarlo como motor de programación de uso diario para sus desarrolladores.
Los detalles son de una concreción poco habitual. Los modelos evaluados se dividieron en tres grupos de rendimiento: uno superior, con tasas de éxito del 82 al 90 por ciento (Opus 4.8, GLM 5.2 y GPT-5.5 en determinadas configuraciones); uno intermedio, entre el 71 y el 82 por ciento; y uno inferior, en torno al 51-60 por ciento. Databricks también descubrió que el 61 por ciento de las tareas de programación de sus ingenieros tiene una complejidad media y que solo el 12 por ciento es realmente difícil, pese a que hasta ahora se usaban por defecto los modelos más caros para todo. A partir de ahora, el trabajo se asignará a opciones más baratas según la dificultad real de cada tarea.
Hay otro hallazgo que merece atención: la capa de software que envuelve a un modelo importa tanto como el propio modelo. El sistema de Databricks, la estructura que proporciona contexto al modelo, enviaba aproximadamente tres veces menos texto que Claude Code, lo que permitía que el mismo modelo resultase hasta 2,08 veces más barato por tarea con una calidad comparable. El precio por token y el coste real no son lo mismo; piensa en el consumo de combustible, no en el precio que marca el surtidor.
¿Qué hay detrás de todo esto? Databricks creó su propia prueba a partir de solicitudes de incorporación de cambios reales porque los tests públicos tienen dos problemas conocidos: con el tiempo, las soluciones acaban filtrándose en los datos de entrenamiento y los modelos pueden hacer trampas. En las primeras pruebas, algunos buscaron la respuesta correcta en el historial de Git del proyecto en vez de resolver la tarea. (Databricks lo corrigió truncando el historial). OpenAI presentó un argumento parecido esta semana al declarar que aproximadamente el 30 por ciento de SWE-Bench Pro está defectuoso. Y Databricks no es la única que ha llegado a esta conclusión: Coinbase, Lindy y Snowflake han trasladado parte de su trabajo a modelos chinos más baratos, que ya representan más del 30 por ciento del tráfico semanal en la plataforma de enrutamiento OpenRouter. Conviene matizar que «código abierto» significa aquí que los pesos del modelo se pueden descargar y ejecutar gratuitamente en servidores propios, una posibilidad que los modelos cerrados sencillamente no ofrecen.
Qué significa esto para ti: Si utilizas herramientas de IA para programar, es probable que se abaraten discretamente a medida que los proveedores adopten este tipo de distribución: los trabajos sencillos para modelos baratos y los difíciles para modelos caros. Si tienes conocimientos técnicos y vigilas los costes, GLM 5.2 es una señal clara de que la opción de código abierto ya no es la alternativa de menor calidad. Y para todos: ya no domina un único proveedor. Lo sensato es combinar varios.
Fuentes
Fuentes: https://www.databricks.com/blog/benchmarking-coding-agents-databricks-multi-million-line-codebase
GPT-5.6 Sol casi iguala al mejor modelo de IA por un tercio del precio
Las pruebas independientes sitúan al nuevo buque insignia de OpenAI un punto por detrás de Claude Fable 5, con un coste por tarea de aproximadamente un tercio. La guerra de precios de la IA ha llegado a la gama alta.