CourionAI
ES
Boletín
← Todas las noticias
models 3 min de lectura

El nuevo modelo de Sakana no es un modelo, es un despachador de otros modelos

Fugu Max y Fugu Ultra v2, lanzados el 11 de septiembre, no responden a su pregunta por sí solos. Eligen cuál de un conjunto de modelos abiertos y especializados debería hacerlo, y a 2 dólares por millón de tokens de entrada, Fugu Max rebaja el nivel fronterizo a la mitad.

Un podio de director vacío con un abanico de batutas, frente a un semicírculo de atriles vacíos.

Sakana AI lanzó dos nuevos sistemas el 11 de septiembre, Fugu Max y Fugu Ultra v2, y lo interesante es lo que no son. Tampoco hay un solo modelo grande que lea internet y ahora responda a tus preguntas. Cada uno es un orquestador: un modelo cuya habilidad real es decidir qué otro modelo debe encargarse del trabajo que tiene por delante y luego entregar el trabajo, a veces a varios modelos en secuencia, a veces a otra copia de sí mismo. El grupo al que se dirige es en su mayoría modelos abiertos y especializados, es decir, modelos cuyos archivos cualquiera puede descargar y ejecutar.

El precio es el tono. Fugu Max cuesta 2 dólares por millón de tokens de entrada y 6 por millón de salida, aproximadamente entre un 40 y un 60 por ciento por debajo de Sonnet 5 y GPT-5.6 Terra, y Sakana dice que ocupa el mejor lugar en seis de los diez puntos de referencia que informa, incluidos Terminal Bench 2.1 y GPQA Diamond. Fugu Ultra v2 apunta más alto y cuesta más, 5 dólares de entrada y 30 de salida, con indicaciones más largas facturadas a una tarifa más alta, y reporta 48,3 en Chartography y 74,3 en DeepSWE. Sakana señala que alcanza esos números sin Fable 5, Fable 5.1 o GPT-6 Astra en ninguna parte de su grupo, por lo que los resultados provienen de piezas más baratas y bien ensambladas. Ambos se encuentran detrás de una API que habla el mismo formato que la de OpenAI, por lo que el cambio es principalmente un cambio de dirección. Una línea en la letra pequeña merece atención: el enrutamiento en sí consume tokens y se facturan.

¿Qué hay detrás de esto?

La suposición tácita de los últimos tres años ha sido que si quieres una mejor respuesta, compras un modelo más grande. El enrutamiento cuestiona esto. La mayoría de las solicitudes no son difíciles. Resumir un correo electrónico, reescribir un párrafo, corregir un error obvio: un pequeño modelo abierto lo maneja todo perfectamente por una fracción del costo, y solo una minoría de las solicitudes realmente necesitan el costoso modelo de razonamiento. Un enrutador que puede distinguirlos captura la mayor parte de la calidad por una fracción del dinero. El problema es que un enrutador es una cosa más que puede estar mal, de una manera molesta de depurar, porque una respuesta que salió mediocre podría ser una mala respuesta o simplemente una mala elección de quién respondió. Y los números de referencia aquí son los de Sakana, según los puntos de referencia que Sakana seleccionó.

Qué significa esto para ti: Si usas IA a través de una ventana de chat, esto no cambia nada que puedas ver, pero es bueno entenderlo, porque el enrutamiento se está convirtiendo silenciosamente en la forma en que los grandes asistentes también trabajan. Es por eso que el mismo producto a veces suena brillante y otras veces da pereza: no siempre estás hablando del mismo modelo. Si paga por el uso de API, vale la pena probar Fugu Max honestamente en su propia carga de trabajo, ya que un recorte del 40 al 60 por ciento en una factura que ya paga es dinero real. Dos advertencias antes de mover algo importante: realice su propia comparación en lugar de confiar en el gráfico de lanzamiento y agregue los tokens de orquestación a sus cálculos antes de decidir que es más barato.

Fuentes

Fuentes: https://sakana.ai/fugu-max-release/

Siguiente artículo

DeepMind publicó una predicción para cada letra que podrías cambiar en el ADN humano

AlphaGenome Atlas es un conjunto de datos de un petabyte que cubre los 9 mil millones de posibles variantes de ADN de una sola letra, precalculado para que los investigadores puedan buscar una respuesta en lugar de ejecutar un modelo. Es gratuito para investigaciones no comerciales.

Una pared de cajones con catálogos de tarjetas de biblioteca, dos de ellos abiertos y desenrollados en una cinta de doble hélice retorcida.