CourionAI
ES
Boletín
← Todas las noticias
models 3 min de lectura

Sakana afirma que su enrutador ya supera incluso a un modelo que no utiliza

Fugu Ultra v1.1 reparte cada pregunta entre varios modelos de primer nivel en lugar de depender de uno solo. Sakana afirma haber ganado hasta 7,9 puntos y superar a Claude Fable 5. Nadie lo ha verificado todavía y Europa sigue sin poder usarlo.

Ilustración en risografía vista desde arriba de una playa de vías donde un raíl se divide en cinco, cada uno terminado en un bloque geométrico distinto

La mayoría de los productos de IA le piden que elija un modelo. Fugu Ultra de Sakana AI plantea otra pregunta: ¿por qué elegir solo uno? Es un enrutador, una capa situada delante de varios modelos de primer nivel que decide cuál debe atender cada petición y combina los resultados. Sakana acaba de publicar la versión 1.1 acompañada de una afirmación audaz. La empresa asegura que el enrutador obtiene hasta 7,9 puntos más que la versión 1.0, con los mayores avances en programación y tareas de terminal, y que supera a Claude Fable 5 de Anthropic, aunque Fable 5 no forma parte del conjunto de modelos que utiliza.

Conviene tomar esa afirmación con cautela. Todas las cifras proceden de la propia Sakana y todavía no hay pruebas independientes. Los benchmarks publicados por la empresa que creó el producto son un punto de partida para la conversación, no un veredicto. La arquitectura se describe en un informe técnico en arXiv, por si quiere comprobar el razonamiento.

Los precios siguen igual: 5 dólares por millón de tokens de entrada y 30 dólares por millón de tokens de salida. Los tokens son los pequeños fragmentos de texto que un modelo lee y escribe, y se paga por cada uno; 30 dólares por la salida es un precio elevado. Sakana dice que hacen falta unas dos semanas de entrenamiento y evaluación antes de incorporar al conjunto un nuevo modelo de primer nivel, una admisión discreta de que un enrutador siempre va un paso por detrás de la frontera a la que dirige las peticiones. La actualización también añade un endpoint compatible con Claude Code para que los desarrolladores puedan llamar a Fugu directamente desde el terminal, y el servicio sigue disponible a través de plataformas como OpenRouter y Vercel.

La idea del enrutamiento es realmente interesante. Los distintos modelos destacan en tareas diferentes y sus debilidades no coinciden de forma exacta, así que un sistema que seleccione el adecuado para cada trabajo puede, en principio, superar a cualquier modelo por separado. Esa es la propuesta de la «inteligencia colectiva». La pega está en el coste y la velocidad: la primera versión de Fugu tuvo una recepción tibia precisamente porque los críticos consideraron que consumía muchos tokens, funcionaba despacio y no ofrecía lo suficiente para justificar ninguna de las dos cosas. La versión 1.1 es la respuesta de Sakana; que funcione dependerá de pruebas que la empresa no realizó.

Un detalle importante para los lectores de Alemania, Austria y Suiza: Sakana sigue sin prestar servicio en la UE ni en el EEE, alegando el RGPD y «normativas específicas de la UE». Por tanto, para buena parte de la audiencia de este sitio es un producto sobre el que se puede leer, pero que no se puede utilizar.

Qué significa esto para ti: Si está en la UE, de momento nada. Si vive en otro lugar y gasta cantidades importantes en llamadas API, merece la pena seguir los enrutadores como categoría, pero trate los benchmarks de los proveedores como marketing hasta que alguien independiente los reproduzca. La lección más amplia es aplicable en cualquier lugar: empieza a debilitarse la idea de que hay que comprometerse con un único proveedor de modelos. Aún está por ver si la capa intermedia que sustituye esa elección merece su propio sobreprecio.

Fuentes

Fuentes: https://sakana.ai/fugu-1-1-claude-code-interface/

Siguiente artículo

Un modelo abierto alemán contenía respuestas de pruebas en sus datos de entrenamiento, y lo sabemos gracias a su apertura

El consorcio responsable de Soofi S admitió que preguntas del benchmark científico GPQA se filtraron en su conjunto de entrenamiento. La comunidad lo detectó porque los datos eran públicos. El equipo retiró el benchmark y recalculó todos los resultados.

Ilustración en risografía de un matraz de laboratorio derramando líquido sobre una pila de exámenes en blanco, con una lupa que revela una tarjeta en la pila equivocada