CourionAI
IT
Newsletter
← Tutte le notizie
models 3 min di lettura

Sakana sostiene che il suo router ora superi persino un modello che non utilizza

Fugu Ultra v1.1 distribuisce ogni domanda tra diversi modelli di punta invece di affidarsi a uno solo. Sakana dichiara guadagni fino a 7,9 punti e una vittoria su Claude Fable 5. Nessuno lo ha ancora verificato e in Europa non è tuttora disponibile.

Illustrazione in stile risograph vista dall’alto di uno scalo ferroviario in cui un binario si divide in cinque, ciascuno terminante davanti a un diverso blocco geometrico

La maggior parte dei prodotti di IA vi chiede di scegliere un modello. Fugu Ultra di Sakana AI pone una domanda diversa: perché sceglierne uno solo? È un router, cioè uno strato posto davanti a diversi modelli di fascia alta che decide quale debba gestire una richiesta e combina i risultati. Sakana ha ora pubblicato la versione 1.1, accompagnata da un’affermazione audace. Secondo l’azienda, il router ottiene fino a 7,9 punti in più rispetto alla versione 1.0, con i maggiori progressi nella programmazione e nelle attività da terminale, e supera Claude Fable 5 di Anthropic anche se Fable 5 non fa parte dei modelli a cui attinge.

Questa affermazione va presa con cautela. Tutti i numeri arrivano dalla stessa Sakana e non esistono ancora test indipendenti. I benchmark pubblicati dall’azienda che ha costruito il prodotto sono l’inizio di una discussione, non un verdetto. L’architettura è descritta in un rapporto tecnico su arXiv, per chi volesse verificare direttamente il ragionamento.

I prezzi restano invariati: 5 dollari per milione di token in ingresso e 30 dollari per milione di token in uscita. I token sono i piccoli frammenti di testo che un modello legge e scrive, e si paga per ciascuno di essi; 30 dollari per l’output è quindi un prezzo elevato. Sakana afferma che servono circa due settimane di addestramento e valutazione prima che un nuovo modello di punta possa essere inserito nel gruppo, ammettendo implicitamente che un router rimane sempre un passo indietro rispetto alla frontiera verso cui instrada. L’aggiornamento aggiunge anche un endpoint compatibile con Claude Code, così gli sviluppatori possono chiamare Fugu direttamente dal terminale, mentre il servizio resta disponibile tramite piattaforme come OpenRouter e Vercel.

L’idea del routing è davvero interessante. Modelli diversi sono bravi in compiti diversi e i loro punti deboli non coincidono perfettamente; in teoria, quindi, un sistema che scelga quello giusto per ogni attività può superare qualsiasi singolo modello. È la proposta dell’«intelligenza collettiva». Il limite riguarda costi e velocità: la prima versione di Fugu aveva ricevuto un’accoglienza tiepida proprio perché, secondo le critiche, consumava molti token, era lenta e non offriva abbastanza da giustificare né l’uno né l’altro. La versione 1.1 è la risposta di Sakana e la sua efficacia dipenderà da test che l’azienda non ha eseguito.

Un dettaglio importante per i lettori di Germania, Austria e Svizzera: Sakana continua a non offrire il servizio nell’UE o nello SEE, citando il GDPR e «normative specifiche dell’UE». Per buona parte del pubblico di questo sito, dunque, è un prodotto di cui si può leggere ma che non si può usare.

Cosa significa per te: Se siete nell’UE, ancora nulla. Se vivete altrove e spendete cifre importanti per le chiamate API, i router sono una categoria da osservare, ma considerate i benchmark dei fornitori come marketing finché qualcuno di indipendente non li avrà replicati. La lezione più generale vale ovunque: l’idea di doversi legare a un solo fornitore di modelli comincia a indebolirsi. Resta da capire se lo strato intermedio che sostituisce quella scelta valga il proprio sovrapprezzo.

Fonti

Fonti: https://sakana.ai/fugu-1-1-claude-code-interface/

Articolo successivo

Un modello aperto tedesco aveva le risposte dei test nei dati di addestramento, e lo sappiamo grazie alla sua apertura

Il consorzio dietro Soofi S ha ammesso che alcune domande del benchmark scientifico GPQA erano finite nel set di addestramento. La comunità se n’è accorta perché i dati erano pubblici. Il team ha eliminato il benchmark e ricalcolato tutti i risultati.

Illustrazione in stile risograph di una beuta da laboratorio che versa liquido su una pila di fogli d’esame vuoti, con una lente d’ingrandimento che rivela una scheda nella pila sbagliata