Il nuovo modello di Sakana non è un modello, è un dispatcher per altri modelli
Fugu Max e Fugu Ultra v2, rilasciati l'11 settembre, non rispondono da soli alla tua domanda. Scelgono quale tra un pool di modelli aperti e specializzati dovrebbe essere adatto e, con 2 dollari per milione di token di input, Fugu Max riduce della metà il livello di frontiera.
Sakana AI ha rilasciato due nuovi sistemi l’11 settembre, Fugu Max e Fugu Ultra v2, e la parte interessante è cosa non sono. Nemmeno esiste un unico grande modello che legga Internet e ora risponda alle vostre domande. Ciascuno è un orchestratore: un modello la cui vera abilità è decidere quale altro modello dovrebbe gestire il lavoro che ha di fronte, per poi affidare il lavoro, a volte a diversi modelli in sequenza, a volte a un’altra copia di se stesso. Il pool a cui viene indirizzato è costituito principalmente da modelli openweight e specialistici, ovvero modelli i cui file chiunque può scaricare ed eseguire.
Il prezzo è il passo. Fugu Max costa 2 dollari per milione di token di input e 6 per milione di output, circa dal 40 al 60% in meno di Sonnet 5 e GPT-5.6 Terra, e Sakana afferma che si posiziona al meglio in sei dei dieci benchmark riportati, tra cui Terminal Bench 2.1 e GPQA Diamond. Fugu Ultra v2 punta più in alto e costa di più, 5 dollari in entrata e 30 in uscita, con richieste più lunghe fatturate a una tariffa più alta, e riporta 48,3 su Chartography e 74,3 su DeepSWE. Sakana sottolinea che raggiunge quei numeri senza Fable 5, Fable 5.1 o GPT-6 Astra in qualsiasi parte del suo pool, quindi i risultati provengono da parti più economiche assemblate bene. Entrambi si trovano dietro un’API che parla lo stesso formato di OpenAI, quindi il passaggio è principalmente un cambio di indirizzo. Una riga nelle clausole scritte in piccolo merita attenzione: il routing stesso consuma token e questi vengono fatturati.
Cosa c’è dietro tutto questo?
Il presupposto inespresso degli ultimi tre anni è stato che se vuoi una risposta migliore, compri un modello più grande. Il routing mette in discussione questo. La maggior parte delle richieste non sono difficili. Riassumere un’e-mail, riscrivere un paragrafo, correggere un bug evidente: un piccolo modello aperto gestisce tutto perfettamente bene per una frazione del costo, e solo una minoranza di richieste necessita veramente del costoso modello di ragionamento. Un router in grado di distinguere i due cattura la maggior parte della qualità per una frazione del denaro. Il problema è che un router è un’altra cosa che può essere sbagliata, in un modo che è fastidioso da eseguire il debug, perché una risposta che è risultata mediocre potrebbe essere una cattiva risposta o semplicemente una cattiva scelta di chi ha risposto. E i numeri di riferimento qui sono quelli di Sakana, sui parametri di riferimento selezionati da Sakana.
Che cosa significa per te: Se utilizzi l’intelligenza artificiale attraverso una finestra di chat, ciò non cambia nulla che tu possa vedere, ma è una buona cosa da capire, perché il routing sta tranquillamente diventando il modo in cui funzionano anche i grandi assistenti. Ecco perché lo stesso prodotto a volte sembra brillante e a volte sembra pigro: non sempre parli con lo stesso modello. Se paghi per l’utilizzo dell’API, Fugu Max merita un test onesto sul tuo carico di lavoro, poiché un taglio dal 40 al 60% su una fattura che già paghi è denaro reale. Due avvertenze prima di spostare qualcosa di importante: esegui il tuo confronto anziché fidarti del grafico di lancio e aggiungi i token di orchestrazione ai tuoi calcoli prima di decidere che è più economico.
Fonti
DeepMind ha pubblicato una previsione per ogni singola lettera che potresti cambiare nel DNA umano
AlphaGenome Atlas è un set di dati da un petabyte che copre tutti i 9 miliardi di possibili varianti di DNA a lettera singola, precalcolato in modo che i ricercatori possano cercare una risposta invece di eseguire un modello. È gratuito per la ricerca non commerciale.