Stesso modello, quattro strumenti diversi, tre volte il prezzo: una prova di quanto ti costa l'involucro
Composio ha eseguito DeepSeek V4 Flash tramite Claude Code, Codex, OpenCode e Oh My Pi su 30 attività reali. I tassi di successo erano simili. Il costo variava di quasi 3 volte e la velocità di 2,2 volte, a seconda solo dello strumento che eseguiva il modello.
Ecco un risultato che vale la pena conoscere prima di scegliere uno strumento di codifica AI. La società di strumenti di intelligenza artificiale Composio ha preso un unico modello, DeepSeek V4 Flash, e lo ha eseguito attraverso quattro diversi framework di agenti sulle stesse 30 attività, utilizzando servizi reali come Gmail, GitHub, Slack e Notion. Stesso modello ogni volta. È cambiato solo il software attorno ad esso.
I tassi di successo si sono avvicinati. Oh My Pi ha terminato il maggior numero di attività con 17 su 30, Claude Code e Codex si sono piazzati subito dietro e OpenCode è rimasto leggermente indietro con 14 su 30. Sette delle 30 attività sono state superate o fallite esclusivamente a causa del framework che le eseguiva, il che è di per sé un piccolo avvertimento su quanto tutto ciò sia ripetibile.
Le lacune che contavano davvero erano costi e tempo. OpenCode era il più economico con 0,073 dollari per operazione riuscita. Claude Code era il più costoso con 0,195 dollari, quasi tre volte di più, eppure era anche il più veloce con 122 secondi per attività, contro i 272 secondi del più lento, Oh My Pi. Claude Code è arrivato a questo risultato utilizzando il minor numero di chiamate agli strumenti e generando il minor numero di testo di output, il che è una bella illustrazione del fatto che “efficiente” ed “economico” non sono la stessa parola.
Cosa sta realmente succedendo qui
Una struttura dell’agente, a volte chiamata harness, è il livello tra te e il modello. Decide come viene formulata la tua richiesta, quanta parte della cronologia delle conversazioni viene reinviata in ogni passaggio, quando chiamare uno strumento esterno, quante volte riprovare e quando interrompere. Il modello pensa, ma il framework decide quante volte il modello deve pensare e quanto deve leggere ogni volta. Poiché paghi per unità di testo elaborata, la contabilità rappresenta la maggior parte del tuo conto.
Questo è il motivo per cui confrontare i modelli in una classifica ti dice solo una parte della storia. Un punteggio di benchmark descrive un modello con una configurazione specifica. Il costo e la velocità effettivi dipendono altrettanto dallo strumento in cui lo esegui e questi numeri si muovono in multipli, non in percentuali.
Alcuni giusti avvertimenti. Trenta attività rappresentano un piccolo campione, il test ha utilizzato un modello e le percentuali di successo comprese tra 14 e 17 indicano che circa la metà di tutto ha fallito, indipendentemente dallo strumento. Composio vende strumenti in questo ambito, quindi leggilo come un punto dati utile piuttosto che come un verdetto neutrale. E tutti e quattro i quadri stanno spostando obiettivi che cambieranno entro il mese prossimo.
Cosa significa per te: se utilizzi un agente AI per qualcosa di ripetitivo, lo strumento è una variabile reale, non un dettaglio. Esegui alcune delle tue attività tipiche attraverso due opzioni e confronta la bolletta e l’orologio a muro, perché la differenza è abbastanza grande da essere notata. Se hai appena iniziato, non preoccuparti della scelta, ma attiva qualsiasi visualizzazione dei costi offerta dal tuo strumento. L’abitudine più utile in questo caso è sapere quanto ti costa un’attività prima di eseguirla cento volte.
Fonti
Anthropic allenta il filtro biologico di Claude Fable 5, riducendo le domande bloccate dell'85%.
Fable 5 è stato lanciato con quasi tutte le domande di biologia bloccate. Un classificatore di sicurezza riqualificato ora lascia passare le domande quotidiane sulla salute e sullo studio, riducendo i fallback legati alla biologia di circa l’85%. La virologia professionale e la progettazione dei farmaci restano bloccate.