CourionAI
IT
Newsletter
← Tutte le notizie
agents 3 min di lettura

Stesso modello, quattro strumenti diversi, tre volte il prezzo: una prova di quanto ti costa l'involucro

Composio ha eseguito DeepSeek V4 Flash tramite Claude Code, Codex, OpenCode e Oh My Pi su 30 attività reali. I tassi di successo erano simili. Il costo variava di quasi 3 volte e la velocità di 2,2 volte, a seconda solo dello strumento che eseguiva il modello.

Quattro motori identici montati in quattro telai di forma diversa su un banco da lavoro, ciascuno con il proprio cronometro e una pila di monete di diversa altezza

Ecco un risultato che vale la pena conoscere prima di scegliere uno strumento di codifica AI. La società di strumenti di intelligenza artificiale Composio ha preso un unico modello, DeepSeek V4 Flash, e lo ha eseguito attraverso quattro diversi framework di agenti sulle stesse 30 attività, utilizzando servizi reali come Gmail, GitHub, Slack e Notion. Stesso modello ogni volta. È cambiato solo il software attorno ad esso.

I tassi di successo si sono avvicinati. Oh My Pi ha terminato il maggior numero di attività con 17 su 30, Claude Code e Codex si sono piazzati subito dietro e OpenCode è rimasto leggermente indietro con 14 su 30. Sette delle 30 attività sono state superate o fallite esclusivamente a causa del framework che le eseguiva, il che è di per sé un piccolo avvertimento su quanto tutto ciò sia ripetibile.

Le lacune che contavano davvero erano costi e tempo. OpenCode era il più economico con 0,073 dollari per operazione riuscita. Claude Code era il più costoso con 0,195 dollari, quasi tre volte di più, eppure era anche il più veloce con 122 secondi per attività, contro i 272 secondi del più lento, Oh My Pi. Claude Code è arrivato a questo risultato utilizzando il minor numero di chiamate agli strumenti e generando il minor numero di testo di output, il che è una bella illustrazione del fatto che “efficiente” ed “economico” non sono la stessa parola.

Cosa sta realmente succedendo qui

Una struttura dell’agente, a volte chiamata harness, è il livello tra te e il modello. Decide come viene formulata la tua richiesta, quanta parte della cronologia delle conversazioni viene reinviata in ogni passaggio, quando chiamare uno strumento esterno, quante volte riprovare e quando interrompere. Il modello pensa, ma il framework decide quante volte il modello deve pensare e quanto deve leggere ogni volta. Poiché paghi per unità di testo elaborata, la contabilità rappresenta la maggior parte del tuo conto.

Questo è il motivo per cui confrontare i modelli in una classifica ti dice solo una parte della storia. Un punteggio di benchmark descrive un modello con una configurazione specifica. Il costo e la velocità effettivi dipendono altrettanto dallo strumento in cui lo esegui e questi numeri si muovono in multipli, non in percentuali.

Alcuni giusti avvertimenti. Trenta attività rappresentano un piccolo campione, il test ha utilizzato un modello e le percentuali di successo comprese tra 14 e 17 indicano che circa la metà di tutto ha fallito, indipendentemente dallo strumento. Composio vende strumenti in questo ambito, quindi leggilo come un punto dati utile piuttosto che come un verdetto neutrale. E tutti e quattro i quadri stanno spostando obiettivi che cambieranno entro il mese prossimo.

Cosa significa per te: se utilizzi un agente AI per qualcosa di ripetitivo, lo strumento è una variabile reale, non un dettaglio. Esegui alcune delle tue attività tipiche attraverso due opzioni e confronta la bolletta e l’orologio a muro, perché la differenza è abbastanza grande da essere notata. Se hai appena iniziato, non preoccuparti della scelta, ma attiva qualsiasi visualizzazione dei costi offerta dal tuo strumento. L’abitudine più utile in questo caso è sapere quanto ti costa un’attività prima di eseguirla cento volte.

Fonti

Fonti: https://the-decoder.com/claude-code-is-the-fastest-agent-framework-but-costs-nearly-three-times-more-than-the-cheapest-rival/

Articolo successivo

Anthropic allenta il filtro biologico di Claude Fable 5, riducendo le domande bloccate dell'85%.

Fable 5 è stato lanciato con quasi tutte le domande di biologia bloccate. Un classificatore di sicurezza riqualificato ora lascia passare le domande quotidiane sulla salute e sullo studio, riducendo i fallback legati alla biologia di circa l’85%. La virologia professionale e la progettazione dei farmaci restano bloccate.

Uno schermo a maglie fini sopra una fila di fiasche da laboratorio e capsule di Petri, un piccolo cancello si apre in modo che alcune forme molecolari passino attraverso mentre il resto viene trattenuto