CourionAI
IT
Newsletter
← Tutte le notizie
models 3 min di lettura

Grok 4.7 Pensa più a lungo per gli stessi soldi e vince un benchmark dispari

xAI ha spedito Grok 4.7 lunedì a prezzi invariati di 2 dollari in ingresso e 6 dollari in uscita per milione di token. Presenta il 71% su DeepSWE e un punteggio insolitamente alto su un benchmark legale in cui i rivali collassano.

Una bilancia era tenuta in piano, una piccola pila di monete su un piatto e una torre di ingranaggi sull'altro

xAI ha rilasciato Grok 4.7 lunedì, e il titolo è ciò che non è cambiato: costa lo stesso di Grok 4.6, a 2 dollari per milione di token di input e 6 dollari per milione di token di output, con una variante più veloce al doppio del prezzo per il doppio della velocità. Un token corrisponde a circa tre quarti di una parola, quindi un milione di essi rappresenta un lungo pomeriggio di lavoro per un assistente di codifica. Sotto il cofano si tratta di un modello base più grande addestrato con un ciclo di apprendimento di rinforzo più lungo, ponderato per problemi che richiedono ore anziché minuti.

La tabella di riferimento è un quadro misto, che è più utile di una piazza pulita. Su DeepSWE v1.1, un test di ingegneria del software, Grok 4.7 ottiene il 71,0% ad alto sforzo, rispetto al 65,2 del suo predecessore e appena davanti a Claude Fable 5.1 Max con 70,0, mentre GPT-5.6 Sol Max è in testa con 72,7. Su Terminal-Bench 4.0, che misura il lavoro della riga di comando per più ore, Grok 4.7 quasi raddoppia il punteggio del suo predecessore al 38,0%, ma Fable 5.1 Max è molto più avanti con 57,9. Il numero più strano è l’Harvey Legal Agent Benchmark, dove Grok 4.7 registra il 19,6% contro il 2,5 di GPT-5.6 Sol e il 6,7 di Fable 5.1 Max. Sul ragionamento clinico segue entrambi. xAI afferma inoltre che questo è il suo modello più forte finora nel rifiutare richieste veramente pericolose pur continuando ad aiutare con il lavoro di sicurezza legittimo, lasciando passare il 3,3% delle richieste rischiose nel proprio test HackerBench.

Cosa c’è dietro tutto questo?

Vale la pena tirare fuori due cose. In primo luogo, i prezzi non stanno scendendo tanto quanto la capacità sta aumentando al di sotto di un prezzo fisso, che è il modello in tutto il settore quest’anno e il motivo per cui un modello di sei mesi fa inizia a sembrare costoso anziché diventare più economico. In secondo luogo, la diffusione tra questi parametri di riferimento dice qualcosa di reale: non esiste più un unico “modello migliore”, ci sono modelli che si adattano a lavori particolari. Un punteggio del 19,6% significa comunque che quattro compiti legali su cinque sono falliti, quindi la lettura corretta è che questi agenti sono all’inizio del lavoro professionale, non che Grok abbia risolto il problema legale. Anche i benchmark vengono gestiti dal fornitore, salvo diversa indicazione, e ogni laboratorio sceglie i test dove sembra buono.

Che cosa significa per te: Per l’uso quotidiano della chat, questo cambia molto poco. Se scrivi codice o paghi per l’intelligenza artificiale tramite token, vale la pena provarlo, soprattutto perché si trova all’interno di strumenti che potresti già utilizzare come Cursor e Grok API e perché non cambia nulla nella tua fattura quando cambi. La lezione più generale: quando un modello migliora allo stesso prezzo, il tuo budget esistente ne acquista tranquillamente di più, ma solo se ti trasferisci effettivamente. Controlla ogni pochi mesi su quale modello sono predefiniti i tuoi strumenti.

Fonti

Fonti: https://x.ai/news/grok-4-7

Articolo successivo

Quando gli agenti sono diventati loquaci, i margini di questa startup sono scesi a meno del 50%.

Bloomberg riferisce che la società legale di intelligenza artificiale Harvey ha visto i margini lordi scendere da circa il 50% a meno 50 entro giugno, mentre l'uso dei token è aumentato di venti volte. Si è ripreso costruendo un modello interno sul Kimi K3 aperto di Moonshot.

Un nastro di carta piegato a forma di linea grafica che scende verso il basso e poi si piega verso l'alto su una griglia