CourionAI
IT
Newsletter
← Glossario Termine

ARC-AGI-3

Un benchmark rompicapo che verifica se un modello può dedurre regole mai viste prima.

ARC-AGI-3 è la terza generazione di un test della ARC Prize Foundation e non è destinato ad essere memorizzato. Per i puzzle a griglia semplici, la regola deve essere derivata da alcuni esempi che non assomigliano ai dati di addestramento. Le persone li risolvono abbastanza facilmente, ma i modelli non lo fanno per molto tempo.

Nel 2026 i valori sono aumentati notevolmente. Tuttavia, dipendono fortemente dal cablaggio: lo stesso modello ha ottenuto il 7,8 e il 38,3% con diversi contesti di test. ARC Prize richiede quindi una struttura standard, mentre i laboratori discutono sui possibili svantaggi. I risultati mostrano progressi reali, ma non sono sufficienti per classificare accuratamente due modelli.