ARC-AGI-3
Un benchmark rompicapo che verifica se un modello può dedurre regole mai viste prima.
ARC-AGI-3 è la terza generazione di un test della ARC Prize Foundation e non è destinato ad essere memorizzato. Per i puzzle a griglia semplici, la regola deve essere derivata da alcuni esempi che non assomigliano ai dati di addestramento. Le persone li risolvono abbastanza facilmente, ma i modelli non lo fanno per molto tempo.
Nel 2026 i valori sono aumentati notevolmente. Tuttavia, dipendono fortemente dal cablaggio: lo stesso modello ha ottenuto il 7,8 e il 38,3% con diversi contesti di test. ARC Prize richiede quindi una struttura standard, mentre i laboratori discutono sui possibili svantaggi. I risultati mostrano progressi reali, ma non sono sufficienti per classificare accuratamente due modelli.