CourionAI
IT
Newsletter
← Tutte le notizie
open-source 3 min di lettura

K2 Horizon fornisce sei modelli aperti e con essi i dati di addestramento

L'Institute of Foundation Models di Abu Dhabi ha rilasciato sei modelli con parametri da 0,9B a 375B il 3 settembre sotto Apache 2.0, pubblicando pesi, codice, dati di addestramento e metodologia. Il più piccolo è pensato per funzionare con un orologio.

Sei picchi montuosi che si innalzano in dimensioni ascendenti, ciascuno disegnato come un wireframe trasparente in modo che la struttura interna sia visibile

Mentre la settimana scorsa quattro laboratori commerciali spedivano modelli di frontiera, un istituto di ricerca di Abu Dhabi ne ha rilasciati sei e ha fatto qualcosa che i grandi laboratori non fanno: ha pubblicato i dati di addestramento insieme a loro. L’Institute of Foundation Models, parte dell’Università di Intelligenza Artificiale Mohamed bin Zayed, ha lanciato K2 Horizon il 3 settembre con la licenza Apache 2.0, che è permissiva quanto lo sono le licenze software.

La flotta comprende da 0,9 miliardi a 375 miliardi di parametri. I parametri sono i numeri modificabili all’interno di un modello e un numero maggiore di essi solitamente significa più capacità e più hardware necessari per eseguirlo. Esistono modelli densi a 0,9B, 3,7B, 7B e 32B, più due modelli sparsi di esperti a 36B con 4B attivi e 375B con 23B attivi. Sparse significa che solo una frazione del modello si attiva per ogni determinata domanda, quindi un modello 375B può costare più vicino a uno 23B da eseguire. IFM punta il modello 0.9B su orologi e occhiali, 3.7B e 7B su telefoni, 32B e 36B su laptop e server locali e l’ammiraglia 375B per il lavoro aziendale. IFM afferma che i modelli 0.9B, 3.7B e 7B rappresentano un nuovo stato dell’arte nelle loro dimensioni. Due note tecniche dal rilascio: un metodo di “distillazione per diffusione” che genera blocchi di token in parallelo per una velocità di circa 3 volte e un’architettura mista di valore-attenzione intesa a migliorare il ragionamento senza calcoli aggiuntivi.

Perché “completamente aperto” non è la stessa cosa di “pesi aperti”. La maggior parte dei modelli che vengono chiamati aperti, inclusi Llama e DeepSeek, pubblicano i pesi: i numeri finiti necessari per eseguire l’operazione. Non pubblicano ciò che è stato coinvolto nella formazione, il che significa che puoi utilizzare il modello ma non puoi controllarlo, riprodurlo o studiare perché si comporta in un certo modo. Il fondatore dell’IFM Eric Xing ha posto la distinzione direttamente, sostenendo che la scienza funziona quando gli altri possono vedere i dati, seguire il metodo e riprodurre il risultato. Se i modelli reggeranno rispetto alle migliori versioni a peso aperto è una questione da sottoporre a test indipendenti nelle prossime settimane, e i benchmark auto-riferiti da qualsiasi laboratorio meritano lo stesso scetticismo. Ma l’affermazione della trasparenza è verificabile in un modo in cui i punteggi dei benchmark non lo sono, ed è proprio questo il punto.

Cosa significa per te. Se desideri eseguire un modello compatibile sul tuo computer anziché inviare il testo al server di qualcun altro, i modelli 7B e 32B sono quelli da considerare e sono su Hugging Face con supporto vLLM, SGLang e Ollama oltre alle build GGUF, che è il formato richiesto dalla maggior parte degli strumenti desktop. Un modello 7B funziona comodamente su un laptop decente. Se stai studiando o insegnando, i dati di formazione pubblicati rendono questo il modello di famiglia serio più ispezionabile disponibile in questo momento, il che è importante se la tua domanda è “perché ha detto quello” piuttosto che “cosa ha detto”. Per tutti gli altri: oggi non cambia nulla, ma un modello completamente riproducibile su questa scala offre ai ricercatori uno strumento che chiedono dal 2023.

Fonti

Fonti: https://ifm.ai/k2/press-release/

Articolo successivo

Il livello di modello più economico di Meta costa 21 volte meno e si addestra secondo le tue richieste

Meta ha rilasciato Muse Spark 1.3 il 2 settembre a un prezzo standard invariato, insieme a un livello di contributore di 0,10 dollari per milione di token di input in cui Meta utilizza i tuoi suggerimenti e output per migliorare i suoi prodotti.

Una bilancia a due piatti con monete ammucchiate su un lato e fogli di carta sciolti inclinati sull'altro lato