MiniMax ha rilasciato i pesi per il suo modello video H3 e un modello aperto ora è in cima alla classifica video per la prima volta
MiniMax ha pubblicato i pesi per H3, un modello video da 33 miliardi di parametri che gestisce insieme testo, immagini, video e audio. L'analisi artificiale lo colloca al primo posto nell'editing video. Due componenti sono rimasti chiusi e la licenza ha un limite alle entrate.
Il laboratorio cinese MiniMax ha pubblicato i pesi per H3, il suo nuovo modello video, e per la prima volta un modello scaricabile gratuitamente si trova in cima alla classifica della generazione video. Il sito di benchmarking Artificial Analysis colloca H3 al primo posto nell’editing video, secondo nel testo in video e terzo nell’immagine in video. Fino ad ora, i leader in ognuna di queste categorie erano prodotti chiusi e a pagamento.
H3 ha 33 miliardi di parametri, un numero piccolo per gli standard attuali e ben alla portata di una singola postazione di lavoro ben attrezzata. I parametri sono i numeri regolabili che un modello apprende durante l’addestramento e rappresentano un indicatore approssimativo delle dimensioni piuttosto che della qualità. Il modello accetta testo, immagini, video e audio come input in un unico passaggio e produce clip da quattro a quindici secondi con audio stereo. Secondo la scheda modello di Hugging Face, un singolo prompt può contenere fino a nove immagini di riferimento, tre clip video e tre clip audio, il che è ciò che rende plausibile la partitura del montaggio: puoi consegnargli una ripresa esistente e dirgli cosa cambiare.
Vale la pena conoscere due avvertimenti prima di emozionarsi. Il modulo con risoluzione 2K non fa parte del rilascio, e nemmeno H3-Context-IR, il pezzo che trasforma il tuo materiale di riferimento e di richiesta in un formato interno strutturato che il modello effettivamente legge. Esegui tu stesso H3 in ComfyUI, una popolare interfaccia basata su nodi per modelli di immagini e video aperti, e raggiungerai il massimo a 768p mentre esegui manualmente la preparazione del contesto utilizzando le guide di prompt pubblicate da MiniMax. La licenza aggiunge un ulteriore limite: l’uso commerciale è consentito solo alle aziende con un fatturato inferiore a 20 milioni di dollari.
Cosa c’è dietro. Open weights significa che il file del modello addestrato è scaricabile ed eseguibile sul tuo hardware, al contrario di un’API in cui invii un prompt al server di qualcun altro. Il video è stato l’ultima roccaforte dei modelli chiusi, perché generare immagini in movimento è costoso da addestrare e servire, e perché l’esposizione al copyright è scomoda. Ciò che MiniMax ha fatto qui è uno schema familiare con una svolta: rilasciare abbastanza per vincere la classifica e la buona volontà dello sviluppatore, trattenere i pezzi che rendono conveniente il prodotto ospitato. Il modulo di risoluzione e il traduttore del contesto sono esattamente le parti che trasformano un modello forte in un prodotto fluido. ByteDance ha rilasciato il suo Seedance 2.5 chiuso lo stesso giorno, con clip di 30 secondi e audio integrato, che ti dice che la corsa commerciale non sta rallentando.
Cosa significa per te: se sei curioso dei video AI ma non vuoi consegnare le riprese a un servizio cloud, questa è la prima versione in cui eseguirlo localmente è una vera opzione piuttosto che un compromesso sulla qualità. Aspettatevi di trascorrere un pomeriggio sulla configurazione e di vivere con 768p. Per tutti gli altri, l’effetto pratico arriva più tardi e indirettamente: i open weights spingono verso il basso il prezzo degli strumenti video ospitati e consentono ai fornitori europei più piccoli di creare offerte senza concedere in licenza un modello di frontiera. Se realizzi video in modo professionale, il limite delle entrate nella licenza è la riga da leggere due volte.
Fonti
Karpathy ha trasformato un paragrafo di Tolkien in una scena 3D per dieci dollari e l'ha definito un vibe check
Andrej Karpathy ha dato a Claude Opus 5 l'apertura de Il Signore degli Anelli e ha ottenuto 5.500 righe di codice browser 3D funzionante in due ore. Sta attento a dire che questo non è un benchmark, che è la parte più utile della storia.