Il nuovo modello di trascrizione di Google ripulisce i tuoi ums e i tuoi cambiamenti mentali
Gemini 3.5 Transcribe gestisce 85 lingue, elimina le parole di riempimento e risolve il problema quando dici martedì e intendi mercoledì. È già presente in Gboard su Android e nell'app Gemini su macOS.
Google ha rilasciato Gemini 3.5 Transcribe, un modello di discorso in testo che fa molto di più che scrivere ciò che hai detto. Rileva e trascrive automaticamente oltre 85 lingue, rimuove le parole di riempimento, formatta il testo da solo e corregge silenziosamente le correzioni automatiche. Di’ “ci vediamo martedì, no, mercoledì” e otterrai mercoledì, non tutto l’inciampo.
I numeri di precisione, misurati dalla società indipendente Artificial Analysis, indicano un tasso di errore delle parole del 4,0% per lo streaming live e del 2,6% per l’audio registrato. Il tasso di errore delle parole è semplicemente la percentuale di parole sbagliate dal modello, quindi un valore inferiore è migliore e il 2,6% corrisponde a circa un errore su quaranta parole. Nel benchmark multilingue FLEURS su una serie di lingue principali le cifre sono più alte, 5,50% in streaming e 5,04% registrato, che è il numero più onesto se non parli inglese. Il tempo necessario per la trascrizione finale è del 70% più veloce rispetto a Chirp 3, il modello che sostituisce. Per l’audio registrato può attribuire il parlato a un massimo di tre oratori con timestamp a livello di parola e tre o più sono ancora sperimentali.
Ci sono due modi per entrare. L’API Live gestisce lo streaming in tempo reale con un ritardo inferiore al secondo per cose come assistenti vocali e didascalie. L’API Interactions gestisce file registrati, riunioni e registri delle chiamate. Entrambi sono in anteprima pubblica tramite Google AI Studio, con un percorso aziendale tramite Gemini Enterprise Agent Platform.
Che cosa sta realmente succedendo qui: i modelli convenzionali di riconoscimento vocale trascrivono il suono in testo e si fermano. Questo è un modello linguistico che esegue la trascrizione, motivo per cui può decidere che “um” non faceva parte della tua frase e che hai cambiato idea a metà frase. Anche questo è il rischio. Un modello che modifica mentre ascolta sta esprimendo giudizi e per un certificato medico, una deposizione legale o un colloquio di ricerca potresti voler preservare gli errori esattamente come sono stati espressi. Google al momento non offre una modalità letterale grezza come opzione del titolo, quindi controlla cosa stai ottenendo prima di creare un flusso di lavoro su di esso.
Che cosa significa per te: se utilizzi Android, hai già alcune di queste funzionalità. La funzione Rambler di Gboard la utilizza per trasformare le parole sconclusionate in testo formattato, in paesi e lingue selezionati, e puoi modificarle tramite voce. L’app Gemini su macOS è disponibile in inglese e sta arrivando il supporto per Chrome, il che significa dettare in qualsiasi campo di testo web. Se costruisci cose, questo è un sostituto plausibile per qualsiasi servizio di trascrizione per cui paghi ora, sebbene sia un’anteprima, quindi trattalo come tale. E se hai evitato la dettatura perché la pulizia dell’output ha richiesto più tempo della digitazione, questo è il reclamo specifico per cui il modello è stato creato per rispondere. Vale la pena fare un test onesto con il tuo accento prima di impegnarti.
Fonti
Fonti: https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-5-transcribe/
Granite 4.2 di IBM è gratuito, sufficientemente piccolo da poter essere eseguito localmente e progettato per pensare innanzitutto
Tre modelli aperti a 3B, 8B e 30B con licenza Apache 2.0, più un modello vocale da 470 milioni di parametri che trascrive tre ore di audio in circa un secondo.