Nemotron 3.5 ASR: un modello streaming da 600M parametri parla 40 lingue in tempo reale
Il team Nemotron Speech di NVIDIA ha pubblicato Nemotron 3.5 ASR, un modello di riconoscimento vocale automatico (ASR) streaming da 600 milioni di parametri. Un singolo checkpoint trascrive 40 varietà linguistiche in tempo reale, con punteggiatura e capitalizzazione integrate. I pesi sono aperti su Hugging Face con licenza OpenMDW-1.1.
Come funziona il Cache-Aware FastConformer-RNNT
Il modello ha due componenti principali: un encoder Cache-Aware FastConformer a 24 strati e un decoder RNNT (Recurrent Neural Network Transducer). La novità è l’approccio cache-aware: invece di riprocessare finestre audio sovrapposte come nei buffer streaming tradizionali, il modello memorizza gli stati di self-attention e convoluzione e li riutilizza man mano che arriva nuovo audio. Ogni frame viene elaborato una sola volta, senza sovrapposizioni, riducendo latenza e carico computazionale senza perdere accuratezza.
Latenza configurabile al volo
Un singolo parametro, att_context_size, controlla il compromesso tra latenza e accuratezza. NVIDIA ha mappato cinque impostazioni:
- [56,0] — 80ms (ultra-bassa latenza)
- [56,1] — 160ms
- [56,3] — 320ms
- [56,6] — 560ms
- [56,13] — 1,12 secondi (massima accuratezza)
Lo stesso checkpoint copre tutto lo spettro: si sceglie l’impostazione all’inferenza senza dover riaddestrare il modello.
Lingue e rilevamento automatico
Le 40 varietà linguistiche includono inglese, spagnolo, tedesco, francese, arabo, giapponese, coreano, mandarino, hindi, thailandese e diverse lingue europee e nordiche. Il modello supporta due modalità: impostando target_lang a una lingua nota si ottiene l’accuratezza migliore; con target_lang=auto il modello rileva autonomamente la lingua e, dopo la punteggiatura finale, emette un tag di identificazione. Questo permette di trascrivere flussi multilingua senza componenti separati di language-ID.
Risultati di fine-tuning
I pesi aperti permettono di fare fine-tuning su lingue o domini specifici. NVIDIA ha pubblicato un esempio su greco e bulgaro: addestrando il checkpoint base sullo stesso dataset (Granary, Common Voice, FLEURS) e valutando a 80ms di latenza, il Word Error Rate (WER) è calato del 32% sul greco (da 35 a 24) e del 31% sul bulgaro (da 22 a 15).
Confronto con le alternative
Nemotron 3.5 ASR si distingue per essere open-weight e streaming nativo, a differenza di API chiuse come Deepgram, AssemblyAI o ElevenLabs, e del modello batch Whisper di OpenAI. La latenza configurabile e il singolo checkpoint multilingua semplificano il deployment. NVIDIA raccomanda comunque il suo modello dedicato all’inglese per usi esclusivamente in quella lingua.
