Microfono e spezzoni di testo trascritto, illustrazione di MAI-Transcribe-1.5

Microsoft AI presenta MAI-Transcribe-1.5: un’ora di audio trascritta in 15 secondi

Microsoft ha annunciato MAI-Transcribe-1.5, la seconda iterazione del suo modello interno di riconoscimento vocale. Il sistema supporta 43 lingue con un unico modello, gestendo accenti, dialetti e ambienti rumorosi. L’obiettivo dichiarato è la trascrizione pronta per carichi di lavoro produttivi.

MAI-Transcribe-1.5 è un modello ASR (automatic speech recognition) sviluppato internamente da Microsoft, non su base di terze parti. È già integrato in Copilot, Teams, GitHub e Dynamics 365 Contact Centre, ed è disponibile sulla piattaforma Foundry.

Accuratezza e lingue supportate

L’accuratezza si misura con il Word-Error-Rate (WER): più è basso, meno errori ci sono per parola trascritta. Microsoft sostiene di avere il miglior WER su FLEURS, il benchmark standard multilingua per la trascrizione. Sul leaderboard Artificial Analysis, il modello ottiene un WER del 2,4%, posizionandosi al terzo posto in una classifica aperta e competitiva. Il quadro è quindi misto: Microsoft rivendica il primo posto su FLEURS e il terzo su Artificial Analysis.

Il supporto linguistico è passato da 25 a 43 lingue. Dieci delle nuove lingue sono dell’Asia meridionale, tra cui bengalese, tamil e telugu. Otto sono europee, come ucraino, greco e catalano. L’espansione è avvenuta senza compromettere l’accuratezza.

Velocità di trascrizione

MAI-Transcribe-1.5 è il leader nel rapporto accuratezza-velocità sul leaderboard Artificial Analysis. È fino a 5 volte più veloce di modelli con accuratezza comparabile. L’effetto è massimo su file audio lunghi: il modello trascrive un’ora di audio in meno di 15 secondi. Microsoft cita speedup fino a 5x rispetto a Gemini 3.1, Scribe v2 e GPT-4o-Transcribe. Rispetto al precedente MAI-Transcribe-1, la scheda Azure indica fino a 5,7x più veloce in inferenza long-form.

Keyword (Entity) Biasing

I trascrittori generici spesso falliscono su parole di dominio specifico: nomi di persone, prodotti, termini medici o acronimi interni. MAI-Transcribe-1.5 introduce il keyword biasing: si fornisce un elenco di parole chiave (fino a 200) e il modello orienta le sue predizioni verso quella lista, senza forzare i match ma usando il contesto condiviso. Microsoft riporta una riduzione del 30% del WER su FLEURS quando il biasing è attivo. Un esempio: senza biasing, nomi come “Shaun”, “Aoife” e “Xochitl” vengono trascritti come “Sean”, “Oif” e “Societal”. Con la lista, il modello li recupera correttamente.

Casi d’uso

  • Sottotitoli per video su piattaforme media e contenuti
  • Strumenti di accessibilità basati su didascalie
  • Trascrizione di riunioni per strumenti di collaborazione come Teams
  • Analisi delle chiamate per contact center e supporto
  • Flussi di lavoro di creazione contenuti che richiedono bozze rapide
  • Agenti vocali che convertono parlato in testo prima di ragionare

In più, il modello include identificazione automatica della lingua: rileva la lingua parlata senza impostazione manuale.

Punti di forza e limiti

Punti di forza: copertura di 43 lingue con un modello singolo; biasing keyword che riduce il WER fino al 30%; trascrizione sub-15 secondi per un’ora di audio; disponibile subito su Azure AI Foundry; robusto su audio rumoroso.

Limitazioni: nessuna diarizzazione (non identifica i parlanti); nessuna API di streaming nativa (uso real-time limitato); diverse affermazioni su accuratezza, velocità e costi sono di prima parte; terzo posto su Artificial Analysis, dietro due concorrenti.

Articoli simili