MAI-Transcribe-2-Streaming ha debuttato il 1° ottobre con trascrizioni in tempo reale in 60 lingue e riconoscimento automatico continuo della lingua parlata. Microsoft ha annunciato il primo posto su Artificial Analysis per l’accuratezza dei risultati parziali e definitivi. L’azienda ha inoltre presentato MAI-Voice-2.1 e MAI-Voice-2.1-Flash, dedicati alla generazione vocale.
Uno fra i dati di maggiore interesse riguarda l’attesa prima di ricevere testo utilizzabile. Il modello restituisce le prime ipotesi di trascrizione in poco più di 100 ms dalla ricezione dell’audio, senza aspettare che l’interlocutore completi la frase. Aggiorna poi queste porzioni provvisorie con il contesto successivo, fino a consolidare il risultato.

Per un assistente vocale, disporre di testo durante l’ascolto permette di avviare il ragionamento o richiamare strumenti mentre l’utente sta ancora parlando. Lo stesso meccanismo serve a mostrare sottotitoli e dettature progressivamente. Bisogna però distinguere la comparsa delle prime ipotesi dalla disponibilità della trascrizione definitiva: i 100 ms indicano il primo passaggio, non il completamento dell’intero processo.
Nell’annuncio ufficiale, Microsoft colloca il modello sulla frontiera di Pareto della valutazione accuratezza-latenza di Artificial Analysis, quindi tra le soluzioni con il miglior compromesso fra le due metriche. Per dettatura e sottotitolazione dichiara anche parole visualizzate con una velocità doppia rispetto al concorrente più vicino. Quest’ultimo confronto proviene però da valutazioni interne, e il testo non identifica il rivale.
La sintesi vocale punta su continuità linguistica e tempi ridotti
Il prezzo introduttivo ammonta a 0,54 dollari per ora di audio, con validità fino alla fine del 2026. La scadenza conta per chi deve stimare i costi di un servizio continuativo: si tratta della tariffa di lancio, mentre l’annuncio non specifica quella successiva.
MAI-Voice-2.1 gestisce 23 lingue e 26 varianti locali, mantenendo l’identità della voce quando cambia la lingua. Secondo Microsoft, il modello adatta anche l’accento alla lingua utilizzata. L’obiettivo è consentire, per esempio, a un tutor di passare da una lingua all’altra senza cambiare voce, oppure a un assistente di rispondere nella lingua dell’interlocutore.
La tariffa è di 22 dollari per milione di caratteri. MAI-Voice-2.1-Flash conserva la stessa copertura linguistica e la continuità della voce fra lingue diverse, ma punta ai servizi con molte richieste e vincoli stretti sui tempi di risposta. Il prezzo scende a 15 dollari per milione di caratteri.
Per Flash, Microsoft dichiara la generazione di 45 secondi di audio con una latenza complessiva di 150 ms, oltre a un’inferenza più veloce del 55% e costi inferiori di circa il 60% rispetto a modelli comparabili. Sono confronti da leggere con cautela: l’annuncio non precisa qui quali modelli costituiscano il riferimento, né dettaglia le condizioni di misurazione.

Entrambe le versioni supportano la clonazione vocale nelle lingue disponibili partendo da pochi secondi di registrazione. Microsoft dichiara inoltre protezioni integrate legate al consenso per contrastare gli abusi. L’abbinamento fra trascrizione progressiva e sintesi rapida punta a lasciare agli agenti più tempo per elaborare le richieste, utilizzare strumenti e verificare le risposte.
I tre modelli sono accessibili attraverso Microsoft Foundry, MAI Playground, Vercel e Azure Voice Live; il supporto LiveKit è annunciato come prossimo. OpenRouter offre i due modelli vocali. Per mostrare il funzionamento congiunto, Microsoft ha realizzato Chatter, una dimostrazione di agente conversazionale disponibile nel MAI Playground.