Gradium lancia stt-translate e s2s-translate: traduzione vocale in tempo reale più veloce e accurata di GPT
Gradium ha rilasciato due modelli di traduzione vocale in tempo reale: stt-translate (da voce a testo) e s2s-translate (da voce a voce). Coprono cinque lingue – inglese, francese, tedesco, spagnolo e portoghese – per un totale di 20 coppie di traduzione. Il sistema trasmette i risultati in diretta nel browser e, secondo l’azienda, offre un miglior compromesso tra accuratezza e latenza rispetto a gpt-realtime-translate e gemini-3.5-live-translate. In più, aggiunge il controllo sulla voce di output, inclusa la clonazione, cosa che manca a GPT.
La novità principale è l’architettura: invece del classico stack a tre modelli (riconoscimento vocale → traduzione testuale → sintesi vocale), Gradium usa due soli modelli. stt-translate fonde trascrizione e traduzione in un unico passaggio all’interno del modello audio. Eliminando il modulo intermedio di text-to-text, si riducono latenza e passaggi di consegna. s2s-translate si basa su stt-translate e lo abbina a un modello TTS di Gradium in un unico servizio: si invia l’audio in input via WebSocket e si ricevono in output sia la traccia audio sintetizzata sia il testo tradotto.
I benchmark di Gradium, condotti su un dataset proprietario di conversazioni su temi quotidiani (lavoro, viaggi, meteo), mostrano che stt-translate supera gemini-3.5-live-translate sia su BLEU (accuratezza lessicale) sia su MetricX (qualità semantica percepita). Rispetto a gpt-realtime-translate, Gradium è superiore su BLEU e comparabile su MetricX. La latenza media per s2s-translate è di 3,0 secondi, contro 3,6 secondi di GPT e 2,9 secondi di Gemini. Gradium è più preciso e offre il controllo vocale; Gemini è leggermente più veloce.
Casi d’uso pratici
- Doppiaggio dal vivo e localizzazione: si clona una volta la voce del presentatore e si traduce un keynote francese in spagnolo, mantenendo la timbrica originale.
- Assistenti vocali multilingua: un operatore inglese gestisce una chiamata in tedesco; la risposta viene ritradotta in tedesco in tempo reale.
- Riunioni in tempo reale: l’audio del microfono passa attraverso s2s-translate e ogni partecipante riceve discorso e trascrizione nella propria lingua.
- Accessibilità e sottotitolazione: con stt-translate si generano sottotitoli tradotti in diretta senza produrre audio.
L’audio in input è PCM a 24 kHz, 16 bit con segno, mono. L’output è PCM a 48 kHz, 16 bit con segno, mono. Supportati anche WAV, Opus, mu-law e A-law. Gradium fornisce un SDK Python che espone tre modalità: s2s_realtime per sorgenti live, s2s_stream per iterabili finiti e s2s per file completi. Tutte comunicano con l’endpoint wss://api.gradium.ai/api/speech/s2s.
Punti di forza e limiti
Punti di forza: passaggio unico che elimina un modello dalla catena di latenza; migliore accuratezza BLEU e MetricX rispetto a Gemini; scelta della voce di output e clonazione vocale; singola connessione WebSocket bidirezionale.
Limiti: solo 5 lingue al lancio (20 coppie); Gemini ha una latenza leggermente inferiore (2,9 secondi); MetricX è solo comparabile a GPT, non superiore; i benchmark su dataset proprietario rendono la replica esterna limitata.
