La Voce che “Pensa” prima di Parlare
Alibaba Qwen ha alzato l’asticella della conversazione vocale con Qwen-Audio-3.1-Realtime, un modello full-duplex addestrato non solo a rispondere, ma a decidere quando ascoltare, parlare,
È il fiore all’occhiello di una famiglia di cinque modelli audio pensati per rendere le interazioni vocali più naturali, fluide e utili.
Nei test, questa nuova versione ottiene risultati nettamente migliori rispetto alla precedente: capisce meglio domande complesse, gestisce con più efficacia istruzioni articolate e performa in modo più solido quando si passa da una lingua all’altra. Riesce anche a distinguere meglio la voce dell’utente dai rumori di fondo, riducendo le risposte “a caso” quando sente solo confusione ambientale.
Il modello è più lento di alcuni competitor nel fermarsi quando viene interrotto, ma nelle prove con valutatori umani viene giudicato molto positivamente per naturalezza e affidabilità. Può cercare informazioni sul web, eseguire azioni tramite comandi vocali e tenere a mente conversazioni molto lunghe grazie a una memoria estesa. È disponibile solo come servizio online (API), senza scaricare il modello, e costa molto meno della versione precedente: secondo Alibaba, il prezzo è sceso dell’85%.


