OpenAI ha ufficialmente introdotto GPT-Live, la nuova frontiera delle interazioni vocali tra uomini e macchine. Si tratta di un salto tecnologico significativo rispetto alle soluzioni precedenti: il sistema consente dialoghi naturali e scorrevoli, proprio come accade tra due persone che conversano senza interruzioni. La novità più rilevante risiede nell'architettura full-duplex, che permette all'intelligenza artificiale di ascoltare e rispondere simultaneamente, eliminando così i tempi morti che caratterizzavano le versioni precedenti.
Per comprendere il valore della novità, vale la pena ripercorrere l'evoluzione della tecnologia vocale di OpenAI. La versione iniziale di ChatGPT Voice si basava su un sistema a tre stadi: prima convertiva la voce in testo, poi elaborava la risposta tramite il modello linguistico, infine trasformava il testo in audio. Questo processo comportava perdite informative e risposte lente e poco naturali. L'Advanced Voice Mode rappresentò un primo passo avanti, riducendo la latenza attraverso un singolo modello, ma manteneva un limite fondamentale: poteva rispondere solo dopo una pausa dell'utente, con il rischio di interruzioni inopportune. GPT-Live supera definitivamente questi ostacoli, elaborando contemporaneamente l'input ricevuto e l'output generato.
Il nuovo sistema si articola su due versioni, pensate per platee diverse. GPT-Live-1 è riservato agli abbonati Plus, Pro e Go di ChatGPT, mentre GPT-Live-1 mini rappresenta l'opzione gratuita disponibile a tutti gli utenti. Entrambe le versioni sono accessibili sia dalla piattaforma web che dalle applicazioni mobile per Android e iOS. Gli utenti potranno personalizzare il livello di ragionamento scegliendo tra modalità istantanea, media e veloce, nonché selezionare la lingua preferita e una tra nove voci diverse. Durante le conversazioni, GPT-Live può delegare compiti più complessi a GPT-5.5 in background, come ricerche sul web o operazioni di ragionamento articolato. La piattaforma supporta inoltre input multimediali: testo, immagini e documenti possono essere condivisi durante il dialogo, mentre la visualizzazione mediante card integrate permette di ottenere risultati sportivi, quotazioni azionarie e previsioni meteo direttamente nella conversazione.
OpenAI ha implementato una suite robusta di protezioni di sicurezza per garantire un utilizzo consapevole della tecnologia. Il sistema identifica argomenti potenzialmente rischiosi e risponde in modo appropriato o interrompe completamente l'interazione quando necessario. I genitori hanno la possibilità di limitare l'accesso a ChatGPT Voice attraverso controlli parentali dedicati. Ulteriori filtri impediscono che l'intelligenza artificiale imiti le voci di personalità reali, una misura importante per contrastare potenziali usi fraudolenti.
Tuttavia, la nuova generazione di modelli vocali presenta ancora alcuni limiti tecnici. La condivisione di schermo e di video non è attualmente supportata, restando disponibile esclusivamente tramite Advanced Voice Mode. Nonostante questa limitazione, OpenAI considera GPT-Live una pietra miliare nell'evoluzione dell'interazione uomo-intelligenza artificiale, aprendo nuove possibilità per applicazioni che richiedono dialoghi fluidi e naturali.