O GPT-Live-1 é um modelo de voz feito para ouvir e falar ao mesmo tempo. Na prática, isso permite uma conversa menos travada: a pessoa pode interromper, hesitar, mudar de ideia ou completar uma frase sem esperar o assistente terminar tudo.
A novidade foi criada para aplicativos, centrais de atendimento, tutores de idioma e outros serviços que usam conversa em tempo real.
O que significa “full duplex”
Assistentes tradicionais costumam trabalhar em etapas: transformam a fala em texto, enviam o texto para outro modelo e depois convertem a resposta novamente em áudio. Cada passagem pode acrescentar atraso e perder parte do ritmo da conversa.
O GPT-Live-1 processa entrada e saída de áudio dentro da mesma camada de voz. Isso ajuda o sistema a perceber interrupções, pausas e pequenas confirmações, como “certo” ou “entendi”, sem responder fora de hora.
As principais novidades
A OpenAI destaca estes pontos:
- tratamento mais natural de interrupções;
- controle de tom, ritmo e estilo pelo desenvolvedor;
- melhor comportamento com silêncio e barulho ao fundo;
- manutenção de contexto em conversas longas;
- suporte a telefonia e chamadas;
- possibilidade de delegar raciocínio e ações a outro modelo.
Essa delegação permite que a voz continue sendo a interface enquanto um modelo de texto ou uma ferramenta executa o trabalho mais pesado nos bastidores.
Onde isso pode aparecer
Atendimento por telefone
Uma empresa pode criar um atendente que entende correções durante a própria frase, consulta um sistema e transfere a conversa para uma pessoa quando necessário.
Estudo de idiomas
Um tutor pode esperar a pessoa pensar, aceitar respostas incompletas e corrigir a pronúncia sem transformar a aula em uma sequência rígida de perguntas e respostas.
Assistentes dentro de aplicativos
Serviços de viagem, entrega ou agendamento podem permitir que o usuário fale normalmente enquanto o aplicativo consulta opções e prepara uma ação.
Isso já está no ChatGPT?
O modelo foi apresentado como produto da API, usado por quem desenvolve aplicativos. A experiência de voz do ChatGPT pode compartilhar tecnologias e comportamentos parecidos, mas o lançamento não significa que o nome GPT-Live-1 aparecerá no seletor de modelos de toda conta.
Quanto custa
No anúncio de lançamento, a OpenAI informou preço de US$ 0,05 por minuto para a camada de voz do GPT-Live-1. O modelo de raciocínio, as ferramentas e a infraestrutura usados junto com ele podem gerar custos adicionais.
Preços de API podem mudar. Antes de criar um serviço, confira a tabela oficial e calcule também telefonia, armazenamento e chamadas de ferramentas.
Cuidados antes de usar uma IA de voz
Uma conversa natural pode fazer o sistema parecer mais seguro do que realmente é. Para decisões importantes, o aplicativo precisa deixar claro quando a pessoa está falando com uma IA e pedir confirmação antes de ações como compra, reserva ou alteração de cadastro.
Também é importante definir:
- quando a gravação começa e termina;
- quais dados são guardados;
- como o usuário pode pedir atendimento humano;
- quais ações exigem confirmação;
- como ruído e falhas de transcrição serão tratados.
O GPT-Live-1 mostra uma mudança de direção: a voz deixa de ser apenas leitura de uma resposta e passa a funcionar como uma conversa contínua. Para o usuário final, a diferença mais perceptível deve ser simples — menos espera e menos interrupções erradas.
TRANSPARÊNCIA
Fontes consultadas
Links e disponibilidade conferidos na data de atualização deste artigo.