IA prática

GPT-Live-1: nova IA de voz escuta e fala ao mesmo tempo

O GPT-Live-1 promete conversas mais naturais, aceita interrupções e pode atender chamadas. Entenda o que mudou e para quem a novidade foi criada.

O GPT-Live-1 é um modelo de voz feito para ouvir e falar ao mesmo tempo. Na prática, isso permite uma conversa menos travada: a pessoa pode interromper, hesitar, mudar de ideia ou completar uma frase sem esperar o assistente terminar tudo.

A novidade foi criada para aplicativos, centrais de atendimento, tutores de idioma e outros serviços que usam conversa em tempo real.

O que significa “full duplex”

Assistentes tradicionais costumam trabalhar em etapas: transformam a fala em texto, enviam o texto para outro modelo e depois convertem a resposta novamente em áudio. Cada passagem pode acrescentar atraso e perder parte do ritmo da conversa.

O GPT-Live-1 processa entrada e saída de áudio dentro da mesma camada de voz. Isso ajuda o sistema a perceber interrupções, pausas e pequenas confirmações, como “certo” ou “entendi”, sem responder fora de hora.

As principais novidades

A OpenAI destaca estes pontos:

  • tratamento mais natural de interrupções;
  • controle de tom, ritmo e estilo pelo desenvolvedor;
  • melhor comportamento com silêncio e barulho ao fundo;
  • manutenção de contexto em conversas longas;
  • suporte a telefonia e chamadas;
  • possibilidade de delegar raciocínio e ações a outro modelo.

Essa delegação permite que a voz continue sendo a interface enquanto um modelo de texto ou uma ferramenta executa o trabalho mais pesado nos bastidores.

Onde isso pode aparecer

Atendimento por telefone

Uma empresa pode criar um atendente que entende correções durante a própria frase, consulta um sistema e transfere a conversa para uma pessoa quando necessário.

Estudo de idiomas

Um tutor pode esperar a pessoa pensar, aceitar respostas incompletas e corrigir a pronúncia sem transformar a aula em uma sequência rígida de perguntas e respostas.

Assistentes dentro de aplicativos

Serviços de viagem, entrega ou agendamento podem permitir que o usuário fale normalmente enquanto o aplicativo consulta opções e prepara uma ação.

Isso já está no ChatGPT?

O modelo foi apresentado como produto da API, usado por quem desenvolve aplicativos. A experiência de voz do ChatGPT pode compartilhar tecnologias e comportamentos parecidos, mas o lançamento não significa que o nome GPT-Live-1 aparecerá no seletor de modelos de toda conta.

Quanto custa

No anúncio de lançamento, a OpenAI informou preço de US$ 0,05 por minuto para a camada de voz do GPT-Live-1. O modelo de raciocínio, as ferramentas e a infraestrutura usados junto com ele podem gerar custos adicionais.

Preços de API podem mudar. Antes de criar um serviço, confira a tabela oficial e calcule também telefonia, armazenamento e chamadas de ferramentas.

Cuidados antes de usar uma IA de voz

Uma conversa natural pode fazer o sistema parecer mais seguro do que realmente é. Para decisões importantes, o aplicativo precisa deixar claro quando a pessoa está falando com uma IA e pedir confirmação antes de ações como compra, reserva ou alteração de cadastro.

Também é importante definir:

  • quando a gravação começa e termina;
  • quais dados são guardados;
  • como o usuário pode pedir atendimento humano;
  • quais ações exigem confirmação;
  • como ruído e falhas de transcrição serão tratados.

O GPT-Live-1 mostra uma mudança de direção: a voz deixa de ser apenas leitura de uma resposta e passa a funcionar como uma conversa contínua. Para o usuário final, a diferença mais perceptível deve ser simples — menos espera e menos interrupções erradas.

TRANSPARÊNCIA

Fontes consultadas

  1. Anúncio oficial do GPT-Live-1
  2. Catálogo oficial de modelos da OpenAI

Links e disponibilidade conferidos na data de atualização deste artigo.