Fundamentos e ferramentas de IA

Resumo do lançamento do GPT-Live: o que a IA de voz ganhou ao abandonar os “turnos”

A OpenAI lançou seu novo modelo de voz, GPT-Live. Se eu tivesse de escolher uma única frase central do anúncio, seria esta: “Uma arquitetura full-duplex que ouve e fala ao mesmo tempo”. Até agora, por mais rápida que fosse, a IA de voz ainda era um walkie-talkie: um lado precisava terminar de falar para o outro poder responder.…

6 min de leitura
Imagem de capa de Resumo do lançamento do GPT-Live: o que a IA de voz ganhou ao abandonar os “turnos”

A OpenAI lançou seu novo modelo de voz, GPT-Live. Se eu tivesse de escolher uma única frase central do anúncio, seria esta: “Uma arquitetura full-duplex que ouve e fala ao mesmo tempo”. Até agora, por mais rápida que fosse, a IA de voz ainda era um walkie-talkie: um lado precisava terminar de falar para o outro poder responder. O GPT-Live transformou essa própria estrutura em um telefone. Veja o que mudou e por que isso é importante sob a perspectiva da arquitetura.

Antes, vamos dar uma rápida olhada em como começa uma nova conversa por voz.

▶ Tela de início da conversa por voz do GPT-Live (OpenAI oficial)

Do modelo em cascata ao baseado em turnos e, depois, ao full-duplex

A arquitetura da IA de voz passou por três etapas.

As primeiras conversas por voz do ChatGPT usavam uma arquitetura em cascata. Um modelo de reconhecimento de fala convertia a voz em texto, um modelo de linguagem gerava a resposta e um modelo de conversão de texto em fala transformava tudo novamente em áudio: um revezamento entre três modelos. Poder conversar por voz com um modelo de fronteira já era algo inédito, mas informações se perdiam a cada passagem entre modelos, e as respostas ficavam lentas. Havia ainda uma limitação estrutural: as nuances da voz desapareciam no momento em que eram convertidas em texto.

Os modelos baseados em turnos, representados pelo Advanced Voice Mode, unificaram tudo isso em um único modelo. Ao processar e gerar voz diretamente, reduziram a latência e tornaram a expressão mais natural. Ainda assim, a conversa continuava sendo processada por turnos. O sistema esperava o usuário terminar de falar antes de responder, e o problema era identificar que ele havia “terminado” pelo silêncio. Uma breve pausa para organizar os pensamentos podia causar uma interrupção, enquanto ruídos ao redor podiam ser confundidos com o fim da conversa.

O GPT-Live abandonou o próprio conceito de turno. Enquanto gera uma resposta, ele continua processando a entrada do usuário e decide várias vezes por segundo se deve falar, continuar ouvindo, pausar por um instante, interromper ou usar uma ferramenta. Essa estrutura tornou possível o backchannel — reagir com “hum” ou “sim” enquanto a outra pessoa fala — e também a interpretação em tempo real. Essa diferença é mais rápida de confirmar ouvindo do que lendo. Vou incluir também dois vídeos de demonstração publicados pela OpenAI.

▶ Demonstração de conversa natural (OpenAI oficial)

▶ Ouvindo e falando ao mesmo tempo: demonstração de interpretação em tempo real (OpenAI oficial)

Além de detectar turnos pelo silêncio: ouvir e falar simultaneamente, com delegação em segundo plano
Além de detectar turnos pelo silêncio: ouvir e falar simultaneamente, com delegação em segundo plano

Segundo design: separando conversa e raciocínio

Tão importante quanto o full duplex é a separação de responsabilidades. O GPT-Live cuida da interação contínua, enquanto perguntas que exigem busca ou raciocínio profundo são encaminhadas a um modelo frontier em segundo plano. No lançamento, essa função é desempenhada pelo GPT-5.5, e a OpenAI informou que ele será substituído quando surgir um novo modelo frontier.

Essa arquitetura é inteligente por dois motivos. O primeiro é a experiência do usuário. O GPT-Live mantém a conversa enquanto tarefas pesadas são executadas em segundo plano. Em vez de silêncio enquanto os resultados da busca carregam, o fluxo da conversa é preservado. O segundo é o caminho de atualização. Como as funções de conversa e raciocínio são separadas, basta trocar o modelo posterior para aumentar a inteligência sem alterar a experiência de voz. É a mesma ideia de separar o orquestrador dos workers em um sistema de agentes.

Os números de desempenho também sustentam essa arquitetura. Segundo a OpenAI, o GPT-Live-1 superou o modo de voz avançado no GPQA, que avalia raciocínio científico em nível especialista; no BrowseComp, que avalia busca na web agêntica; e no τ³-Voice Telecom, que avalia tarefas de voz multiturno em ambientes de suporte de telecomunicações. Em avaliações comparativas de uso real com duração de 5 a 10 minutos, ele também teve maior preferência em troca de turnos, interrupções e fluxo da conversa. A demo abaixo mostra como a delegação em segundo plano funciona na prática.

▶ Respostas mais inteligentes: demo de raciocínio em segundo plano (oficial da OpenAI)

O que pode ser usado e o que ainda não pode

A oferta funciona assim. As versões GPT-Live-1 e GPT-Live-1 mini estão sendo disponibilizadas gradualmente para usuários do mundo todo no iOS, Android e ChatGPT.com. Os planos Go, Plus e Pro usam o GPT-Live-1 por padrão, enquanto o Free usa o mini. Também é possível escolher o nível de raciocínio: Instant para respostas rápidas, ou Medium e High para respostas mais profundas, executando o GPT-5.5 Thinking em segundo plano.

Durante a conversa, temas como clima, ações e esportes são exibidos em cartões visuais. Busca, memória, imagens e upload de arquivos também podem ser usados diretamente nas conversas por voz. A capacidade de se concentrar na voz do usuário em meio ao ruído de fundo também foi aprimorada. Há demos oficiais para os dois recursos.

▶ Demo de cartões visuais durante a conversa (oficial da OpenAI)

▶ Demonstração de conversa em meio a ruído de fundo (oficial da OpenAI)

As medidas de segurança também foram redesenhadas para voz. Como as conversas por voz acontecem em tempo real, há proteções que funcionam enquanto a resposta é emitida, e a conversa pode ser encerrada quando o risco é alto. Conversas sobre autolesão apresentam linhas de apoio em crises; em contas de adolescentes, os pais podem definir se a conversa por voz será permitida e podem receber alertas em situações de alto risco. Também está claro que apenas 9 vozes predefinidas são oferecidas, para impedir a imitação de vozes reais.

Alguns recursos ainda não estão disponíveis. A API para desenvolvedores está «em breve» e, por enquanto, só permite inscrição para receber avisos de lançamento. Conversas por voz combinadas com vídeo ou compartilhamento de tela também ficam de fora logo após o lançamento; se você precisa desses recursos, deve usar o modo de voz existente. A otimização de idiomas se concentra nos principais, então a entonação pode soar estranha em alguns deles.

É quando as mãos estão ocupadas que uma interface de voz mais faz falta
É quando as mãos estão ocupadas que uma interface de voz mais faz falta

Resumo

  • GPT-Live é um modelo de voz full-duplex que escuta e fala ao mesmo tempo. A estranheza do modelo anterior, que identificava a vez de falar pelo silêncio, desapareceu no nível da arquitetura.
  • O GPT-Live cuida da conversa, enquanto o GPT-5.5 em segundo plano cuida da busca e do raciocínio. Com essa separação, é possível atualizar continuamente a inteligência subjacente sem mudar a experiência conversacional.
  • A aplicação no ChatGPT começa agora de forma gradual, mas a API ainda não está disponível. Para quem desenvolve uma interface de voz, vale revisar o design partindo dessa arquitetura, em vez de um pipeline em etapas.

Dizem que 150 milhões de pessoas conversam por voz com o ChatGPT toda semana. À medida que a voz deixa de ser uma entrada auxiliar e se torna a interface principal, eliminar a troca de turnos pode ser um ponto de virada muito maior do que parece.