OpenAI lança GPT-Live-1 API, voz full duplex a $0,05/min
GPT-Live-1 chega à API com conversas naturais em full duplex, interrupções suaves e delegação para modelos de backend, cobrando $0,05 por minuto de sessão, faturado por segundo.
Danilo Gato
Autor
Introdução
A OpenAI lançou o GPT-Live-1 na API com preço de $0,05 por minuto para a camada de voz, faturado por segundo. O modelo de voz full duplex permite falar e ouvir ao mesmo tempo, com interrupções naturais e controle de tom e ritmo, dando aos desenvolvedores uma base mais simples para experiências de voz em tempo real. (openai.com)
A chegada do GPT-Live-1 API importa por dois motivos práticos. Primeiro, substitui cadeias frágeis de STT, LLM e TTS por um único modelo de voz que entende e gera fala nativamente, reduzindo latência e erros de timing. Segundo, habilita delegação de raciocínio e ações a modelos de backend, mantendo a conversa fluindo enquanto o “trabalho pesado” acontece nos bastidores. (openai.com)
O artigo aprofunda o que muda com o full duplex, como funciona a cobrança, o que dizem as métricas e clientes, além de caminhos práticos para implementar, otimizar custo e qualidade.
O que é full duplex na prática e por que muda o jogo
Full duplex não é apenas “responder mais rápido”. É capacidade de ouvir e falar simultaneamente, aceitar interrupções no meio de uma frase, reconhecer pausas curtas e manter o ritmo natural da fala. Em vez de aguardar turnos rígidos, o agente processa backchannels, risos e hesitações como sinais legítimos de conversação. (openai.com)
Na arquitetura tradicional, cada etapa, transcrever, raciocinar e sintetizar voz, adiciona latência e chances de perder contexto. O GPT-Live-1 concentra essa inteligência conversacional em um único modelo de voz, preservando detalhes que costumavam se perder na passagem texto, reduzindo tempo de resposta e erros de timing. (openai.com)
Do ponto de vista de UX, isso se traduz em conversas mais naturais. Em avaliações internas e pilotos com clientes, o modelo foi associado a quedas expressivas em interrupções indevidas durante pausas de pensamento, além de maior fluidez no “cortar a fala” do assistente quando o usuário decide mudar de direção. (openai.com)
Preço e modelo de cobrança, o que significa $0,05 por minuto
O GPT-Live-1 custa $0,05 por minuto de sessão, medido por segundo, sem arredondar para o minuto cheio. Isso cobre a camada de voz de entrada e saída. Qualquer raciocínio delegado e chamadas de ferramentas por trás da conversa são cobrados separadamente conforme o modelo de backend escolhido. O endpoint principal é v1/live/sessions, com limites de concorrência por tier e sem suporte a free tier. (developers.openai.com)
Na documentação, o conhecimento padrão do GPT-Live-1 aparece com cutoff em 31 de julho de 2025, o que orienta expectativas sobre atualização de fatos recentes quando a sessão delega para um modelo de backend ou ferramenta de busca. Em outras palavras, o front de voz gerencia a conversação, enquanto a precisão factual e ações se apoiam nas ferramentas e modelos atrás dele. (developers.openai.com)
Para planejamento financeiro, a regra prática é separar “custos de conversa” dos “custos de raciocínio”. O primeiro é linear no tempo da sessão de voz. O segundo varia com o modelo e o volume de chamadas no backend. A própria página do modelo deixa claro que a duração da sessão é faturada por segundo e que as Responses no backend usam a tabela de preços do modelo configurado. (developers.openai.com)
Arquitetura, delegação e como isso simplifica seu stack
O pulo de valor do GPT-Live-1 está em duas frentes. Primeiro, simplifica o front de voz. Segundo, dá mais controle para orquestrar raciocínio no backend. Casos reais reportados pela OpenAI mostram redução de complexidade na base de código, com relatos de simplificação de 80 por cento e remoção de dezenas de milhares de linhas quando se sai do pipeline cascata para o modelo único de voz. (openai.com)
A delegação funciona assim, a conversa acontece com o GPT-Live-1, porém o aplicativo define quando e como envolver um modelo de backend para resolver tarefas, buscar dados ou acionar sistemas. O blog de lançamento ilustra a integração com agentes e ferramentas, além de mencionar conectores empresariais via OpenAI Presence para workflows de atendimento e operações internas. (openai.com)
Do lado técnico, a documentação de “Getting started with GPT-Live” descreve a sessão como a unidade básica de cobrança e controle. Há conexões via WebRTC para o browser, WebSockets para integrações de servidor e guias para telephony e SIP. A orientação operacional destaca que sessões de voz são cobradas por duração e que o uso do backend é contabilizado separadamente. (developers.openai.com)
Além do endpoint v1/live/sessions, o catálogo do modelo lista explicitamente as rotas suportadas e os limites por sessões concorrentes por tier, do Tier 1 com 25 sessões até Tier 5 com 500. Isso ajuda a estimar throughput de call centers, bots de suporte e tutores de voz com picos de tráfego. (developers.openai.com)
Métricas, latência e o diferencial do full duplex
A OpenAI reporta ganhos substanciais em benchmarks próprios de conversação em tempo real. No comparativo interno, o GPT-Live-1 melhora em cerca de 30 pontos percentuais o desempenho no Full Duplex Bench em relação ao GPT-Realtime-2.1, com destaque para latência de turn taking e comportamento interativo. Essa vantagem se mantém mesmo quando o raciocínio é delegado a um modelo de backend durante a conversa. (openai.com)
O post técnico sobre como a equipe construiu o sistema em seis meses explica por que treinar o modelo para entender e gerar fala de forma nativa preserva nuances que se perdiam com transcrição e síntese, e como a infraestrutura de streaming direto de áudio e vídeo reduziu latência e variância. O efeito prático é resposta mais fluida, além da possibilidade de ser interrompido naturalmente. (openai.com)
Para separar atributos de “voz natural” de “capacidade de raciocínio”, vale lembrar do histórico do GPT-4o, cujo cartão de sistema detalha como a modalidade de voz evoluiu em segurança e qualidade. Embora o GPT-Live-1 seja outra linha de modelos, o material do 4o contextualiza a importância de medições específicas para áudio e fala em tempo real. (cdn.openai.com)
O que os clientes relatam e onde usar primeiro
Os depoimentos alinhados ao lançamento destacam ganhos em call handling e naturalidade de fala. Yelp cita melhorias nas taxas de atendimento ao migrar para o GPT-Live-1, usuários passaram a falar frases mais completas, indício de experiência mais natural. A Speak, em tutoria de idiomas, registrou quase 80 por cento menos interrupções durante pausas de pensamento, quando comparado a sistemas de turno fixo. (openai.com)

Isso endossa os primeiros alvos de implementação, atendimento telefônico, reservas, pedidos, triagem de suporte e tutoria. Segmentos como saúde e serviços financeiros se beneficiam do full duplex quando o assistente precisa pedir confirmação, interromper de forma educada para checar um dado ou manter a conversa enquanto uma verificação de conta roda no backend.
Em contextos sensíveis, convém avaliar limites conhecidos de AIs de voz em tempo real. Pesquisas independentes apontam que sistemas comerciais de voz ainda podem se comportar como se estivessem reduzindo fala a simples transcrições em tarefas que dependem muito de prosódia e emoção. Esse alerta sugere prudência em usos que dependem fortemente de tom e subtexto. (arxiv.org)
Segurança, marcas d’água e governança de conteúdo
O material público de segurança lista GPT-Live-1 e GPT-Live-1 mini como modelos de uma nova geração voltada a conversas naturais com full duplex, com diretrizes de implantação e mitigação de riscos. Para quem precisa de validações de conformidade e avaliação de riscos, o System Card e o Deployment Safety Hub são referências diretas. (deploymentsafety.openai.com)
Outro ponto que amadureceu é a marca d’água de áudio. A OpenAI comunicou suporte a SynthID em áudio gerado com GPT-Live, tanto no ChatGPT Voice quanto na API, reforçando rastreabilidade e transparência de conteúdo de voz. Para áreas reguladas e mídia, isso ajuda auditorias e fluxos antifraude. (openai.com)
Como começar, atalhos técnicos e boas práticas
- Conexão, use WebRTC para front-end web, WebSockets para integrações servidor a servidor e siga as recomendações específicas para telefonia e SIP quando integrar com provedores. (developers.openai.com)
- Sessão, trate a sessão como a unidade de cobrança e observabilidade, aguarde
session.started, transmita áudio, e encerre explicitamente para consolidar o uso. (developers.openai.com) - Delegação, defina um prompt de conversação que instrua quando chamar o backend, por exemplo, para consultas de dados atuais, e retorne a resposta final ao Live. O exemplo oficial com agentes e ferramentas ilustra esse fluxo. (openai.com)
- Custos, separe o orçamento de voz do orçamento de raciocínio. A camada de voz custa $0,05 por minuto, por segundo. O backend segue a tabela do modelo e ferramentas usadas. Monitore sessões concorrentes pelo tier da sua conta. (developers.openai.com)
- UX, foque em interrupções elegantes, turn detection e sinais paralinguísticos como hums e pausas. O Live trata melhor ruído de fundo e silêncio para não “narrar” cada etapa, algo que reduz fadiga do usuário. (openai.com)
Benchmarks e contexto com outras linhas de modelos de voz
Historicamente, a linha GPT-4o ajudou a mostrar o salto de qualidade quando a voz deixa de ser apenas pipeline de STT e TTS colados, e passa a ser tratada como modalidade nativa. Os system cards do 4o detalham ganhos e limitações em áudio e texto, úteis para quem precisa embasar decisões de risco, governança e roadmap de voz. (cdn.openai.com)
Relatos da comunidade ao longo de 2024 e 2025 compararam APIs de voz em tempo real, discutindo qualidade percebida e trade-offs. Essas discussões ajudam a calibrar expectativas e a projetar testes A/B realistas quando se adota uma nova pilha. Embora anedóticas, elas mostram como latência, naturalidade e robustez a interrupções pesam tanto quanto métricas clássicas de acurácia. (community.openai.com)
Aplicações prioritárias por setor
- Suporte e contact centers, roteamento e resolução de tickets com delegação a modelos de raciocínio, mantendo conversa natural enquanto o backend consulta bases e executa ações. A preferência por full duplex tende a reduzir monólogos do bot e encorajar fala mais natural do cliente. (openai.com)
- Educação e tutoria, experiências mais próximas de um tutor humano, que sabe quando falar e quando dar espaço ao aluno. Resultados iniciais mostram cortes grandes em interrupções indevidas durante pausas. (openai.com)
- Serviços financeiros, autenticação guiada por voz, recuperação de informações e execução de tarefas com compliance, suportadas por marca d’água de áudio e diretrizes de implantação segura. (deploymentsafety.openai.com)
- Saúde, triagem, agendamento e navegação do cuidado com conversas naturais e menos engenharia sob medida, um ganho colateral da simplificação da arquitetura. (openai.com)
Limitações atuais e o que observar na adoção
- Modalidades, o GPT-Live-1 é focado em áudio, não suporta imagem nem vídeo como entrada ou saída, então experiências multimodais exigem combinação com outros componentes. (developers.openai.com)
- Conhecimento do modelo de voz, com cutoff em 31 de julho de 2025, o que reforça a importância de delegar tarefas factuais e atualizadas para um modelo de backend ou ferramenta de busca. (developers.openai.com)
- Governança e segurança, seguir as orientações do Deployment Safety Hub e testar riscos específicos do domínio, especialmente em cenários onde tom de voz e emoção carregam significado crítico. (deploymentsafety.openai.com)
Conclusão
A GPT-Live-1 API coloca voz full duplex no centro do stack, simplifica o front, melhora a experiência de interrupção e dá caminho claro para delegar raciocínio. Com preço de $0,05 por minuto, faturado por segundo, o modelo oferece previsibilidade e separa de forma limpa o custo de conversa do custo de raciocínio, útil para orçamentos e escalonamento. (openai.com)
O momento é propício para pilotos em atendimento, tutoria e telefonia, medindo métricas de latência de turn taking, taxa de interrupções indevidas e satisfação de conversas. Com marcas d’água em áudio e diretrizes de implantação, a tecnologia avança não só em naturalidade, mas também em rastreabilidade e governança, dois pilares essenciais para levar voz em tempo real do protótipo para a operação. (openai.com)
Leia também
Google lança app Gemini no Windows com atalho Alt+Espaço
O app Gemini para Windows foi lançado em 10 de setembro de 2026 e pode ser aberto com Alt+Espaço, em qualquer tela. O acesso rápido, a integração com Gmail e Drive e o agente Gemini Spark elevam o uso de IA no desktop. Entenda prós e contras, impacto frente ao Copilot, pontos de atenção para TI e como tirar vantagem prática no dia a dia.
8 min de leituraTecnologiaDeepSeek lança V4.1-Flash, MoE 552B multimodal e API mais barata
DeepSeek V4.1-Flash estreia com 552B de parâmetros em arquitetura MoE, suporte multimodal nativo e contexto de até 1M de tokens. Segundo a empresa, o modelo atende mais usuários com menor custo de serviço e substitui temporariamente versões anteriores na API. Veja o que muda na prática, os números, arquitetura e implicações para times de produto e engenharia.
9 min de leituraTecnologiaApple Watch Series 12 estreia Siri sempre ativa com recaps de áudio por IA por 399 dólares
O Apple Watch Series 12 chega com Siri sempre ativa, Audio Intelligence com Live Rewind e Siri Recap, novo chip S11, melhorias de saúde e opções em alumínio, titânio e cerâmica. Preço inicial de 399 dólares, pré-venda já liberada e lançamento em 18 de setembro. Entenda o que muda na prática, inclusive requisitos, privacidade e o que esperar do watchOS 27.
11 min de leituraSmartphonesApple revela iPhone Duo, primeiro iPhone dobrável 7,6"
O iPhone Duo estreia a categoria de dobráveis da Apple com tela interna de 7,6 polegadas, iOS 27 otimizado para multitarefa e Apple Intelligence, além de eSIM global e Touch ID na lateral. Preço a partir de 1.999 dólares, pré‑venda em 16 de outubro e disponibilidade em 23 de outubro, segundo a Apple.
11 min de leitura