OpenAI libera GPT-Live-1 na API com voz full-duplex a US$ 0,05 por minuto

A OpenAI libera o GPT-Live-1 na API com voz full-duplex a US$ 0,05 por minuto, cobrado por segundo (model-id gpt-live-1). Free não entra; no Tier 1 há 25 sessões, com delegação a backend e suporte a telefonia. Para o leitor de modelos, o marco é voz conversacional em tempo real na API, ainda sem lista pública de idiomas PT-BR.

Por Lívia, Staff

setembro 13, 2026

GPT-Live-1: modelo de voz full-duplex da OpenAI na API

A OpenAI liberou nesta quinta-feira, 10 de setembro de 2026, o GPT-Live-1 na API, com conversas de voz full-duplex (o modelo ouve e fala ao mesmo tempo). O anúncio saiu no post oficial de lançamento e descreve um único modelo de voz na frente da conversa, em vez da cascata clássica de STT, LLM e TTS. A empresa posiciona a novidade como a mesma linha full-duplex já vista no ChatGPT, agora com controles pensados para apps e fluxos de negócios.

Segundo a OpenAI, o GPT-Live-1 pode delegar raciocínio e uso de ferramentas a um modelo de texto no backend (por exemplo GPT-6 Astra ou um modelo de terceiro). A camada de voz na API custa US$ 0,05 por minuto. A documentação do modelo detalha cobrança por segundo, sem arredondar para o minuto cheio, e deixa claro que chamadas de Responses no backend entram na tabela do modelo configurado.

Claims de desempenho e de clientes (Speak, Hippocratic, Yelp, Intercom Fin, Cognition) aparecem no material de estreia como avaliações iniciais ou depoimentos. Preço, model-id, endpoint Live e limites por tier vêm da docs e do próprio post. Esta reportagem separa os dois blocos.

O que o GPT-Live-1 entrega na API de voz

No post de 10 de setembro, a OpenAI afirmou que o GPT-Live-1 traz ao desenvolvedor conversas full-duplex com mais controle sobre como o agente fala e age. A companhia destacou interrupções mais suaves porque um único modelo raciocina sobre áudio de entrada e de saída juntos, sem os handoffs frágeis da arquitetura encadeada STT-LLM-TTS. A formulação “STT-LLM-TTS” é a usada pela própria OpenAI no anúncio; aqui serve só para nomear o padrão antigo.

A lista de forças citadas pela empresa inclui: tratamento de interrupções; delegação de raciocínio e tool calling ao backend; controle de tom, ritmo e estilo via system prompt; melhor manejo de silêncio e ruído de fundo sem narrar cada passo em voz alta; retenção de contexto em sessões longas; e suporte a telefonia para agentes full-duplex em ligações (reservas de restaurante a suporte ao cliente).

A OpenAI também escreveu que o modelo fornece nativamente transcripts de ASR e texto de resposta. Há, segundo a empresa, compreensão alfanumérica forte e suporte a keyword biasing. Embora não seja um modelo turn-based, o GPT-Live-1 oferece turn detection nativo, o que permite a quem já opera com fronteiras explícitas de turno continuar nesse desenho.

Na documentação pública, o identificador é gpt-live-1. O endpoint Live listado é v1/live/sessions. Modalidades de entrada e saída cobrem áudio e texto. Function calling está suportado. Structured outputs e fine-tuning não. O knowledge cutoff informado é 31 de julho de 2025.

Limites de taxa, na docs, medem-se em sessões concorrentes. Free: Not supported. Tier 1: 25 sessões concorrentes. Tier 2: 50. Tier 3: 200. Tier 4: 300. Tier 5: 500. Quem depende de conta Free não entra nessa superfície de voz Live, pelo texto consultado.

Arquitetura: um modelo de voz e backend à escolha

A OpenAI contrastou o desenho full-duplex com agentes que costuram speech-to-text, um modelo de raciocínio e text-to-speech. Cada handoff, escreveu a empresa, acrescenta latência e abre espaço para perder timing, contexto ou o ritmo natural da conversa. Com o GPT-Live-1, a camada de voz fica em um só modelo; o trabalho mais profundo pode seguir no backend enquanto a conversa continua.

Desenvolvedores escolhem modelos, ferramentas e agent harness atrás da conversa. O post exemplifica combinar o GPT-Live-1 com um modelo mais leve para tarefas de alto volume (agendamento, atualização de pedido) e com Astra para questões complexas de atendimento. A flexibilidade declarada é casar profundidade de raciocínio, velocidade e custo a cada tarefa.

Há trecho de código no anúncio que mostra como uma aplicação passa contexto de conversa ao Codex e devolve a resposta ao GPT-Live-1 via session.commentary.append. Setup de conexão e tratamento completo de delegação ficam omitidos no excerpt. O ponto editorial é a existência de um caminho oficial de delegação, não a reprodução integral do SDK.

A OpenAI citou ainda o OpenAI Presence como outra forma de montar fluxos de voz sobre o GPT-Live-1. Presence, no texto corporativo, usa o modelo para interações de voz em tempo real e mira agentes empresariais que respondem perguntas, resolvem problemas, usam sistemas da empresa, executam ações aprovadas e escalam para humanos quando preciso. Contato comercial via account director, segundo o post.

Claims de desempenho e o que clientes disseram

Na seção de medição full-duplex, a OpenAI afirmou que o GPT-Live-1 melhora o Full Duplex Bench em 30 pontos percentuais em relação ao GPT-Realtime-2.1, com ganhos grandes em latência de turn-taking e comportamento interativo. Trata-se de claim da própria OpenAI em avaliações internas. Pareado com GPT-6 Astra em esforço de raciocínio médio, o conjunto também figurou em primeiro no Tau3, métrica que a empresa descreve como inteligência de agente de voz em tarefas de ponta a ponta.

Figuras do post detalham, no resumo da OpenAI, tarefas faladas de atendimento (aéreo, varejo, telecom), suporte bancário com retrieval e tools, pausas e backchannels, reação a fala de fundo e interrupções, latência até o início da resposta, e tool use a partir de fala com hesitações. Vários painéis notam backend Astra (medium) ou Terra (low). Números e metodologia não foram auditados por esta reportagem.

Speak, segundo early evaluations citadas no post, encontrou que o GPT-Live-1 deu mais tempo ao aprendiz pensar antes da resposta do tutor e cortou interrupções em quase 80% versus sistemas turn-based anteriores. Andrew Hsu, co-fundador e CTO da Speak, foi citado com essa linha de naturalidade nas Live Tutor Lessons.

Hippocratic, no depoimento de Tony Stoyanov (co-fundador e CTO), afirmou que, em comparação com o build em cascata, o GPT-Live-1 simplificou a base de código em 80% e removeu 23 mil linhas. A frase é claim do cliente, não medição independente da ias.news. O texto associa o ganho a conversas em tempo real com pacientes e a mais foco da equipe na experiência (de marcar consulta a navegar o cuidado).

Yelp, na voz de Alex Levy (CTO), disse que GPT-Live-1 no Yelp Host e no Hatch melhorou turn-taking e precisão frente à arquitetura de voz tradicional. Quando o Host usa o modelo para atender ligações (reservas e pedidos de comida), a empresa relatou melhorias materiais nas taxas de handling e frases mais completas e naturais dos chamadores.

“Callers are also speaking fuller, more natural sentences, which tells us the experience on the other end of the phone feels genuinely different.”

Alex Levy, CTO da Yelp, no post OpenAI de 10 de setembro de 2026

Jordan Neill, COO da Intercom (Fin), descreveu o GPT-Live-1 como sinal de que o suporte por voz sai do ritmo stop-start e se aproxima do fluxo de uma ligação telefônica. Clientes podem pausar, interromper e mudar de direção; a entrega de voz avança; e o Fin combina a conversa natural ao sistema proprietário de suporte para o trabalho mais fundo de resolução. Walden Yan, co-fundador e CPO da Cognition, ligou Devin ao GPT-Live-1 e falou em colaboração que começa a parecer trabalho com um colega (falar uma ideia, testar abordagem ou passar tarefa longe do teclado).

Todas as aspas acima são curtas e atribuídas. Claims de quase 80% menos interrupções (Speak), 80% a menos de código e 23K linhas (Hippocratic) e +30 pp no Full Duplex Bench (OpenAI) ficam no campo de avaliação inicial ou depoimento. Não substituem preço nem disponibilidade documentados.

Preço, disponibilidade e vozes

Preço da camada de voz na frente: US$ 0,05 por minuto, disponível na API no dia do anúncio, segundo o post. A documentação confirma US$ 0,05 por minuto, cobrado por segundo, sem arredondar a duração da sessão para o próximo minuto inteiro. Uso do modelo e das tools no backend Responses segue a tabela normal do modelo configurado. Custom voice: contato com sales para elegibilidade e processo de pedido, no texto de lançamento.

Sobre vozes, a OpenAI escreveu que amplia o conjunto além de um pequeno grupo de vozes real-time, com seleção mais larga em sotaques, dialetos e idiomas. Nomes demonstrados no post incluem Quartz, Ripple, Vesper, Willow, Stone, Gleam, Meridian, Bossa, Tempo, Beacon, Delta e Cinder. A empresa disse que continuará a expandir opções de voz e disponibilidade de idiomas nos meses seguintes.

Lista fechada de vozes PT-BR na API não foi publicada no post de 10 de setembro. Portanto, esta edição não inventa catálogo brasileiro para o endpoint Live. Vozes Viola e Rio, quando citadas no ecossistema ChatGPT no Brasil, pertencem ao contexto de produto do app ChatGPT, não a uma lista fechada da API divulgada nesse anúncio. Desenvolvedores que precisam de sotaque ou dialeto específico em português devem validar o que a sessão Live realmente expõe na conta e na docs vigente.

Qualidade subjetiva em português do Brasil não foi medida no material de estreia da API. Telefonia e full-duplex interessam a quem opera call centers, reservas e suporte no Brasil, mas a adequação de sotaque, turn detection e keyword biasing em PT-BR fica como validação local, não como claim do post.

O que o anúncio não cobre e o recado prático

O post não publica tabela completa de idiomas oficiais por voz na API. Também não traz auditoria externa dos benches Full Duplex ou Tau3. Free tier para sessões Live não é suportado na docs consultada. Imagem e vídeo como modalidades do GPT-Live-1 não entram: a ficha lista áudio e texto.

Não foi embutido vídeo inventado nesta reportagem. O anúncio usa demos de sessão e áudios de exemplo (incluindo cenários com ruído de fundo); não há, no material consultado, um único YouTube ID oficial claro para embed obrigatório do lançamento da API. Featured image do pacote editorial fica fora do corpo HTML, conforme padrão da mesa.

Na prática, quem já monta agente de voz em cascata encontra no GPT-Live-1 um caminho documentado para colapsar a camada de fala, manter transcripts e turn detection, e empurrar raciocínio caro para Astra (ou outro backend). O custo fixo da voz (US$ 0,05/min, por segundo) soma-se ao consumo do modelo de texto. Contas Free ficam de fora das sessões concorrentes Live.

Em síntese, a OpenAI colocou o GPT-Live-1 na API em 10 de setembro de 2026 como modelo full-duplex de voz a US$ 0,05 por minuto, com delegação a backend, telefonia, transcripts nativos e expansão de vozes sem lista fechada PT-BR no post. Ganhos de interrupção, redução de código e pontos no Full Duplex Bench são claims de early evals, clientes ou da própria OpenAI. Preço, model-id gpt-live-1, endpoint v1/live/sessions, cutoff de 31 de julho de 2025 e limites por tier vêm da documentação e do anúncio oficiais.