Google libera Gemini 3.8 Live e Extended Thinking na Live API

O Google libera em 15/09/2026 o Gemini 3.8 Live e o Gemini 3.8 Live Extended Thinking na Live API, com free tier sem custo e paid por token ou minuto (áudio input US$ 3,00 ou US$ 0,005/min; output US$ 12,00 ou US$ 0,018/min). A oferta inclui Search Live, integração Workspace (Docs, Gmail e Keep conforme o plano) e AI Studio; o Extended Thinking traz claims de bench atribuídos ao Google. Para o leitor de modelos, o marco é voz ao vivo na API com opção de raciocínio estendido, já com preço público.

Por Lívia, Staff

setembro 18, 2026

Gemini 3.8 Live: modelos de diálogo ao vivo do Google na Live API

O Google apresentou em 15 de setembro de 2026 o Gemini 3.8 Live e o Gemini 3.8 Live Extended Thinking, dois modelos de diálogo ao vivo pensados para agentes de voz e conversas multimodais. O anúncio saiu no blog The Keyword, com ficha técnica na documentação do Gemini 3.8 Live, na página do Extended Thinking e na model card Gemini 3.8 Audio da DeepMind (Published 15 September 2026).

Na tabela de preços da Gemini API, a faixa paid tier dos três IDs Live listados juntos (gemini-3.8-live, gemini-3.8-live-extended-thinking e gemini-3.1-flash-live-preview) cobra, por 1 milhão de tokens em USD: entrada a US$ 0,75 (texto), US$ 3,00 ou US$ 0,005/min (áudio) e US$ 1,00 ou US$ 0,002/min (imagem/vídeo); saída (incluindo thinking tokens) a US$ 4,50 (texto) e US$ 12,00 ou US$ 0,018/min (áudio). O free tier desses modelos aparece como sem custo (free of charge) na mesma página, em contraste com o GPT-Live-1 da OpenAI (lançado por volta de 10 de setembro de 2026), cuja docs da API marca Free como Not supported e cobra a camada de voz a US$ 0,05/min full-duplex.

Esta reportagem separa (a) preço, IDs, limites de tokens, capacidades e disponibilidade documentados pelo Google da (b) preferência de usuários e benches reivindicados no post corporativo. Qualidade subjetiva em português do Brasil não foi medida no material consultado.

O rollout, segundo o Google, começou “starting today” no dia do post. Desenvolvedores passam pela Live API e pelo Google AI Studio; empresas entram em private preview no Gemini Enterprise; usuários finais veem Search Live, Gemini Live e superfícies do Workspace conforme o plano.

O que o Gemini 3.8 Live muda na Live API

Na documentação, gemini-3.8-live é o default para a maioria das experiências de agente de voz de baixa latência e para diálogo em tempo real sem delays induzidos por reasoning. gemini-3.8-live-extended-thinking é o modelo de áudio-para-áudio de alto raciocínio recomendado quando a tarefa exige reasoning de fundo e tool calls assíncronos enquanto o áudio continua a streamar.

Entradas: text, images, audio e video. Saídas: text e audio. A docs da API informa limites de 131.072 tokens de input e 65.536 de output. A model card fala em até 128K de entrada e 64K de saída; esta edição prefere os números da API e registra a variação da card. Update das docs: September 2026. Knowledge cutoff na model card: January 2025. Base declarada: Gemini 3 Pro.

Capacidades suportadas na ficha da API: Live API, function calling, search grounding e thinking (no Live, interleaved reasoning; no Extended Thinking, thinking configurável). Não suportados: caching, code execution, file search, structured outputs, image generation, grounding com Google Maps e Batch API.

No blog, o Google atribuiu ao Gemini 3.8 Live contexto visual near real-time, transição automática entre 97 idiomas mid-conversation, e execução de tools e API calls em background sem interromper a fala. A overview genérica da Live API ainda lista 70 idiomas; o anúncio cita 97. Esta edição não inventa métrica específica de PT-BR nem resolve o desalinhamento além de reportá-lo.

Vídeo oficial do Google / The Keyword: usuário fala enquanto o Gemini gera documentos de negócios (embed YouTube 9_WadRR_E38).

IDs, specs e migração a partir do 3.1 Flash Live

Quem migra de gemini-3.1-flash-live-preview para gemini-3.8-live encontra, na docs de migração do Google, estas mudanças fechadas:

thinking_level (ou thinking_config) não é suportado no 3.8 Live: deve ser omitido no setup da sessão. Function calling assíncrono com behavior: NON_BLOCKING passa a ser o default; BLOCKING ainda é possível por compatibilidade. Agendamento de function (SILENT, WHEN_IDLE, INTERRUPTED) continua suportado no Live.

Proactive audio fica permanentemente ligado: proactive_audio: false retorna erro. Affective dialogue foi removido da API; configurações enable_affective_dialog precisam sair do código. Turn coverage default inclui áudio activity e all video (TURN_INCLUDES_AUDIO_ACTIVITY_AND_ALL_VIDEO), o que envia frames de vídeo ao modelo por padrão e exige atenção a contexto e custo. Modalidade de resposta suportada: áudio; quem precisa de texto deve habilitar transcription de saída.

send_client_content funciona ao longo de toda a sessão, com roles explícitos (user ou model). turn_complete=true interrompe a geração ativa de forma incondicional. Sem turn_complete, o servidor espera mensagens seguintes antes de responder.

Extended Thinking: raciocínio de fundo e tools async

No Extended Thinking, o Google descreveu no blog um modelo que raciocina e fala ao mesmo tempo: cues verbais cedo (do tipo “Let me check that…”), narração de progresso em tarefas multi-step em background, e tool calling sem cortar o fluxo conversacional. A docs técnica reforça o protocolo assíncrono.

Só function calling NON_BLOCKING é suportado; modo blocking devolve hard error. Function scheduling não é suportado nesse ID. thinking_config aceita thinking_level low, medium ou high; MINIMAL não. Depois de turnComplete: true, o cliente deve continuar ouvindo: o servidor pode ainda processar reasoning de fundo ou tool calls. O campo interaction_status distingue IN_PROGRESS (ainda há processamento, reasoning ou espera de tools) de IDLE (sessão ociosa, à espera do usuário).

Proactive audio também fica permanentemente ligado no Extended Thinking. send_client_content e interrupção via turn_complete=true seguem o mesmo desenho de ciclo de vida da sessão Live.

Preço detalhado na Gemini API

Segundo a página de pricing (seção “Gemini 3.8 Live, Gemini 3.8 Live Extended Thinking, and Gemini 3.1 Flash Live Preview”), free tier: sem custo (free of charge) para input e output. Paid tier, por 1 milhão de tokens em USD:

Input: US$ 0,75 (texto); US$ 3,00 ou US$ 0,005/min (áudio); US$ 1,00 ou US$ 0,002/min (imagem/vídeo). Output (incluindo thinking tokens): US$ 4,50 (texto); US$ 12,00 ou US$ 0,018/min (áudio). Grounding com Google Search no paid: 5.000 requests grátis por mês (shared across all Gemini 3.x models), depois US$ 14 por 1.000 requests. No free tier do Live, grounding com Search aparece como Supported na mesma tabela.

A tabela unifica os três IDs Live citados. Não há, nessa seção, Batch API para esses modelos (a ficha do modelo já marca Batch como Not supported). Conteúdo no free tier “Used to improve our products: Yes”; no paid, No, conforme a coluna da docs.

Para o leitor brasileiro que compara com o mercado: o GPT-Live-1 da OpenAI, lançado por volta de 10 de setembro de 2026, cobrou US$ 0,05 por minuto na camada de voz full-duplex da API e não oferece Free tier para sessões Live. Aqui não há bench head-to-head inventado; só o contraste de preço e de acesso free documentados em cada ecossistema.

Claims de desempenho atribuídos ao Google

No post de 15 de setembro, o Google afirmou que o Gemini 3.8 Live Extended Thinking ficou em #1 no Artificial Analysis Speech to Speech Quality Index com 82,6; liderou completion de tarefas agentic com 68,6% em τ-Voice e 35,1% em Sierra’s τ-Voice-banking; e marcou 97,7% no Big Bench Audio. O Gemini 3.8 Live, segundo a empresa, ficou em 2º lugar no Speech Agent Arena por preferência de usuários.

Nos dois modelos, o Google escreveu que, no EVA-Bench da ServiceNow (avaliação de voice agents), eles empurram a fronteira de Pareto entre accuracy e qualidade conversacional. Nota do próprio post: a rodada rodou na Live API on Gemini Enterprise Agent Platform. Nenhum desses números foi auditado pela ias.news; ficam como claims do Google e de benches citados pelo anúncio.

No post, o Google escreveu que o Extended Thinking captura “the #1 overall spot on Artificial Analysis’ Speech to Speech Quality Index (82.6)”, claim da própria empresa no The Keyword em 15 de setembro de 2026.

Disponibilidade e produtos Google

Para o 3.8 Live, o blog listou: desenvolvedores na Gemini API e no Google AI Studio; empresas em private preview no Gemini Enterprise, com Gemini Enterprise for Customer Experience “coming soon”; todos no Search Live. A model card também lista Gemini App, Vertex AI / Google Cloud e Google Search Live.

Para o 3.8 Live Extended Thinking: desenvolvedores na Gemini API e no Google AI Studio; empresas em private preview no Gemini Enterprise, com CX e clientes Workspace business “coming soon”; todos no Gemini Live; assinantes Google AI Pro e Ultra no Workspace em Docs; todos os assinantes Google AI em Gmail e Keep. A model card reforça Gemini App, API, AI Studio, Google Cloud / Vertex AI e Workspace (Gmail, Docs e Keep).

Vídeo oficial do Google / The Keyword: troubleshooting em tempo real no Search Live com contexto de câmera (embed YouTube 4P3iKlmQmM0).

Demos do post também mostraram onboarding com contexto visual, xadrez near real-time, geração de componentes React a partir de sketches, bookings multi-step com function calls assíncronas, e planos de negócios por voz. Os embeds acima são os dois YouTube IDs oficiais indicados no pacote editorial; vídeos mp4 hospedados em storage.googleapis.com do blog existem, mas não foram reembutidos aqui além dos YouTube.

Parceiros, plataformas e SynthID

O Google citou plataformas de desenvolvedores que encapsulam streaming em tempo real sobre a Live API: Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel e Vision Agents. Parceiros nomeados no post: Salesforce, Genspark e Lumeris, com ênfase corporativa em latência, fluidez e tool calling.

Todo áudio gerado pelos produtos de IA do Google, segundo o anúncio, leva watermark SynthID imperceptível no output, para detecção de conteúdo gerado e mitigação de desinformação. Detalhes de safety e responsabilidade ficam na model card e na página do SynthID.

O que o anúncio não cobre e o recado prático para o Brasil

O material não publica auditoria externa independente dos benches Artificial Analysis, τ-Voice, τ-Voice-banking, Big Bench Audio, Speech Agent Arena ou EVA-Bench. Não há score oficial de qualidade conversacional em PT-BR. A overview da Live API ainda fala em 70 idiomas enquanto o blog do lançamento cita 97; quem depende de transição mid-conversation em português deve validar na docs e na sessão real, não neste parágrafo.

Caching, code execution, file search, structured outputs, image generation, Maps grounding e Batch não entram nesses IDs Live. Affective dialogue saiu da API. No 3.8 Live, thinking_level some; no Extended Thinking, só async NON_BLOCKING e níveis low/medium/high. Knowledge cutoff January 2025 na model card implica lacuna factual recente que grounding com Search pode compensar em parte, com o custo documentado acima.

Na prática, um time BR que já usa gemini-3.1-flash-live-preview troca o model string, remove affective dialogue e thinking_level no caminho Live, trata proactive audio como sempre on, e decide se precisa de transcription de áudio para texto. Quem escolhe Extended Thinking ajusta o client para ouvir depois de turnComplete e monitorar interaction_status. O free tier sem custo abre teste sem o bloqueio Free Not supported visto no GPT-Live-1; produção paid segue a tabela por token/minuto em USD.

Em síntese, em 15 de setembro de 2026 o Google colocou o Gemini 3.8 Live e o Gemini 3.8 Live Extended Thinking na Live API, no AI Studio e em produtos consumer/enterprise com rollout gradual. Preço paid (por 1M tokens USD) e sem custo no free tier vêm da docs de pricing; IDs, limites 131.072 / 65.536, migração e protocolo async vêm das páginas de modelo; SynthID, base Gemini 3 Pro e cutoff January 2025 vêm da model card. Preferências de arena e percentuais de bench são claims do Google no The Keyword, não fatos medidos pela ias.news.