O Google apresentou em 23 de setembro de 2026 o Gemini 3.8 Flash TTS e o Gemini 3.8 Flash-Lite TTS, dois modelos de text-to-speech da família Gemini para estúdio criativo e escala de produção. O anúncio saiu no blog The Keyword, com fichas em gemini-3.8-flash-tts e gemini-3.8-flash-lite-tts, preços na tabela da Gemini API e detalhes de safety na model card Gemini 3.8 Audio da DeepMind.
Para o leitor brasileiro, o ganho imediato é acesso no Google AI Studio e na Gemini API no mesmo dia do post, suporte a Portuguese nas listas oficiais (130 línguas no Flash, 101 no Flash-Lite), menção explícita a Brazilian Portuguese nas avaliações de preferência humana citadas pelo blog, e voice replication disponível no Brasil (Illinois, Texas, EEA, Reino Unido, Suíça e Índia ficam fora; o Brasil não entra na lista de bloqueio). No paid Standard, até 31 de dezembro de 2026, a docs cobra por 1 milhão de tokens em USD: texto a US$ 0,50 nos dois IDs; áudio a US$ 9,00 no Flash e US$ 6,00 no Flash-Lite (cerca de US$ 0,00225 e US$ 0,0015 por 10 segundos, a 25 tokens por segundo de áudio).
Esta reportagem separa fatos de docs (IDs, preço, línguas, disponibilidade, salvaguardas) de claims de preferência Voice Arena e benches Hume AI do post. Qualidade subjetiva em PT-BR não foi medida pela ias.news.
O rollout, segundo o Google, começou “starting today” em 23 de setembro de 2026. Desenvolvedores usam a Gemini API e o AI Studio nos dois modelos. Empresas entram “coming soon” via API no Gemini Enterprise. O Flash TTS chega ao Gemini Notebook para o público geral; o Flash-Lite TTS chega ao Google Vids.
Vídeo oficial do Google / The Keyword: Create your own voices with Gemini 3.8 text-to-speech (embed YouTube FL6mI_Br-mc).
O que o Gemini 3.8 Flash TTS muda na API de voz
Na documentação, gemini-3.8-flash-tts é o modelo criativo de referência para fidelidade acústica, atuação expressiva, sotaques regionais e estabilidade em long-form multi-turn. A ficha recomenda o ID para audiolivros, narração de estúdio, diálogo multi-speaker complexo, acting com vocal bursts e pronúncia difícil. Limites: 8.192 tokens de entrada e 16.384 de saída. Entrada: texto. Saída: áudio.
gemini-3.8-flash-lite-tts compartilha o mesmo schema de API e a mesma estrutura de prompting. A docs o descreve como workhorse de alto throughput, baixa latência e custo menor, substituto de gemini-3.1-flash-tts-preview para volume, voice agents, read-aloud e replication. Limites de tokens e o par texto para áudio são os mesmos do Flash.
Capacidades suportadas nas duas fichas: audio generation, caching, Batch API, Flex inference e Priority inference. Não suportados: Live API, function calling, search grounding, thinking, code execution, file search, structured outputs, image generation, Maps grounding e URL context. TTS aqui é síntese texto-para-áudio, não diálogo full-duplex da Live API.
O guia de speech generation e as páginas de voice design e voice replication cobrem prompting e formatos. Update nas fichas: July 2026.
Dois IDs, um schema: Flash versus Flash-Lite
A tabela “When to use which TTS model” na docs deixa a divisão explícita. Flash prioriza fidelidade máxima, nuance de atuação e cobertura de dialetos (130 línguas). Flash-Lite prioriza throughput, latência e eficiência de custo (101 línguas). Portuguese aparece na lista de línguas suportadas dos dois modelos; a detecção de idioma no input é automática, segundo a documentação.
Quem migra de gemini-3.1-flash-tts-preview precisa, segundo o migration guide do Google, tratar o texto de entrada como transcript literal. Direções do tipo “Say cheerfully: Hello!” ou rótulos “Speaker 1:” no corpo do texto podem ser faladas em voz alta. Estilo sustentado (style) e rótulo de falante (speaker) vão para speech_metadata estruturado (Interactions API via annotation type: speech_metadata; GenerateContent API via campo speech_metadata em cada part).
Tags entre colchetes angulares ficam reservadas a eventos vocais pontuais (riso, suspiro, tosse, respiração, pausa curta). Whisper e outras entregas contínuas entram em style. Em multi-speaker, cada turn precisa de speaker explícito alinhado aos speakers configurados. Personas longas de “Director’s Notes” devem migrar para um voice ID criado em Voice design.
Mudança de formato: Gemini 3.8 TTS devolve WAV (audio/wav) com header RIFF por padrão em requests unary. O preview 3.1 devolvia PCM raw audio/l16 sem header. Pipelines que embrulhavam PCM precisam gravar os bytes direto ou setar response_format (L16, mu-law, A-law) de forma explícita.
Preço detalhado na Gemini API
Segundo a página de pricing (seções Gemini 3.8 Flash TTS e Gemini 3.8 Flash-Lite TTS), o free tier Standard lista input e output como free of charge. A coluna “Used to improve our products” marca Yes no free e No no paid. Tokens de áudio correspondem a 25 tokens por segundo de áudio, nota de rodapé da própria tabela.
Paid Standard, por 1 milhão de tokens em USD, até 31 de dezembro de 2026: input texto US$ 0,50 nos dois modelos; output áudio US$ 9,00 no Flash (equivalente a US$ 0,00225 por 10 segundos) e US$ 6,00 no Flash-Lite (equivalente a US$ 0,0015 por 10 segundos). Caching de input no Standard: US$ 0,125 por 1M tokens até a mesma data, com storage a US$ 0,50 por 1M tokens por hora.
A partir de 1 de janeiro de 2027, o Standard dobra no texto e no áudio: texto US$ 1,00; áudio US$ 18,00 no Flash e US$ 12,00 no Flash-Lite (equivalentes a US$ 0,0045 e US$ 0,003 por 10 segundos). Caching de input sobe para US$ 0,25; storage para US$ 1,00 por 1M tokens por hora.
Batch no paid, até 31 de dezembro de 2026: texto US$ 0,25; áudio US$ 4,50 (Flash) e US$ 3,00 (Flash-Lite), metade do Standard na mesma janela. A partir de 1 de janeiro de 2027, Batch sobe para texto US$ 0,50 e áudio US$ 9,00 / US$ 6,00. Free tier Batch aparece como Not available. Flex e Priority existem na mesma tabela, com Flex no patamar de desconto do Batch e Priority acima do Standard.
Não há preço em reais na docs. Orçamento BR trabalha em USD: volume alto em PT-BR tende a Flash-Lite ou Batch; long-form com acting fino permanece no Flash.
Vozes: design por prompt, biblioteca e replication
No The Keyword, o Google descreveu um salto de “30 original voices” para uma biblioteca de mais de 2.000 vozes prontas para produção, com cobertura ampla de línguas e variedades regionais (o post citou Mexican Spanish, Quebec French e Scots English como exemplos). Voice design generativo no Flash TTS cria personas a partir de prompt em linguagem natural (papel, sotaque, características de voz) em mais de 100 línguas e dialetos, segundo o blog.
Voice replication, ainda segundo o anúncio e a docs de replication, reconstrói um perfil vocal a partir de cerca de 30 segundos de áudio da própria voz ou de voz com direitos de uso. O fluxo exige consentimento verbal gravado do dono da voz, com verificação de match ao speaker de referência. O Google também citou watermark SynthID e credenciais C2PA nesse pacote de proteções.
Vozes customizadas podem ser salvas para reduzir drift. Voice remixing (timbre, pitch, pace, sotaque via prompt) aparece como “coming soon”, sem data. O AI Studio foi apresentado como workspace de design: criar voz do zero, replicar com consentimento e dirigir screenplay dual-speaker linha a linha.
Restrição geográfica explícita no rodapé do post: voice replication via AI Studio não está disponível em Illinois, Texas, EEA, Reino Unido, Suíça e Índia. O Brasil não figura nessa lista de exclusão no material consultado.
Direção de cena, long-form e dois falantes
Os dois modelos, no relato do Google, aceitam direção de performance linha a linha: rubricas de palco escritas pelo usuário ou cues de script para tom, pacing e nuance. Long-form visa manter qualidade, pacing e timbre por horas de áudio com drift mínimo, caso citado para podcasts e audiolivros.
Staging nativo de dois falantes dirige conversas multi-turn a partir de um script, com turn-taking. Vocal bursts e backchanneling entram como textura; na API, eventos pontuais ficam em tags inline e o estilo contínuo em metadata. Parceiros citados no post: Figma, HeyGen, Linguana, Wondercraft, 99.co e Ollang; plataformas Agora, LiveKit, Pipecat e Vercel.
Claims de desempenho atribuídos ao Google
No post de 23 de setembro de 2026, o Google afirmou que o Gemini 3.8 Flash TTS ficou em primeiro lugar no Hume AI’s Voice Design Benchmark com 71,4 e liderou accent modeling com 60,8. A companhia também informou que Flash TTS e Flash-Lite TTS ficaram em primeiro e segundo lugares, respectivamente, no Hume AI’s Overall Quality Index.
Em avaliações cegas de preferência humana no Voice Arena, segundo o blog, os dois modelos ocuparam posições de topo entre concorrentes em línguas-chave, incluindo Japanese, Brazilian Portuguese, Vietnamese, Modern Standard Arabic (MSA), Mexican Spanish e Hindi. O post também escreveu que houve melhorias relevantes frente ao Gemini 3.1 Flash TTS em long-form e controle de screenplay dual-speaker.
Nenhum desses scores foi auditado pela ias.news; ficam como claims do Google. Não há score oficial independente de qualidade em PT-BR além da menção Voice Arena do post.
Disponibilidade, SynthID e o que o anúncio não cobre
Resumo de canais no The Keyword: Flash TTS para desenvolvedores na Gemini API e no Google AI Studio; empresas “coming soon” via API no Gemini Enterprise; público geral no Gemini Notebook. Flash-Lite TTS: mesmos canais de API e AI Studio para desenvolvedores; Enterprise “coming soon”; público geral no Google Vids. A família Gemini Audio recente (3.5 Live Translate, 3.5 Transcribe, 3.8 Live e Extended Thinking) aparece no post como contexto de linha.
Todo áudio gerado pelos modelos Gemini Audio, segundo o Google, leva watermark SynthID imperceptível no output, para detecção de fala sintética e mitigação de desinformação. Detalhes de safety e responsabilidade apontam para a model card Gemini 3.8 Audio e para a página do SynthID. Não houve, na busca deste pacote, model card DeepMind exclusiva só do TTS 3.8 no mesmo dia; o companion de trust aponta para a card de áudio da família.
O material não traz auditoria externa dos benches Hume nem da Voice Arena, nem SLA de latência do Flash-Lite, nem preço Enterprise além do “coming soon”. Voice remixing segue sem data. As fichas listam “Portuguese”; quem destaca Brazilian Portuguese na Voice Arena é o blog.
Na prática, um time BR que já usa gemini-3.1-flash-tts-preview troca o model string, move estilo e speaker para speech_metadata, ajusta o pipeline ao WAV default e escolhe Flash (estúdio/long-form) ou Flash-Lite (volume/custo). Replication no AI Studio pede cerca de 30 segundos de áudio e consentimento verbal; o Brasil não está na lista de bloqueio. Produção paid segue a tabela USD até 31/12/2026 (Batch ~50% off); a partir de 1/1/2027 o Standard dobra.
Em síntese, em 23 de setembro de 2026 o Google colocou o Gemini 3.8 Flash TTS e o Gemini 3.8 Flash-Lite TTS na Gemini API e no AI Studio, com Notebook (Flash) e Vids (Flash-Lite) no consumidor e Enterprise ainda “coming soon”. Preço paid Standard (texto US$ 0,50; áudio US$ 9 / US$ 6 por 1M tokens até 31/12/2026), free of charge no free tier, Batch pela metade e dobra em 1/1/2027 vêm da docs de pricing. Model-ids, 130/101 línguas, limites 8.192 / 16.384 e schema de metadata vêm das páginas de modelo. SynthID, consentimento e exclusões regionais de replication vêm do The Keyword e da model card de áudio. Preferências Voice Arena e scores Hume são claims do Google no post de lançamento, não fatos medidos pela ias.news.
