Google lança Gemini 3.5 Transcribe, 2,6% WER e 85+ idiomas
Novo modelo de fala para texto do Google promete transcrição precisa, baixa latência, suporte a mais de 85 idiomas e recursos inteligentes como diarização, vocabulário customizado e formatação automática.
Danilo Gato
Autor
Introdução
O Google lançou o Gemini 3.5 Transcribe com foco em precisão e uso prático no mundo real. O modelo de fala para texto reporta 2,6% de WER em cenários não streaming, 4,0% em streaming segundo medições independentes, além de suporte a mais de 85 idiomas, com melhorias significativas sobre o Chirp 3 em acurácia e latência. (blog.google)
A relevância é direta para quem depende de captura confiável de conteúdo falado. O Gemini 3.5 Transcribe foi projetado para lidar com ruídos, jargões e disfluências, convertendo áudio em texto limpo e formatado, inclusive com identificação de múltiplos falantes em gravações. Está disponível para desenvolvedores na Gemini API, com duas opções, o endpoint em tempo real via Live API e o processamento de áudio pré-gravado via Interactions API. (blog.google)
O artigo aprofunda recursos, benchmarks, preços práticos, casos de uso e implicações estratégicas para produtos de voz, contact centers e produtividade pessoal, com citações diretas da documentação e do anúncio oficial do Google.
O que é o Gemini 3.5 Transcribe e por que importa
O Gemini 3.5 Transcribe é o novo modelo de ASR do Google para transformar fala em texto de forma inteligente. O modelo se diferencia por combinar reconhecimento robusto com formatação automática, limpeza de disfluências, entendimento de intenções e suporte a vocabulário customizado. O foco vai além de legendagem simples, a proposta é viabilizar interfaces de voz mais úteis em apps, navegadores e sistemas operacionais. (blog.google)
Dois caminhos de integração cobrem cenários distintos. Em tempo real, o Live API usa WebSockets para entregar transcrição bidirecional com latência sub segundo usando o modelo gemini-3.5-transcribe-live. Para arquivos e reuniões já gravados, o Interactions API processa lotes, gera timestamps a nível de palavra e faz diarização de até três falantes, com suporte experimental acima disso. Essa separação facilita arquiteturas que misturam atendimento ao vivo e pós-processamento analítico. (ai.google.dev)
No ecossistema Google, o modelo aparece em superfícies como o app Gemini, Gboard com Rambler, o app do Gemini no macOS e em breve no Chrome, sinalizando uma estratégia para tornar a digitação por voz e os comandos multimodais mais naturais. Para desenvolvedores, a disponibilidade em AI Studio e na plataforma Enterprise Agent acelera a experimentação com agentes de voz e pipelines de analytics. (blog.google)
Números que chamam atenção, WER, idiomas e benchmarks
O anúncio oficial destaca métricas de precisão e cobertura de idiomas. Segundo o Google, o Gemini 3.5 Transcribe atinge em média 2,6% de WER em uso não streaming e 4,0% em streaming em medições da Artificial Analysis, além de suportar automaticamente mais de 85 idiomas e diferentes sotaques e dialetos. Em FLEURS, em um conjunto de principais idiomas e localidades, o modelo alcança 5,50% de WER em streaming e 5,04% em não streaming. (blog.google)
Esses números colocam o modelo em um patamar competitivo entre soluções de mercado. Publicações técnicas e repositórios independentes referenciam os mesmos dados, reforçando a leitura de que o WER não é apenas marketing, é medido por terceiro. Ainda assim, comparativos apontam que há concorrentes próximos em WER absoluto, um ponto importante para decisões de arquitetura. (orcarouter.ai)

Outro aspecto relevante é a evolução sobre o Chirp 3. O Google afirma melhoria de 70% no tempo até a transcrição final, o que impacta diretamente a experiência em chamadas, ditado e legendagem ao vivo. Em ambientes barulhentos ou com tráfego instável, latência menor aumenta utilidade e reduz frustração do usuário. (blog.google)
Como funciona na prática, Live API e Interactions API
Para aplicações interativas de voz, o Live API com o modelo gemini-3.5-transcribe-live mantém uma sessão WebSocket, recebe áudio contínuo e devolve trechos de texto incrementalmente. A documentação descreve como iniciar streams, habilitar transcrição e controlar custos em sessões longas usando parâmetros de contexto. Para processamento assíncrono de gravações, o Interactions API com o modelo gemini-3.5-transcribe cria transcrições completas com diarização e timestamps. (ai.google.dev)
Do ponto de vista de produto, isso abre dois padrões de implementação. Primeiro, agentes de voz que precisam responder em tempo quase real, por exemplo triagem de chamados, assistentes de suporte e fluxo de autoatendimento em apps móveis. Segundo, análise pós-chamada para contact centers e reuniões, gerando resumos, extraindo entidades, calculando sentiment e compliance. A alternância entre fluxos em tempo real e batch reduz acoplamento e permite otimizar custo por jornada do usuário. (ai.google.dev)
Recursos inteligentes que impactam qualidade e usabilidade
O Gemini 3.5 Transcribe foi projetado para entender a fala como ela acontece. Entre os recursos listados no anúncio estão, transcrição inteligente que remove preenchimentos, aplica formatação e trata autocorreções, reconhecimento com vocabulário customizado para jargões e termos de marca, além de identificação de múltiplos falantes com timestamps a nível de palavra. Esses detalhes fazem diferença em relatórios finais, buscas e automações. (blog.google)
Na prática, limpeza de disfluências e preservação de entidades alfanuméricas, como IDs de pedido e CEPs, reduzem retrabalho e erros de backoffice. Em workflows corporativos, a combinação de diarização com marcação de tempo facilita auditorias e acelera QA de atendimentos. Em mobilidade, a integração com Gboard e Chrome tende a elevar a adoção do ditado entre usuários que evitavam a funcionalidade por ruído e formatação aquém do desejado. (blog.google)
Preço, modelo de cobrança e como estimar custos
Para decidir escopo e escala, é essencial entender o modelo de preços. Na documentação oficial, o Google apresenta valores da Gemini API por milhão de tokens, com estimativas por minuto para áudio e texto. No gemini-3.5-transcribe, a tabela sugere custo efetivo aproximado de 0,005 dólar por minuto considerando 25 tokens de áudio por segundo e 175 tokens de texto por minuto. No gemini-3.5-transcribe-live, a estimativa combinada gira em torno de 0,009 dólar por minuto. Esses números são aproximações baseadas em perfis médios de tokens. (ai.google.dev)
Importante, o Live API cobra por tokens, não por minuto fixo. Em sessões persistentes, o histórico de tokens é reprocessado a cada turno, o que aumenta o custo conforme a conversa se alonga. A própria equipe de desenvolvedores do Google reforça que transcrição de entrada ou saída adiciona cobrança de tokens de texto além do custo de áudio. Para controlar o gasto, a recomendação oficial é usar compressão da janela de contexto com limites e janela deslizante. (ai.google.dev)
Na prática, planejamento orçamentário deve considerar distribuição real de duração das interações, proporção entre sessões curtas e longas e se haverá transcrição de input e output simultaneamente. Em pipelines batch, o custo tende a ser mais previsível, já em experiências conversacionais contínuas convém implementar limites de sessão, políticas de compressão de contexto e avisos de tempo para usuários heavy users. (ai.google.dev)
Comparativos, trade offs e o papel de WER na decisão
WER continua sendo métrica central, mas não é a única. Relatos e análises independentes posicionam o Gemini 3.5 Transcribe entre os modelos líderes, embora benchmarks mencionem alternativas com WER ligeiramente melhor em cenários específicos. O quadro que emerge é de liderança disputada, com variações por idioma, sotaque e domínio. A escolha ideal depende tanto do WER quanto de latência, estabilidade de endpointing, custo efetivo por minuto e capacidade de manter entidades críticas intactas. (orcarouter.ai)
Benchmarks públicos também apontam ganhos práticos. Em testes no Superwhisper, por exemplo, há medições de WER em conjuntos como Common Voice em inglês australiano, com cerca de 4,6% para configurações específicas do Gemini 3.5 Transcribe, dentro de uma bateria comparável entre modelos. Esses números ajudam a calibrar expectativas para cenários do dia a dia, além do recorte anunciado. (ai.superwhisper.com)

Casos de uso imediatos, do ditado pessoal ao contact center
No varejo, agentes de voz podem validar IDs, endereços e números de pedido com maior confiabilidade, reduzindo backlogs por erros de digitação. Em saúde, ditado clínico com vocabulário customizado ajuda a capturar termos técnicos e nomes de medicamentos, inclusive com sotaques regionais. Em educação, legendagem multilíngue de aulas gravadas amplia acesso ao conteúdo. Já em produtividade, ditado limpo e comandos por voz aceleram rascunhos e organização de arquivos. Essas aplicações são coerentes com os recursos descritos no anúncio, em especial limpeza de disfluências, preservação de entidades e suporte amplo de idiomas. (blog.google)
Para plataformas de desenvolvedores, o Live API integra com SDKs e WebSockets para montar assistentes responsivos em sites e apps. O Interactions API fecha o ciclo com processamento robusto de reuniões e chamadas, entregando transcrições com timestamps e diarização para indexação e análise. Parceiros como LiveKit, Agora, LangChain e Vercel foram citados, ilustrando como a infraestrutura de streaming e os frameworks atuais já abraçaram o modelo. (blog.google)
Boas práticas técnicas para tirar proveito do modelo
Algumas práticas emergem da documentação e de fóruns oficiais. Em primeiro lugar, configure compressão de contexto no Live API para conter custos em conversas extensas. Em segundo, habilite transcrição apenas quando necessário, já que tokens de texto gerados pelo recurso são cobrados adicionalmente. Em terceiro, monitore a qualidade por idioma, usando amostras reais do seu domínio antes de padronizar thresholds e dicionários personalizados. Essas orientações são explicitamente discutidas nos guias do Live API e em tópicos do fórum de desenvolvedores. (ai.google.dev)
Para qualidade, combine avaliações internas com benchmarks como FLEURS para seus idiomas prioritários. Avaliar WER não basta, vale medir preservação de entidades, qualidade de pontuação e formatação, latência ponta a ponta e resiliência a ruído. Em lotes, valide diarização e confiança a nível de palavra para garantir consistência em auditorias. Essas medições ajudam a transformar o ganho de acurácia em resultados de negócio, não apenas em números de release. (blog.google)
Limitações e pontos de atenção
Modelos que limpam disfluências e aplicam formatação geram texto mais legível, porém há cenários forenses e jurídicos que exigem registro estritamente literal. Nesse caso, opções de configuração e documentação de como o texto foi gerado precisam ser tratadas com rigor. Comunidades técnicas têm observado que WER alto ou baixo em um benchmark não captura toda a complexidade de sessões ao vivo, por isso protótipos reais ainda são o melhor termômetro. (aireiter.com)
Outro ponto é que as estimativas por minuto na página de preços partem de suposições de tokens. Em sessões WebSocket longas, o reprocessamento do histórico pode tornar interações tardias mais caras que as iniciais. O guia de melhores práticas do Live API detalha como funciona a cobrança e recomenda controles de contexto para evitar crescimento de custo. (ai.google.dev)
Conclusão
O Gemini 3.5 Transcribe chega com avanços concretos, WER baixo, latência melhor e integração madura com o stack do Google. A disponibilidade via Live API e Interactions API, somada a recursos como diarização, timestamps e vocabulário customizado, torna o modelo uma opção sólida para produtos de voz, legendagem multilíngue e automação de backoffice. Para times de produto, a combinação de precisão, alcance em 85+ idiomas e facilidade de integração vale o teste controlado em problemas reais. (blog.google)
A decisão final deve equilibrar mais que WER, custo efetivo por sessão, latência ponta a ponta, preservação de entidades e governança sobre quando limpar disfluências. Com medições internas, boas práticas de contexto no Live API e foco em métricas que importam para o negócio, dá para transformar o potencial técnico do Gemini 3.5 Transcribe em ganhos práticos de experiência e eficiência. (ai.google.dev)
Leia também
Gemini lança vídeo agentic, 88% menos tokens, 66% custos
O Google lançou a compreensão de vídeo agentic no Gemini em 1 de setembro de 2026. A novidade reduz em até 88% os tokens de entrada e corta até 66% os custos de análise em cenários de vídeo longo, com ganhos de qualidade reportados. Disponível via Gemini API no Google AI Studio e no Gemini Enterprise Agent Platform, a abordagem usa exploração dinâmica de quadros, áudio e transcrições para focar apenas nos trechos relevantes. Veja o que muda na prática, implicações de custo, como ativar o modo ag
10 min de leituraInteligência ArtificialMicrosoft lança MAI-Transcribe-2, o mais rápido, preciso e barato a US$0,10/h
MAI-Transcribe-2 foi anunciado com preço promocional de US$0,10 por hora, suporte a 60 idiomas, diarização e timestamps. A Microsoft afirma superar rivais como Google, OpenAI e ElevenLabs em velocidade e acurácia, abrindo novas possibilidades para contact centers, mídia e produtos com voz.
8 min de leituraeducaçãoFaculdade não está na lista do plano de estudante da IA: o que fazer
Sua faculdade não está na lista de verificação de estudante? O pedido pra incluir a instituição e a revisão manual que destravam o acesso.
8 min de leituraInteligência ArtificialGoogle lança Gemini 3.8 Flash e Flash Cyber, agentes e segurança
O Gemini 3.8 Flash chega com ganhos de raciocínio e código mantendo preço e latência do 3.7, enquanto o 3.8 Flash Cyber estreia para defensores com desempenho de ponta em descoberta e correção autônoma de vulnerabilidades. Entenda preços, benchmarks, disponibilidade e como integrar em agentes, APIs e plataformas Google.
10 min de leitura