ElevenLabs lança Eleven v4, TTS mais expressivo e Turbo 100ms
Novo modelo de voz da ElevenLabs eleva expressividade, controla melhor emoções e ritmo, suporta 90+ idiomas e chega com a variante Turbo que atinge cerca de 100 ms de latência para agentes de voz em tempo real.
Danilo Gato
Autor
Introdução
Eleven v4 chegou como o modelo de TTS mais expressivo da ElevenLabs, acompanhado do v4 Turbo com latência medida por volta de 100 ms para uso em tempo real. O anúncio foi publicado em 28 de setembro de 2026, com atualização em 29 de setembro, detalhando ganhos de expressividade, naturalidade e controles finos de entrega vocal. (elevenlabs.io)
O lançamento importa porque redefine o equilíbrio entre qualidade de voz e velocidade, duas métricas que historicamente exigiam trocas. O v4 promete emoção, ritmo e contexto mais naturais, enquanto o v4 Turbo aproxima a resposta de um agente de voz ao intervalo natural de fala entre humanos. (elevenlabs.io)
Este artigo aprofunda o que muda com o v4, como a variante Turbo atinge baixa latência, o estado do ranking de qualidade entre modelos, cases de uso práticos e implicações para times de produto, marketing e atendimento.
O que é o Eleven v4 e por que ele muda o jogo
O Eleven v4 foi apresentado como o modelo mais emotivo da empresa, com nova arquitetura de geração de fala, melhor interpretação de tom, cadência e contexto do texto, e dinâmica multi‑falantes mais natural. Segundo a própria ElevenLabs, o v4 foi preferido em testes cegos frente a concorrentes como Cartesia Sonic 3.6 e Google Gemini 3.8 Flash TTS, além de receber o selo de primeiro lugar no Provider Voice Arena da Artificial Analysis na janela do lançamento. (elevenlabs.io)
Além do v4 padrão, a empresa lançou o Eleven v4 Turbo, pensado para conversação em tempo real, com tempo mediano até a primeira fala por volta de 150 ms e latência de inferência próxima de 100 ms, números apurados em setembro de 2026 e com rede descontada nos testes internos. Esses dados alinham com o changelog técnico da própria Eleven, que também referencia a meta de cerca de 100 ms. (elevenlabs.io)
Para quem constrói produtos, isso significa duas opções claras dentro da mesma família, qualidade máxima para narração e dublagem e performance para agentes conversacionais. Essa convergência reduz o atrito entre P&D de voz e engenharia de plataforma, simplificando rotas de migração e testes A/B.
Latência e experiência de tempo real, o que muda com o v4 Turbo
Na prática, latência é o calcanhar de Aquiles de qualquer agente de voz. O v4 Turbo foi projetado para derrubar essa barreira, entregando tempo de início de áudio em torno de 150 ms e inferência mediana aproximadamente 100 ms. Isso coloca a resposta dentro, ou até melhor, que a pausa média entre turnos de fala de humanos, sensação essencial para conversas naturais. Os gráficos divulgados pela Eleven mostram o v4 Turbo à frente de alternativas avaliadas no teste interno, incluindo Cartesia Sonic 3.6, xAI TTS, Google Gemini 3.8 Flash‑Lite TTS e OpenAI GPT‑4o mini TTS. (elevenlabs.io)
A imprensa especializada também destacou a combinação de nova expressividade com baixa latência e suporte amplo de idiomas, reforçando o posicionamento do v4 para aplicações de atendimento, jogos e criação de conteúdo. TechCrunch resumiu o lançamento no dia 28 de setembro de 2026, enfatizando melhor controle de expressão e mais de 90 idiomas. (techcrunch.com)
Do ponto de vista de integração, o v4 Turbo foi otimizado para o stack conversacional da própria Eleven, o ElevenAgents. Isso interessa para quem busca encurtar ciclo de tuning e ganhar consistência de respostas sem costurar componentes de múltiplos fornecedores. (elevenlabs.io)
Expressividade, controles e clonagem de voz mais consistente
Expressividade é o diferencial mais visível do v4. Além de interpretar contexto e intenção, o modelo segue tags de áudio e instruções de direção de forma mais fiel, como [laughs], [said angrily in French accent] ou indicações de efeitos sonoros inline. Isso simplifica a direção de narradores e personagens sem depender de pós‑edição extensa. A empresa afirma também melhor suporte ao Alfabeto Fonético Internacional, útil para pronúncias customizadas. (elevenlabs.io)
A clonagem de voz ganhou estabilidade e semelhança mais alta, inclusive com Instant Voice Clones a partir de cerca de 10 segundos de áudio. Para projetos longos, a promessa é manter identidade vocal ao longo de capítulos, cenas e regravações, algo que equipes de audiolivros e publicidade valorizam. (elevenlabs.io)
Na comparação direta, a própria Eleven publicou um gráfico de preferência em testes cegos, com o v4 vencendo entre 65 e 81 por cento das comparações contra Cartesia Sonic 3.6, Inworld TTS‑2 e dois modelos Gemini 3.8. Esses testes foram realizados em setembro de 2026 com critérios descritos nas notas de rodapé. (elevenlabs.io)
Idiomas e alcance global, mais de 90 línguas com aderência de sotaque
O v4 e o v4 Turbo suportam mais de 90 idiomas, com promessa de entonação e ritmo mais autênticos por contexto. Um detalhe importante, segundo a documentação de modelos, é que a família v4 leva os ganhos de expressividade para o cenário de tempo real, mantendo o suporte amplo de idiomas e controles de tags, enquanto versões anteriores tinham limites de latência e menor espectro emocional. (elevenlabs.io)
A cobertura de mídia reforçou o suporte a 90+ idiomas como um dos pontos fortes do anúncio. Para dublagem e localização, isso significa manter uma voz de marca única, em diferentes mercados, com menor deriva para o sotaque original ao longo da geração, uma queixa comum em pipelines de TTS multilíngues. (techcrunch.com)

Para planejamento de conteúdo, equipes podem considerar uma estratégia de voz central, projetada em um idioma e expandida para outros com consistência, desde que o material de referência seja bem curado. Em fluxos de UX conversacional, vale padronizar pronúncias de termos proprietários via IPA e tags, evitando variação entre jornadas.
Como o v4 se posiciona nos rankings e frente aos concorrentes
Logo após o anúncio, o v4 apareceu em primeiro lugar no Provider Voice Arena da Artificial Analysis, o “TTS Arena” mais citado, com Elo em torno de 1316 a 1319, acima de Cartesia Sonic 3.6 e dos modelos Gemini 3.8 avaliados. Diversas leituras independentes registraram a ascensão do v4 à liderança na semana do lançamento. (artificialanalysis.ai)
Nem todos os painéis concordam sempre. Há diferenças entre leaderboards como Voice Arena e compilações de terceiros, o que exige cautela ao comparar números de Elo, custos por milhão de caracteres e latência medida. Ainda assim, o consenso na janela de 28 a 29 de setembro de 2026 aponta o v4 no topo do ranking de preferência do Provider Voice Arena, com os concorrentes mais próximos variando entre Cartesia Sonic 3.6, Gemini 3.8 Flash TTS e Inworld Realtime TTS‑2. (voicearena.com)
Para avaliação objetiva, priorize três frentes, preferências cegas no seu domínio, latência medida ponta a ponta na sua rede e custo por caractere na sua cadência de uso. Alguns relatórios setoriais apontam preços bem diferentes entre fornecedores, algo que pode compensar gaps pequenos de Elo dependendo do caso de uso. (inworld.ai)
Aplicações práticas, de agentes de voz a dublagem e publicidade
Na prática, o v4 padrão tende a brilhar em narrativas longas, dublagem premium, trailers e publicidade, onde variação emocional e consistência de personagem importam mais que resposta ultrarrápida. Já o v4 Turbo é o candidato natural para contact centers, assistentes em apps, bots de vendas, guias em museus, experiências em lojas e NPCs em jogos que respondem na hora. (elevenlabs.io)
Alguns sinais públicos, inclusive em comunidades, mostram entusiasmo e críticas iniciais, como relatos de que a nova abordagem pode soar mais energética do que desejado em certos prompts sem tags, enquanto outros usuários celebram o salto de expressividade para uso cotidiano de leitura. Essa diversidade de feedback confirma a importância de guiar a entrega com tags e testes de tom. (reddit.com)
Para quem opera produtos em escala, três boas práticas se destacam, padronizar um conjunto mínimo de tags de entrega por tipo de conteúdo, definir glossários com IPA para termos críticos e medir CSAT e abandono por pausa de resposta em agentes. O objetivo é alinhar estética de voz e velocidade ao objetivo de negócio, evitando over‑engineering.
Integração e estratégia de produto, passos recomendados
Times que já usam Eleven v3 podem pilotar migrações graduais com dois trilhos, conteúdo premium direto para v4 e flows conversacionais migrando para v4 Turbo quando a latência real medida ficar dentro de metas internas. A vantagem de compartilhar a família de modelos reduz drift de timbre entre canais. (elevenlabs.io)
No lado técnico, mapeie onde usar streaming WebSocket e onde lotes síncronos bastam, e ative direção por tags nos pontos sensíveis, como desculpas em suporte, CTAs em anúncios e pausas dramáticas em storytelling. Para voice branding, bloqueie referências por idioma e persona e, quando possível, use Professional Voice Clones para campanhas com vozes licenciadas, garantindo consistência por trimestre. (elevenlabs.io)
Por fim, revise métricas além de WER de STT inverso ou MOS sintético. Meça preferência cega interna com amostras reais do seu funil, faça testes de interrupção de usuário em agentes e monitore falsos‑positivos de intenção causados por entonação. Esses dados orientam trade‑offs de preço versus Elo de mercado. (digitalapplied.com)
Reflexões e insights
A corrida por TTS de ponta virou um jogo de margem, onde pequenas vantagens em expressividade e latência se convertem em saltos grandes de percepção. O v4 equilibra esses dois vetores dentro de uma mesma família, o que elimina fricção típica entre times criativos e de plataforma. A presença no topo do Provider Voice Arena na semana de lançamento é um termômetro do momento, não um veredito eterno. Benchmarks mudam rápido, por isso vale manter uma rotina mensal de reavaliação.
A estratégia vencedora combina direção criativa consistente, automação de tags e métricas de negócio que tratam voz como uma camada de UX. Quando a equipe trabalha com um “guia de fala” claro, termos padronizados e limites de latência alinhados a cada jornada, a tecnologia vira diferencial competitivo, não uma loteria de demos.
Conclusão
Eleven v4 consolida um avanço de expressividade, controles de entrega e suporte a 90+ idiomas, enquanto o v4 Turbo leva essa expressividade ao tempo real com latência medida próxima de 100 ms e início de fala por volta de 150 ms. Em 28 e 29 de setembro de 2026, o modelo apareceu no topo do ranking de preferência do Provider Voice Arena, sinal forte de aceitação técnica e estética pelos ouvintes. (elevenlabs.io)
Para equipes de produto e conteúdo, a recomendação é clara, pilote com dados do seu domínio. Use o v4 em narrativas e dublagens premium, e o v4 Turbo onde a conversa precisa fluir sem atritos. Com direção por tags, IPA para termos críticos e medição de preferência cega contínua, a adoção do v4 deixa de ser hype e vira resultado previsível em retenção, NPS e conversão.
Leia também
OpenAI apresenta DoTs, redes minúsculas especializadas
DoTs, as novas redes minúsculas e especializadas da OpenAI, apontam para uma adaptação mais eficiente de grandes modelos. O conceito se apoia em tendências como adapters, sparsidade e otimizações de infraestrutura, com impacto direto em custo, latência e personalização corporativa.
8 min de leituraTecnologia e IAShopify lança WebMCP Checkout para agentes IA via Shop Pay
A chegada do WebMCP Checkout na Shopify permite que agentes de IA no navegador criem carrinhos, atualizem dados do cliente e finalizem compras usando Shop Pay. Isso acelera conversões, melhora a experiência e mantém atribuição e segurança. Veja como funciona, requisitos técnicos, impactos e como se preparar.
11 min de leituraTecnologia e IAAmazon compra e destrói livros raros em massa para IA
Uma investigação da 404 Media seguiu um lote de livros raros até um centro da Amazon em Las Vegas, onde funcionários cortam as lombadas para escanear páginas e descartar os exemplares. A empresa afirma comprar livros por canais comerciais para aprimorar produtos. Entenda o que muda para IA, editoras e leitores e quais são os riscos, implicações legais e alternativas.
9 min de leituraTecnologia e IASocial Media Examiner 73% usam IA, Claude vence ChatGPT 2026
O relatório de IA 2026 da Social Media Examiner crava 73% de uso diário de IA entre marketers e vira o jogo, Claude é apontada como plataforma mais importante, à frente do ChatGPT. Entenda o que muda em conteúdo, agentes de IA, governança e ROI, com ações práticas para equipes B2B e B2C.
9 min de leitura