Transcrever áudio longo com IA: o que fazer quando o arquivo é longo demais pro app
produtividade

Transcrever áudio longo com IA: o que fazer quando o arquivo é longo demais pro app

Danilo Gato

Autor

29 de agosto de 2026
6 min de leitura

Resposta rápida

Sim, dá pra transcrever um áudio ou aula de duas horas com IA, mas primeiro você precisa saber em qual parede a sua ferramenta vai esbarrar. A OpenAI limita o Whisper por TAMANHO de arquivo (25 MB, não importa a duração), o Gemini limita por TEMPO (10 minutos no plano grátis, até 3 horas no pago), e a ElevenLabs Scribe aceita até 10 horas e 3 GB de uma vez, dividindo o áudio sozinha em pedaços por dentro. Ou seja: o mesmo arquivo de duas horas pode travar numa ferramenta e passar direto por outra, sem você mudar nada além do destino do upload. Quando a ferramenta trava mesmo assim, a saída é dividir o áudio em pedaços menores antes de mandar, e é isso que a maioria dos tutoriais não te ensina a fazer direito.

Por que o app trava bem no meio da sua aula de duas horas?

Toda ferramenta de transcrição por IA impõe um limite, só que cada uma escolhe uma régua diferente:

  • Por tamanho do arquivo (a régua da OpenAI no Whisper): o corte é em megabytes, então um podcast comprimido de duas horas pode passar, enquanto um áudio de vinte minutos gravado sem compressão nenhuma pode travar antes.
  • Por duração (a régua do Gemini): o corte é no relógio, então não importa o tamanho do arquivo, só quantos minutos ele tem.
  • Por duração bem mais generosa, com divisão automática por dentro (a régua da ElevenLabs Scribe): o serviço aceita o arquivo inteiro e ele mesmo quebra em pedaços pra processar em paralelo, sem você perceber.

Isso explica por que a mesma aula de duas horas “não abre” num app e abre direto no outro: você não fez nada errado, só usou a ferramenta com a régua mais curta pra aquele arquivo.

Quanto cada ferramenta aguenta hoje

Ferramenta Limite O que acontece se passar
OpenAI Whisper (API) 25 MB por arquivo, sem limite de duração Erro de upload, precisa comprimir ou dividir
ChatGPT (Record, no app de macOS) 4 horas (240 min) por sessão Ferramenta pensada pra reunião ao vivo, não pra subir um arquivo já gravado
Google Gemini, plano gratuito 10 minutos e 100 MB Trava e pede pra encurtar o áudio
Google Gemini, plano pago (AI Pro/Ultra) Até 3 horas Dá conta da maioria das aulas inteiras
ElevenLabs Scribe 10 horas e 3 GB por arquivo Divide sozinha em segmentos de 8 minutos ou mais e processa em paralelo

Como dividir o áudio sem perder o fio da meada

Se a sua ferramenta trava e você não quer trocar de app nem pagar plano novo, dividir o arquivo resolve. O jeito mais confiável, mesmo sem saber programar, é usar o ffmpeg (gratuito, roda no Windows, Mac e Linux):

ffmpeg -i aula.mp3 -f segment -segment_time 1500 -c copy pedaco_%03d.mp3

Esse comando corta o arquivo aula.mp3 em pedaços de 1.500 segundos (25 minutos) cada, sem recodificar o áudio (por isso é rápido e não perde qualidade). Troque 1500 pelo tamanho de pedaço que a sua ferramenta aceitar.

Três cuidados que fazem diferença na hora de juntar a transcrição de volta:

  1. Corte em silêncio, não no meio de uma frase. Se você tiver como escolher o ponto de corte (ouvindo por cima ou usando um editor simples), prefira um trecho de pausa entre frases. Cortar no meio de uma palavra faz a IA “chutar” o final ou o começo dela.
  2. Numere os pedaços na ordem certa. O %03d do comando acima já faz isso (pedaco_000.mp3, pedaco_001.mp3…), mas se você dividir na mão, mantenha um padrão de número que ordene certo no seu computador.
  3. Junte as transcrições texto por texto, não os áudios. Depois de transcrever cada pedaço separado, cole os textos em sequência num único documento. Juntar os ÁUDIOS de novo e reenviar não resolve nada, e ainda esbarra no mesmo limite.

Antes de subir qualquer pedaço, confira o tamanho real do arquivo gerado. No Windows, clique com o botão direito no arquivo e veja “Propriedades”; no Mac, “Obter Informações” (⌘+I); no Linux, o comando ls -lh pedaco_000.mp3 mostra o tamanho na hora. Se um pedaço ainda estiver acima do limite da sua ferramenta, diminua o segment_time do comando e gere pedaços menores, é mais rápido que ficar comprimindo bitrate na tentativa e erro.

Existe uma ferramenta que já resolve isso sem eu dividir nada?

Existe, e é a ElevenLabs Scribe. Documentação oficial da própria ElevenLabs confirma: arquivos de até 10 horas e 3 GB são aceitos de uma vez, e qualquer áudio com mais de 8 minutos já é dividido sozinho pelo sistema em segmentos processados em paralelo. Pra quem transcreve aula, reunião ou entrevista longa com frequência, é a diferença entre “preciso lembrar de dividir o arquivo toda vez” e “só subo o arquivo inteiro e espero”.

Se o seu uso principal é ata de reunião no dia a dia (não aula de duas horas), vale conferir o comparativo específico de IA para transcrever áudio de WhatsApp e reunião, que cobre esse caso mais curto e mais comum. E se o que você quer no fim das contas é legenda pronta pra postar, não só o texto cru, o caminho está em legenda automática e transcrição com IA.

A transcrição erra mais em áudio longo do que em áudio curto?

Não pela duração em si, mas pelo que costuma vir junto de um áudio longo: mais ruído de fundo, mais gente falando ao mesmo tempo, mais troca de assunto. Os benchmarks de 2026 mostram acurácia de 95% a 98% em áudio limpo pros melhores modelos, mas essa margem cai bastante assim que entra sotaque forte, gente disputando a fala ou barulho de ambiente, exatamente o que uma aula de duas horas tem mais chance de ter do que um áudio de dois minutos.

Na prática: divida o áudio pelo TAMANHO permitido pela ferramenta, mas revise o texto final com mais atenção nos trechos que você lembra que tiveram barulho ou gente interrompendo. É ali que o erro se concentra.

Um detalhe que ajuda bastante em aula gravada: se o professor usa microfone de lapela ou headset, o áudio chega mais limpo do que o microfone embutido do computador captando a sala inteira. Se você tem escolha na hora de gravar, um microfone mais perto da boca vale mais do que qualquer ajuste que você faça depois na transcrição.

Vale pagar plano premium só pra transcrever áudio mais longo?

Depende da frequência. Se você transcreve uma aula de duas horas uma vez por mês, dividir o arquivo com ffmpeg (gratuito) resolve sem custo nenhum. Se isso é rotina semanal, o tempo que você gasta dividindo e juntando pedaços rapidamente supera o valor de um plano pago que aceita o arquivo inteiro de uma vez, seja o Gemini Pro (até 3 horas) ou a ElevenLabs Scribe (até 10 horas). Meça primeiro quantas vezes por mês você bate nesse limite antes de decidir.

Sobre a CPDF (Comunidade Profissionais do Futuro - por Danilo Gato): esse tipo de escolha de ferramenta certa pra cada rotina é parte do que a gente trabalha dentro da comunidade, pra quem usa IA todo santo dia não perder tempo redescobrindo limite de app.

Leia também

Tecnologia e IA

Gemini Notebook: limites flexíveis a cada 5 h desde 2 set

O Gemini Notebook adotará limites flexíveis com renovação a cada 5 horas, mudando de cotas diárias para um modelo baseado em computação. Explico o que muda, por que muda e como adaptar o fluxo de trabalho para manter produtividade, com dicas práticas e estudos de caso reais.

11 min de leitura
Inteligência Artificial

Perplexity lança agente de IA local-first on-device privado

A Perplexity lançou um agente de IA local-first, projetado para executar no dispositivo, preservar dados sensíveis e cortar gastos com tokens. O sistema combina um modelo de 27B otimizado com um harness próprio e só escala para a nuvem quando precisa, unindo privacidade e eficiência para o trabalho do conhecimento.

9 min de leitura
IA generativa

Grok Bot agora no SuperGrok Plus, Cursor Pro+ e Teams

A x.ai tornou o Grok Bot disponível no SuperGrok Plus, no Cursor Pro+ e em todos os planos Cursor Teams. Veja o que muda na prática, como funciona a computação dedicada em nuvem, quais os preços e as implicações para segurança, governança e produtividade.

10 min de leitura
Tecnologia e IA

OpenHistory app Mac open-source rastreia o dia com IA local

OpenHistory coloca em destaque uma tendência no Mac, apps open-source que registram o trabalho do dia e produzem resumos com IA no dispositivo. O artigo analisa como isso funciona, por que a privacidade melhora, quais limites técnicos existem e compara alternativas como Dayflow e outras soluções locais.

11 min de leitura

Tags

produtividadeia-para-tarefatranscricao