Áudio no prompt de vídeo de IA: o que dá pra pedir de som
video com ia

Áudio no prompt de vídeo de IA: o que dá pra pedir de som

Danilo Gato

Autor

12 de setembro de 2026
6 min de leitura

Resposta rápida

Sim, dá pra pedir áudio dentro do prompt de vídeo de IA, e isso mudou bastante nos últimos meses: as três ferramentas mais usadas hoje (Google Veo 3, Kling e Runway) já geram vídeo e som juntos, numa única passada, sem precisar de dublagem ou trilha adicionada depois. Você pode descrever diálogo, efeito sonoro, som ambiente e até estilo de trilha diretamente no texto do prompt. O que a IA ainda erra bastante: diálogo com mais de um personagem falando (a sincronia labial cai de forma acentuada quando são vários falantes ao mesmo tempo), letra de música exata ou faixa protegida por direito autoral, e controle fino de volume entre elementos (ela mistura o áudio inteiro por conta própria, você não ajusta cada camada separadamente).

Sou o Danilo Gato, fundador da CPDF (Comunidade Profissionais do Futuro - por Danilo Gato), e esse é um dos avanços mais recentes em vídeo de IA que muda de verdade o fluxo de quem cria conteúdo: até pouco tempo, todo vídeo gerado saía mudo.

Dá pra pedir som no prompt de vídeo de IA?

Dá, mas depende de QUAL ferramenta e QUAL versão do modelo. Até 2025, a regra geral era: vídeo gerado por IA sai mudo, e você adiciona trilha, efeito e narração depois, num editor separado. Isso mudou com a chegada do áudio nativo: o modelo gera imagem e som ao mesmo tempo, na mesma geração, sincronizados automaticamente. O Google foi o primeiro a popularizar isso com o Veo 3, que gera diálogo, som ambiente, efeito sonoro e música de fundo perfeitamente sincronizados com o vídeo, numa passada só. O Kling seguiu o mesmo caminho a partir do modelo de vídeo 2.6, com a função chamada Native Audio, e o Runway trouxe áudio nativo a partir do Gen-4, evoluindo no Gen-4.5 com integração de áudio via ElevenLabs.

Antes disso, o Kling só gerava “visual mudo”, e quem queria som precisava caçar voz e efeito à parte e encaixar na edição. Se você usa uma ferramenta ou uma versão mais antiga, vale conferir se ela já suporta áudio nativo antes de escrever um prompt pedindo som, porque o modelo simplesmente ignora esse pedido se não tiver o recurso.

Como pedir diálogo (fala) no prompt, e onde ele falha

Pra pedir fala, descreva o que o personagem diz entre aspas dentro do prompt, junto com o tom (sussurrando, gritando, num tom calmo) e, se possível, o sotaque ou idioma. O ponto forte aqui é o diálogo de UM personagem só: a sincronia labial funciona bem na maior parte das vezes. O problema aparece quando você pede diálogo entre DOIS OU MAIS personagens na mesma cena: a taxa de acerto da sincronia cai muito, e é comum o áudio de um personagem sair “colado” na boca do outro, ou os dois falarem ao mesmo tempo quando você pediu um diálogo alternado.

Recomendação prática: se a cena exige conversa entre duas pessoas, considere gerar cada fala num clipe separado (um personagem por vez) e editar o corte depois, em vez de forçar os dois falando na mesma geração.

Um exemplo de prompt de diálogo de UM personagem, no formato que costuma funcionar melhor:

Uma mulher de jaqueta de couro, sentada num café, olha pra câmera e diz,
num tom calmo e confiante: "Isso aqui vai mudar a forma como você trabalha."
Som ambiente de café ao fundo, xícaras batendo baixinho, murmúrio distante de conversa.

Note a separação clara: a FALA vem entre aspas, o TOM vem descrito antes da fala, e o AMBIENTE vem depois, como uma camada separada. Misturar tudo numa frase só, sem essa separação, tende a confundir o modelo sobre o que é fala e o que é som de fundo.

Como pedir efeito sonoro e som ambiente

Aqui o resultado costuma ser mais confiável do que o diálogo. Descrever o ambiente da cena já ajuda o modelo a inferir o som certo (chuva, vento, buzina de carro, passos, som de multidão), mas o ideal é nomear o efeito específico que você quer no prompt, assim como você nomeia um elemento visual. Sons de natureza (floresta, oceano, chuva, vento, pássaros) e efeitos climáticos costumam sair com qualidade natural. Efeito muito específico ou raro (uma marca de produto fazendo um som característico, por exemplo) tem taxa de acerto menor, porque o modelo nunca “ouviu” aquele som de referência.

Como pedir trilha ou música de fundo

Descreva o ESTILO da música, não peça uma música existente pelo nome. Frases como “trilha acústica animada de violão” ou “trilha orquestral melancólica de fundo” funcionam bem, porque o modelo compõe algo original no estilo pedido. O que não funciona: pedir uma música específica e protegida por direito autoral (o modelo é bloqueado de propósito pra não reproduzir obra registrada), ou pedir a letra exata de uma canção conhecida.

Se o vídeo é pra rede social e vai concorrer com áudio de trilha viral, vale saber que a IA não reproduz esse tipo de faixa: ela compõe algo NO ESTILO pedido, nunca a faixa original. Pra esse caso específico, o caminho mais confiável ainda é gerar o vídeo mudo (ou com trilha própria) e adicionar a trilha viral depois, na edição.

O vídeo saiu sem som nenhum, mesmo eu tendo pedido. Por quê?

Três causas prováveis, na ordem mais comum:

  1. A ferramenta ou o modelo escolhido não tem áudio nativo. Confira se você está usando a versão certa (por exemplo, Kling antes do modelo 2.6 não gera áudio de jeito nenhum, só o vídeo mudo de sempre).
  2. O prompt descreveu a cena, mas não pediu som explicitamente. Diferente do visual, onde o modelo sempre preenche alguma coisa mesmo sem detalhe, o áudio às vezes só aparece quando é pedido com uma frase própria pra ele, separada da descrição da cena.
  3. O plano ou o modo de geração não inclui áudio. Algumas ferramentas cobram à parte, ou têm um modo “rápido”/“rascunho” que gera só o vídeo, deixando o áudio pra uma segunda passada opcional.

O que a IA ignora ou erra ao pedir áudio

Resumindo os pontos fracos, na ordem do que mais trava:

  1. Diálogo com múltiplos personagens. A sincronia labial de um personagem só costuma acertar na maior parte das gerações; com dois ou mais falando, a taxa de acerto despenca.
  2. Música ou voz protegida por direito autoral. O modelo se recusa a reproduzir com fidelidade, de propósito.
  3. Controle fino de mixagem. Você não ajusta o volume de cada camada de áudio (diálogo, efeito, trilha) separadamente depois. A IA decide a mixagem inteira sozinha, na hora de gerar.
  4. Timing exato de fala muito longa. Frases curtas sincronizam melhor que parágrafos inteiros, porque o modelo precisa encaixar a duração da fala dentro da duração do clipe (geralmente 5 a 8 segundos).
  5. Ferramenta ou versão sem áudio nativo. Se o modelo que você está usando ainda não tem esse recurso, ele ignora completamente o pedido de som e entrega o vídeo mudo de sempre.

Quais ferramentas têm áudio nativo, e desde quando

Ferramenta Áudio nativo desde O que gera
Google Veo 3 Lançamento do Veo 3 Diálogo, som ambiente, efeito sonoro, música de fundo, tudo sincronizado
Kling Modelo de vídeo 2.6 (função Native Audio) Voz, efeito sonoro, som ambiente, inclusive canto
Runway Gen-4, evoluído no Gen-4.5 Diálogo, trilha de fundo, áudio sincronizado (integração com ElevenLabs no Gen-4.5)

Se você ainda não decidiu qual ferramenta usar pro seu projeto de vídeo, os guias completos de cada uma cobrem o fluxo do zero: Como usar o Google Veo 3, Como usar o Kling AI: gerar vídeos realistas com inteligência artificial e Como usar o Runway. E se a dúvida for sobre manter o mesmo personagem falando em várias cenas diferentes, isso é resolvido numa etapa anterior à do áudio: veja em Personagem consistente em vídeo com IA.

Na CPDF a gente testa cada recurso novo de vídeo com IA direto na ferramenta antes de levar pra aula, porque áudio nativo é recente o suficiente pra mudar de comportamento a cada atualização de modelo.

Leia também

Tags

video com iaaudio nativoveoklingrunway