Thumbnail de vídeo com IA: o enquadramento que deixa espaço pro texto e não corta o rosto
Danilo Gato
Autor
Resposta rápida
Pra criar uma thumbnail com IA que funciona de verdade, o segredo não está só no visual bonito: está no enquadramento. Peça uma imagem em 16:9, com o assunto principal (rosto ou objeto) posicionado no terço esquerdo ou centro do quadro, deixando o terço direito e a faixa inferior direita livres de detalhe importante. Essa área fica sempre coberta pela duração do vídeo que o YouTube sobrepõe automaticamente, e é também onde você vai colocar o texto de apoio depois. Peça também “rosto inteiro, sem cortar queixo ou topo da cabeça” na descrição do enquadramento, porque é o erro mais comum de modelo de IA gerando retrato: cortar justamente a parte que devia ficar visível.
Por que o enquadramento importa mais que o estilo visual
Uma thumbnail bonita que esconde ou corta o que devia estar em destaque perde a função dela. Segundo a própria documentação da YouTube (CPDF: Comunidade Profissionais do Futuro, por Danilo Gato, usa esse dado com frequência nos cursos de conteúdo), o formato recomendado é 16:9, com resolução mínima de 1280x720 e ideal de 3840x2160, em JPG ou PNG. Isso já define o canvas que você pede pra IA gerar, mas o canvas certo não resolve sozinho: dentro dele existe uma área que o próprio YouTube cobre com a barra de duração do vídeo, sempre no canto inferior direito. Qualquer rosto, texto ou logo posicionado ali some parcialmente assim que o vídeo aparece na lista de recomendados, mesmo que a imagem original estivesse perfeita.
Onde o YouTube corta, e onde colocar o que importa
A regra prática que funciona em qualquer editor ou gerador de imagem: pense no quadro dividido em uma grade de três colunas. A coluna da esquerda e o centro são a área “segura”, onde rosto, produto ou elemento principal pode ficar sem risco de corte visual. A faixa dos últimos 15% no canto inferior direito é território do timestamp, então texto, olho e detalhe fino não vão ali. O espaço que sobra no terço superior ou no canto oposto é onde entra o texto de apoio (2 a 4 palavras, letra grande), que normalmente você adiciona depois, num editor separado, por cima da imagem gerada pela IA.
Como pedir isso no prompt, com exemplo aplicado
A maioria das pessoas pede “uma thumbnail chamativa sobre X” e recebe uma imagem centralizada, sem espaço pra nada. O prompt que resolve isso descreve a composição, não só o tema:
Prompt fraco: “cria uma thumbnail de vídeo sobre produtividade com IA, estilo chamativo”
Prompt que funciona: “foto realista, still de vídeo, pessoa olhando pra câmera com expressão de surpresa, enquadrada no terço esquerdo do quadro, corpo a partir do peito, rosto inteiro visível sem cortar queixo nem topo da cabeça, fundo desfocado com tons de azul, espaço vazio e liso ocupando o terço direito e metade superior, sem nenhum texto ou elemento na imagem, formato 16:9, resolução alta”
A diferença entre os dois é que o segundo diz onde a pessoa fica, quanto do corpo aparece, o que não pode ser cortado, e onde fica o vazio. “Espaço vazio e liso” é a instrução que evita a IA preencher o quadro inteiro com detalhe, que é o comportamento padrão da maioria dos modelos quando não recebem essa restrição.
O erro mais comum: o rosto cortado
Modelos de geração de imagem tendem a enquadrar rosto “à francesa”, cortando parte do topo da cabeça ou do queixo pra caber no formato, porque foram treinados majoritariamente em fotos de retrato tradicional (proporção mais vertical), não no formato largo 16:9 que a thumbnail exige. Pra corrigir isso sem regenerar do zero, existem três caminhos: pedir explicitamente “corpo a partir do peito ou da cintura, rosto inteiro visível” no prompt (a solução mais barata); usar a função de expansão de imagem (outpainting) pra esticar o fundo pros lados sem mexer no rosto já enquadrado certo; ou gerar em proporção vertical primeiro e recortar o 16:9 depois, escolhendo você mesmo onde corta, em vez de deixar o modelo decidir.
Rosto de verdade puxa mais clique, mas com uma condição
Vale saber por que vale o esforço: estudos de comportamento de clique no YouTube mostram que thumbnails com rosto, principalmente com expressão de emoção clara (surpresa, curiosidade, entusiasmo) e contato visual direto com a câmera, aumentam o CTR em torno de 20 a 30% comparado a thumbnails sem rosto. A pesquisa também mostra que isso depende do nicho e de quão reconhecível você é pro seu público, então não é regra universal, mas é o padrão mais consistente entre os canais que medem isso de verdade. A expressão importa mais que a beleza da imagem: um rosto genérico e neutro converte pior que um rosto expressivo, mesmo que a arte ao redor seja mais simples.
E quando o vídeo é vertical (Shorts, Reels, TikTok)
A lógica muda de proporção, mas não muda de princípio. Pra Shorts, o formato recomendado é 9:16, e a área “segura” desloca pro centro vertical do quadro: os cantos superior e inferior costumam ficar cobertos por elementos da interface (nome do canal, botões de curtir e comentar, legenda automática), então o rosto ou o elemento principal precisa ficar concentrado no terço central, não nas bordas. Se você está adaptando uma imagem 16:9 que já gerou pra virar capa de Short, o caminho mais seguro é pedir uma versão nova em 9:16 direto no prompt, e não simplesmente esticar ou cortar a imagem horizontal, porque o corte quase sempre tira metade do rosto ou empurra o assunto pra fora do centro. A instrução de prompt fica parecida com a da versão horizontal, só trocando “formato 16:9” por “formato vertical 9:16, assunto centralizado, margem livre em cima e embaixo”.
Checklist antes de publicar a thumbnail
Antes de aprovar a imagem gerada, confira estes cinco pontos, na ordem que mais gente erra:
- Formato e tamanho: 16:9, pelo menos 1280x720, JPG ou PNG.
- Canto inferior direito livre: nada importante nos últimos 15% dessa área, é onde entra o timestamp.
- Rosto inteiro visível: sem cortar queixo, testa ou topo da cabeça.
- Espaço reservado pro texto: pelo menos um terço do quadro liso, sem detalhe competindo com a letra que vem depois.
- Expressão clara: se tem rosto na imagem, ele precisa comunicar uma emoção legível em miniatura, porque é assim que a thumbnail aparece na maior parte das telas.
Esses cinco pontos resolvem sozinhos a maior parte das thumbnails que “saem feias” mesmo com um gerador de imagem bom: o problema quase nunca é a qualidade da IA, é a falta de instrução sobre onde as coisas ficam dentro do quadro.
Vale também testar a imagem em tamanho pequeno antes de publicar, do jeito que ela vai aparecer de verdade pra maioria de quem rola o feed no celular. Reduza a pré-visualização até uns 200 pixels de largura na tela do computador, ou olhe ela na tela do celular mesmo: se o rosto ainda está reconhecível e a emoção ainda está clara nesse tamanho pequeno, a thumbnail passou no teste que importa. Se ficou uma mancha sem expressão definida, o problema geralmente está no enquadramento fechado demais ou no contraste baixo entre o assunto e o fundo, dois ajustes rápidos de refazer no prompt antes de aprovar a versão final.
Se você ainda está ajustando cor e luz da imagem antes de chegar no enquadramento, vale ler antes o artigo sobre iluminação e lente no prompt de imagem, que cobre a parte técnica da cena que entra junto com esse tipo de pedido. E se a IA está incluindo elementos que você não pediu (texto quebrado, marca d’água falsa, mão extra no canto), o artigo sobre prompt negativo ensina a excluir isso direto no pedido, em vez de corrigir depois no editor.
Leia também
Pedir pra IA revisar a própria resposta: as perguntas que fazem ela achar o erro sozinha
Pedir concordância traz concordância. Veja as perguntas certas pra fazer a IA achar o próprio erro antes de você usar a resposta.
6 min de leituraprompt de imagemTransformar foto em vídeo com IA: como descrever o movimento para o rosto não derreter
Como descrever o movimento numa foto animada com IA sem o rosto distorcer ou mudar.
6 min de leituraprompt de imagemDuas pessoas na mesma imagem de IA: como descrever cada uma sem elas se misturarem
Como escrever um prompt com duas pessoas sem a IA misturar roupa, cabelo e rosto de uma na outra.
7 min de leiturareceita de promptCenário no prompt de imagem: como a IA para de inventar o fundo
Como descrever o lugar em camadas pra IA parar de inventar o fundo, e travar o cenário sem perder o resto da imagem.
8 min de leitura