Câmera e microfone em estúdio de podcast, ilustrando referência de voz e cena no vídeo generativo
IA Generativa

xAI Imagine Video 1.5 adiciona refs de imagem e voz, 1080p

A xAI liberou no dia 31 de julho de 2026 o Imagine Video 1.5 com referências de imagem e voz e geração nativa em 1080p em text-to-video, ampliando controle criativo e consistência de personagens para criadores e equipes.

Danilo Gato

Danilo Gato

Autor

1 de agosto de 2026
9 min de leitura

Introdução

Imagine Video 1.5 é a aposta mais recente da xAI para vídeo generativo, agora com referências de imagem e voz e suporte nativo a 1080p em text-to-video. O anúncio foi publicado em 31 de julho de 2026 e inicia a liberação nos Estados Unidos para assinantes SuperGrok Heavy e SuperGrok Plus, com expansão aos demais planos nos próximos dias. (x.ai)

A novidade posiciona o modelo como opção prática para quem precisa de consistência visual e sonora, além de maior resolução na geração direta a partir de texto. Text-to-video e image-to-video ganham 1080p nativo. Já o modo reference-to-video, que usa imagens e voz como guias, mantém resolução máxima de 720p e até sete imagens de referência por geração. (docs.x.ai)

O que há de novo no Imagine Video 1.5

A xAI detalha três avanços principais. Primeiro, text-to-video agora gera nativamente em 1080p, disponível no site, iOS e Android. Segundo, referências de imagem e voz permitem fixar elementos como rosto, produto ou cenário, mantendo a mesma voz do personagem durante o vídeo. Terceiro, o lançamento inclui disponibilidade imediata nos EUA para níveis SuperGrok Heavy e Plus, com rollout em seguida. Esses pontos, além da expansão do API, aparecem no comunicado oficial. (x.ai)

Para quem atua com storytelling, publicidade e social, a combinação de controle por referências com 1080p em text-to-video melhora previsibilidade, sobretudo quando o requisito é manter identidade visual de um protagonista, repetir um cenário de marca ou sincronizar uma voz característica em múltiplas cenas. No ecossistema Grok, isso se soma a melhorias anunciadas no mês anterior em física, movimento e áudio, base do salto de qualidade percebido pelos criadores. (x.ai)

Como funcionam as referências de imagem e voz

O fluxo de reference-to-video aceita até sete imagens de referência, cada uma bloqueando um aspecto, por exemplo, o rosto do personagem, um produto em primeiro plano ou o ambiente. Também é possível escolher uma voz pré-configurada para manter timbre consistente, característica útil em séries de vídeos e campanhas. Segundo a documentação, o modo aceita URLs públicos, data URI em base64 ou file_id via Files API. (docs.x.ai)

Alguns limites importam para o planejamento. O reference-to-video no Imagine Video 1.5 atualmente suporta no máximo 720p e até 15 segundos por geração, além de até três vozes pré-definidas no modelo para seleção via voice_id. Upload de voz própria ainda não é suportado e o modo não combina com image-to-video ou edição de vídeo na mesma chamada. Esses detalhes técnicos, embora pareçam restritivos, ajudam a garantir performance e previsibilidade. (docs.x.ai)

Text-to-video com 1080p nativo, quando usar

O suporte nativo a 1080p em text-to-video é o destaque para quem deseja gerar clipes diretamente de prompts sem imagem inicial. Conforme a própria xAI, esse modo agora entrega 1080p nativo, com parâmetros de duração, proporção de tela e resolução configuráveis. Vale notar que exemplos de SDK ainda mostram 720p por padrão, então ajustar explicitamente a resolução evita resultados abaixo do esperado. (docs.x.ai)

Em pipelines práticos, use text-to-video 1080p quando qualidade de exibição e nitidez forem prioridade, como thumbnails animadas, aberturas de vídeos institucionais, inserts para mídia paga e demos de produto. Em contrapartida, se a exigência for consistência rígida de um rosto de personagem entre vídeos, o reference-to-video com 720p pode ser preferível como etapa de storyboard ou prototipagem, seguido de upscaling ou reinterpretação em 1080p quando possível. (docs.x.ai)

Disponibilidade, apps e API

O anúncio confirma que referências de imagem e voz começam a valer imediatamente para clientes SuperGrok Heavy e SuperGrok Plus nos Estados Unidos, e que o rollout aos demais planos ocorrerá nos dias seguintes. Além disso, text-to-video e 1080p nativo estão disponíveis no site grok.com, no app para iOS e no app para Android. Para equipes técnicas, o recurso está exposto na xAI API com o modelo grok-imagine-video-1.5. (x.ai)

Na documentação, a seção de Video Generation reforça que o 1080p nativo vale para text-to-video no Imagine Video 1.5, descreve a natureza assíncrona das gerações e mostra exemplos de uso no SDK e via REST. Já a página de Reference-to-Video detalha o limite de 720p nesse modo, duração e quantidade de referências. Esses pontos norteiam escolhas de arquitetura para quem integra a API a produtos. (docs.x.ai)

Exemplos de uso e melhores práticas

  • Personagem consistente em série curta. Use 3 a 5 imagens que cubram ângulos e expressões do personagem e selecione a mesma voice_id em todos os episódios. Limite a duração para até 15 segundos por geração e trabalhe por cenas, unindo-as na pós. (docs.x.ai)
  • Produto e cenário fixos, ação variável. Trave a cena com uma imagem do set e outra do produto. Peça variações de ação no prompt. A vantagem é manter ambientação contínua sem drift visual entre vídeos. (docs.x.ai)
  • Text-to-video como base de qualidade. Quando a prioridade é nitidez e exibição em telas grandes, priorize text-to-video em 1080p nativo e guie estilo e paleta no prompt. Ajuste duração e aspect ratio conforme o canal de distribuição. (docs.x.ai)

Para lidar com o tempo de geração, que pode variar conforme complexidade, duração e resolução, projete filas assíncronas e notificação por webhook no seu backend. Isso reduz timeout e melhora UX em apps de criação colaborativa. (docs.x.ai)

Como o lançamento se compara ao mercado

No ecossistema concorrente, o Google Veo 3.1 oferece 1080p e até 4K via Gemini API, Vertex AI e Flow, com foco em qualidade de produção e consistência de personagens e cenários. Isso eleva a régua para entregas premium e pressiona players a igualar controles de identidade. Por outro lado, a proposta da xAI simplifica a adoção com referências e 1080p nativo em text-to-video, facilitando iteração rápida. (blog.google)

O cenário pós-Sora também abre espaço para alternativas. A OpenAI descontinuou o aplicativo e a experiência web do Sora em 26 de abril de 2026, informando que a API será descontinuada em 24 de setembro de 2026. Com essa janela se fechando, criadores e plataformas que dependiam de Sora migram fluxos para Veo, Runway e, agora, para Imagine Video 1.5 com referências. (openai.com)

No caso da Runway, a linha Gen-3 Alpha saiu de cena em julho de 2026 para dar lugar a novas gerações. Embora a empresa avance em recursos de controle e captura de expressão, a retirada programada do Gen-3 Alpha e do Gen-3 Alpha Turbo em julho indica ritmo acelerado de substituição por modelos mais recentes, o que reforça a importância de APIs estáveis e documentação clara, ponto em que a xAI enfatiza limites e modos por página. (help.runwayml.com)

Ilustração do artigo

Casos reais que ganham com referências e 1080p

  • Marcas com personagens proprietários. O reference-to-video bloqueia o rosto, preserva identidade e evita deriva visual entre episódios, algo crítico para mascotes e apresentadores virtuais. Combine com voice_id para manter assinatura vocal. (docs.x.ai)
  • Podcasts e videocasts animados. As referências de cena seguram o estúdio, enquanto a voz selecionada garante uniformidade de narração em vinhetas. Para versões finais, gere inserts em 1080p via text-to-video com estilo alinhado à identidade visual. (x.ai)
  • E-commerce e demonstração de produto. Trave o cenário e o item em destaque e varie ação e enquadramento. Gerações curtas em 720p servem para protótipos e testes A/B, enquanto 1080p em text-to-video entrega materiais finais para canais de alta resolução. (docs.x.ai)

Guia rápido de implementação na API

  • Escolha o modo certo. Use text-to-video para 1080p nativo e reference-to-video quando consistência visual for prioridade, aceitando 720p. (docs.x.ai)
  • Parametrize explicitamente. Defina resolution como 1080p no text-to-video para evitar defaults de 720p. Para reference-to-video, respeite 720p e duração até 15 segundos. (docs.x.ai)
  • Organize referências. Envie URLs públicos ou file_id via Files API. Priorize 3 a 5 imagens com variação de ângulos e luz. (docs.x.ai)
  • Planeje filas assíncronas. Geração é assíncrona, então implemente polling ou callbacks no backend, exibindo estado de progresso no front. (docs.x.ai)

Exemplo mínimo em Python para text-to-video com 1080p nativo no Imagine Video 1.5:

response = client.video.generate(
    prompt="Câmera em dolly-in sobre uma cidade neon à noite, chuva suave e reflexos no asfalto",
    model="grok-imagine-video-1.5",
    duration=8,
    aspect_ratio="16:9",
    resolution="1080p"
)

Segundo a própria documentação, a escolha de resolução, duração e complexidade do prompt afeta diretamente tempo de render e fila. Em fluxos com alto volume, vale tratar tempos máximos por job e retentativas controladas. (docs.x.ai)

Limitações, riscos e o que observar

  • Qualidade por modo. A 1080p nativo está em text-to-video e image-to-video, não em reference-to-video, que permanece em 720p. Isso exige pensar em upscaling e composição quando consistência visual é mandatória. (x.ai)
  • Voz por preset. O recurso de voz usa presets do modelo e, conforme a documentação, upload de áudio próprio não é suportado neste modo, com acesso sob solicitação. Isso simplifica conformidade, porém reduz flexibilidade em casos com vozes proprietárias. (x.ai)
  • Convergência do mercado. Com Veo entregando 1080p e 4K em contextos enterprise e o Sora em fase de desligamento, times devem avaliar custo, latência, controles de segurança e metadata. O tabuleiro muda rápido e cada API impõe limites operacionais distintos. (blog.google)

Reflexões e insights

O movimento da xAI acerta no pragmatismo. Ao dar 1080p nativo em text-to-video e manter um canal de consistência por referências, o modelo cobre os dois extremos que mais doem no dia a dia, qualidade de exibição e identidade persistente. A segmentação por modo, com regras claras de duração, resolução e número de referências, facilita previsibilidade em produção, reduzindo surpresas em lotes e integrando melhor com pipelines de edição.

Outro ponto positivo é a documentação granular por modo, algo que nem sempre aparece com a mesma clareza em concorrentes. Em cenários com calendário apertado e múltiplos stakeholders, ter especificações objetivas, como o teto de 720p para reference-to-video, ajuda PMs e engenheiros a compor escopos realistas sem prometer o que a API não entrega. (docs.x.ai)

Conclusão

Imagine Video 1.5 amplia o controle criativo com referências de imagem e voz e destrava 1080p nativo em text-to-video, atendendo demandas de consistência e qualidade com rotas práticas de adoção. A liberação a partir de 31 de julho de 2026 para clientes nos EUA e a presença em apps e API aceleram testes e integrações reais. (x.ai)

No contexto de um mercado que viu a saída do Sora e a escalada de resoluções no Veo, o pacote da xAI entrega um equilíbrio interessante entre velocidade, previsibilidade e controle. Cabe aos times avaliar quando priorizar identidade rígida via referências em 720p e quando investir em 1080p nativo em text-to-video para entregar acabamento final, construindo uma linha de produção que minimize retrabalho e maximize impacto visual. (help.openai.com)

Leia também

Tecnologia e IA

Hank Green pausa canais após admitir dependência não saudável de IA

Hank Green anunciou uma pausa em seus canais após admitir uma dependência não saudável de IA para pesquisa e escrita. O caso expõe o choque entre escala e qualidade, pressiona o YouTube a aplicar políticas contra conteúdo massificado, e oferece lições práticas para criadores que querem usar IA com responsabilidade.

8 min de leitura
IA Generativa

HeyGen lança vídeo podcast de dois hosts via docs e links

A HeyGen apresentou um recurso que converte documentos e links em programas de vídeo com dois apresentadores gerados por IA. O formato agiliza a produção, melhora retenção e escala distribuição com traduções e dublagem sincronizada. Entenda funcionalidades, limites e onde aplicar com ROI.

7 min de leitura
IA Generativa

Mirage lança Avatar X, IA com microexpressões e setup 10 s

Avatar X, da Mirage, chega com a promessa de preservar microexpressões e configurar em 10 segundos. O modelo integra voz, olhar e linguagem corporal, mirando casos práticos como anúncios, tutoriais e atendimento. Veja como se posiciona frente a rivais e pesquisas recentes.

9 min de leitura
IA e Produtividade

xAI lança Grok Build Mode Beta, crie apps, jogos e sites

O Grok Build Mode entrou em beta e permite criar apps, jogos, sites e dashboards direto no chat, com prévia ao vivo e publicação em um link grok.me. Disponível para assinantes SuperGrok Heavy no web, iOS e Android, o recurso promete acelerar prototipagem, validação e compartilhamento com segurança e praticidade.

8 min de leitura

Tags

xAIGeração de VídeoModelos Multimodais