xAI Imagine Video 1.5 adiciona refs de imagem e voz, 1080p
A xAI liberou no dia 31 de julho de 2026 o Imagine Video 1.5 com referências de imagem e voz e geração nativa em 1080p em text-to-video, ampliando controle criativo e consistência de personagens para criadores e equipes.
Danilo Gato
Autor
Introdução
Imagine Video 1.5 é a aposta mais recente da xAI para vídeo generativo, agora com referências de imagem e voz e suporte nativo a 1080p em text-to-video. O anúncio foi publicado em 31 de julho de 2026 e inicia a liberação nos Estados Unidos para assinantes SuperGrok Heavy e SuperGrok Plus, com expansão aos demais planos nos próximos dias. (x.ai)
A novidade posiciona o modelo como opção prática para quem precisa de consistência visual e sonora, além de maior resolução na geração direta a partir de texto. Text-to-video e image-to-video ganham 1080p nativo. Já o modo reference-to-video, que usa imagens e voz como guias, mantém resolução máxima de 720p e até sete imagens de referência por geração. (docs.x.ai)
O que há de novo no Imagine Video 1.5
A xAI detalha três avanços principais. Primeiro, text-to-video agora gera nativamente em 1080p, disponível no site, iOS e Android. Segundo, referências de imagem e voz permitem fixar elementos como rosto, produto ou cenário, mantendo a mesma voz do personagem durante o vídeo. Terceiro, o lançamento inclui disponibilidade imediata nos EUA para níveis SuperGrok Heavy e Plus, com rollout em seguida. Esses pontos, além da expansão do API, aparecem no comunicado oficial. (x.ai)
Para quem atua com storytelling, publicidade e social, a combinação de controle por referências com 1080p em text-to-video melhora previsibilidade, sobretudo quando o requisito é manter identidade visual de um protagonista, repetir um cenário de marca ou sincronizar uma voz característica em múltiplas cenas. No ecossistema Grok, isso se soma a melhorias anunciadas no mês anterior em física, movimento e áudio, base do salto de qualidade percebido pelos criadores. (x.ai)
Como funcionam as referências de imagem e voz
O fluxo de reference-to-video aceita até sete imagens de referência, cada uma bloqueando um aspecto, por exemplo, o rosto do personagem, um produto em primeiro plano ou o ambiente. Também é possível escolher uma voz pré-configurada para manter timbre consistente, característica útil em séries de vídeos e campanhas. Segundo a documentação, o modo aceita URLs públicos, data URI em base64 ou file_id via Files API. (docs.x.ai)
Alguns limites importam para o planejamento. O reference-to-video no Imagine Video 1.5 atualmente suporta no máximo 720p e até 15 segundos por geração, além de até três vozes pré-definidas no modelo para seleção via voice_id. Upload de voz própria ainda não é suportado e o modo não combina com image-to-video ou edição de vídeo na mesma chamada. Esses detalhes técnicos, embora pareçam restritivos, ajudam a garantir performance e previsibilidade. (docs.x.ai)
Text-to-video com 1080p nativo, quando usar
O suporte nativo a 1080p em text-to-video é o destaque para quem deseja gerar clipes diretamente de prompts sem imagem inicial. Conforme a própria xAI, esse modo agora entrega 1080p nativo, com parâmetros de duração, proporção de tela e resolução configuráveis. Vale notar que exemplos de SDK ainda mostram 720p por padrão, então ajustar explicitamente a resolução evita resultados abaixo do esperado. (docs.x.ai)
Em pipelines práticos, use text-to-video 1080p quando qualidade de exibição e nitidez forem prioridade, como thumbnails animadas, aberturas de vídeos institucionais, inserts para mídia paga e demos de produto. Em contrapartida, se a exigência for consistência rígida de um rosto de personagem entre vídeos, o reference-to-video com 720p pode ser preferível como etapa de storyboard ou prototipagem, seguido de upscaling ou reinterpretação em 1080p quando possível. (docs.x.ai)
Disponibilidade, apps e API
O anúncio confirma que referências de imagem e voz começam a valer imediatamente para clientes SuperGrok Heavy e SuperGrok Plus nos Estados Unidos, e que o rollout aos demais planos ocorrerá nos dias seguintes. Além disso, text-to-video e 1080p nativo estão disponíveis no site grok.com, no app para iOS e no app para Android. Para equipes técnicas, o recurso está exposto na xAI API com o modelo grok-imagine-video-1.5. (x.ai)
Na documentação, a seção de Video Generation reforça que o 1080p nativo vale para text-to-video no Imagine Video 1.5, descreve a natureza assíncrona das gerações e mostra exemplos de uso no SDK e via REST. Já a página de Reference-to-Video detalha o limite de 720p nesse modo, duração e quantidade de referências. Esses pontos norteiam escolhas de arquitetura para quem integra a API a produtos. (docs.x.ai)
Exemplos de uso e melhores práticas
- Personagem consistente em série curta. Use 3 a 5 imagens que cubram ângulos e expressões do personagem e selecione a mesma voice_id em todos os episódios. Limite a duração para até 15 segundos por geração e trabalhe por cenas, unindo-as na pós. (docs.x.ai)
- Produto e cenário fixos, ação variável. Trave a cena com uma imagem do set e outra do produto. Peça variações de ação no prompt. A vantagem é manter ambientação contínua sem drift visual entre vídeos. (docs.x.ai)
- Text-to-video como base de qualidade. Quando a prioridade é nitidez e exibição em telas grandes, priorize text-to-video em 1080p nativo e guie estilo e paleta no prompt. Ajuste duração e aspect ratio conforme o canal de distribuição. (docs.x.ai)
Para lidar com o tempo de geração, que pode variar conforme complexidade, duração e resolução, projete filas assíncronas e notificação por webhook no seu backend. Isso reduz timeout e melhora UX em apps de criação colaborativa. (docs.x.ai)
Como o lançamento se compara ao mercado
No ecossistema concorrente, o Google Veo 3.1 oferece 1080p e até 4K via Gemini API, Vertex AI e Flow, com foco em qualidade de produção e consistência de personagens e cenários. Isso eleva a régua para entregas premium e pressiona players a igualar controles de identidade. Por outro lado, a proposta da xAI simplifica a adoção com referências e 1080p nativo em text-to-video, facilitando iteração rápida. (blog.google)
O cenário pós-Sora também abre espaço para alternativas. A OpenAI descontinuou o aplicativo e a experiência web do Sora em 26 de abril de 2026, informando que a API será descontinuada em 24 de setembro de 2026. Com essa janela se fechando, criadores e plataformas que dependiam de Sora migram fluxos para Veo, Runway e, agora, para Imagine Video 1.5 com referências. (openai.com)
No caso da Runway, a linha Gen-3 Alpha saiu de cena em julho de 2026 para dar lugar a novas gerações. Embora a empresa avance em recursos de controle e captura de expressão, a retirada programada do Gen-3 Alpha e do Gen-3 Alpha Turbo em julho indica ritmo acelerado de substituição por modelos mais recentes, o que reforça a importância de APIs estáveis e documentação clara, ponto em que a xAI enfatiza limites e modos por página. (help.runwayml.com)

Casos reais que ganham com referências e 1080p
- Marcas com personagens proprietários. O reference-to-video bloqueia o rosto, preserva identidade e evita deriva visual entre episódios, algo crítico para mascotes e apresentadores virtuais. Combine com voice_id para manter assinatura vocal. (docs.x.ai)
- Podcasts e videocasts animados. As referências de cena seguram o estúdio, enquanto a voz selecionada garante uniformidade de narração em vinhetas. Para versões finais, gere inserts em 1080p via text-to-video com estilo alinhado à identidade visual. (x.ai)
- E-commerce e demonstração de produto. Trave o cenário e o item em destaque e varie ação e enquadramento. Gerações curtas em 720p servem para protótipos e testes A/B, enquanto 1080p em text-to-video entrega materiais finais para canais de alta resolução. (docs.x.ai)
Guia rápido de implementação na API
- Escolha o modo certo. Use text-to-video para 1080p nativo e reference-to-video quando consistência visual for prioridade, aceitando 720p. (docs.x.ai)
- Parametrize explicitamente. Defina resolution como 1080p no text-to-video para evitar defaults de 720p. Para reference-to-video, respeite 720p e duração até 15 segundos. (docs.x.ai)
- Organize referências. Envie URLs públicos ou file_id via Files API. Priorize 3 a 5 imagens com variação de ângulos e luz. (docs.x.ai)
- Planeje filas assíncronas. Geração é assíncrona, então implemente polling ou callbacks no backend, exibindo estado de progresso no front. (docs.x.ai)
Exemplo mínimo em Python para text-to-video com 1080p nativo no Imagine Video 1.5:
response = client.video.generate(
prompt="Câmera em dolly-in sobre uma cidade neon à noite, chuva suave e reflexos no asfalto",
model="grok-imagine-video-1.5",
duration=8,
aspect_ratio="16:9",
resolution="1080p"
)
Segundo a própria documentação, a escolha de resolução, duração e complexidade do prompt afeta diretamente tempo de render e fila. Em fluxos com alto volume, vale tratar tempos máximos por job e retentativas controladas. (docs.x.ai)
Limitações, riscos e o que observar
- Qualidade por modo. A 1080p nativo está em text-to-video e image-to-video, não em reference-to-video, que permanece em 720p. Isso exige pensar em upscaling e composição quando consistência visual é mandatória. (x.ai)
- Voz por preset. O recurso de voz usa presets do modelo e, conforme a documentação, upload de áudio próprio não é suportado neste modo, com acesso sob solicitação. Isso simplifica conformidade, porém reduz flexibilidade em casos com vozes proprietárias. (x.ai)
- Convergência do mercado. Com Veo entregando 1080p e 4K em contextos enterprise e o Sora em fase de desligamento, times devem avaliar custo, latência, controles de segurança e metadata. O tabuleiro muda rápido e cada API impõe limites operacionais distintos. (blog.google)
Reflexões e insights
O movimento da xAI acerta no pragmatismo. Ao dar 1080p nativo em text-to-video e manter um canal de consistência por referências, o modelo cobre os dois extremos que mais doem no dia a dia, qualidade de exibição e identidade persistente. A segmentação por modo, com regras claras de duração, resolução e número de referências, facilita previsibilidade em produção, reduzindo surpresas em lotes e integrando melhor com pipelines de edição.
Outro ponto positivo é a documentação granular por modo, algo que nem sempre aparece com a mesma clareza em concorrentes. Em cenários com calendário apertado e múltiplos stakeholders, ter especificações objetivas, como o teto de 720p para reference-to-video, ajuda PMs e engenheiros a compor escopos realistas sem prometer o que a API não entrega. (docs.x.ai)
Conclusão
Imagine Video 1.5 amplia o controle criativo com referências de imagem e voz e destrava 1080p nativo em text-to-video, atendendo demandas de consistência e qualidade com rotas práticas de adoção. A liberação a partir de 31 de julho de 2026 para clientes nos EUA e a presença em apps e API aceleram testes e integrações reais. (x.ai)
No contexto de um mercado que viu a saída do Sora e a escalada de resoluções no Veo, o pacote da xAI entrega um equilíbrio interessante entre velocidade, previsibilidade e controle. Cabe aos times avaliar quando priorizar identidade rígida via referências em 720p e quando investir em 1080p nativo em text-to-video para entregar acabamento final, construindo uma linha de produção que minimize retrabalho e maximize impacto visual. (help.openai.com)
Leia também
Hank Green pausa canais após admitir dependência não saudável de IA
Hank Green anunciou uma pausa em seus canais após admitir uma dependência não saudável de IA para pesquisa e escrita. O caso expõe o choque entre escala e qualidade, pressiona o YouTube a aplicar políticas contra conteúdo massificado, e oferece lições práticas para criadores que querem usar IA com responsabilidade.
8 min de leituraIA GenerativaHeyGen lança vídeo podcast de dois hosts via docs e links
A HeyGen apresentou um recurso que converte documentos e links em programas de vídeo com dois apresentadores gerados por IA. O formato agiliza a produção, melhora retenção e escala distribuição com traduções e dublagem sincronizada. Entenda funcionalidades, limites e onde aplicar com ROI.
7 min de leituraIA GenerativaMirage lança Avatar X, IA com microexpressões e setup 10 s
Avatar X, da Mirage, chega com a promessa de preservar microexpressões e configurar em 10 segundos. O modelo integra voz, olhar e linguagem corporal, mirando casos práticos como anúncios, tutoriais e atendimento. Veja como se posiciona frente a rivais e pesquisas recentes.
9 min de leituraIA e ProdutividadexAI lança Grok Build Mode Beta, crie apps, jogos e sites
O Grok Build Mode entrou em beta e permite criar apps, jogos, sites e dashboards direto no chat, com prévia ao vivo e publicação em um link grok.me. Disponível para assinantes SuperGrok Heavy no web, iOS e Android, o recurso promete acelerar prototipagem, validação e compartilhamento com segurança e praticidade.
8 min de leitura