Alibaba lança Wan3.0, vídeo de IA em 30s no Model Studio
Wan3.0 chega ao Alibaba Cloud Model Studio com geração de vídeo de IA em até 30 segundos por chamada, entradas multimodais incluindo documentos e preços por segundo, elevando o nível para criadores e equipes de marketing.
Danilo Gato
Autor
Introdução
Wan3.0 coloca a geração de vídeo de IA em 30 segundos no centro do pipeline criativo, diretamente no Alibaba Cloud Model Studio. A novidade permite criar um vídeo completo em uma única chamada, com entradas que vão de texto e imagens a áudio, vídeo e até documentos, e com preços por segundo para 480P, 720P e 1080P. (alibabacloud.com)
A palavra chave aqui é vídeo de IA em 30 segundos. Essa duração em um único passe muda a unidade de produção, deixa de ser só um clipe curto e passa a ser um mini filme com narrativa, câmera contínua e consistência de personagens e cenários, algo que a linha Wan já vinha preparando nas versões 2.x e que agora escala de forma prática para uso comercial. (alibabacloud.com)
O que o Wan3.0 entrega de diferente
O anúncio oficial lista três saltos de capacidade que merecem atenção. Primeiro, gera até 30 segundos por chamada, com recomendação inteligente de duração e extensão de vídeo quando a história precisa continuar. Segundo, aceita documentos como entrada, doc, xls, ppt, pdf, txt e outros formatos, com limite de 1 arquivo ou link de até 100 MB e até 50 páginas. Terceiro, melhora o realismo, principalmente em rostos humanos, micro expressões e consistência de referência entre personagens, props, espaço e estilo. (alibabacloud.com)
Além disso, a edição embutida, herdada do Wan2.7, permite ajustar visual, trama e falas sem refazer tudo. Para quem opera com prazos curtos, isso reduz iteração e custo. Nas versões 2.7, a documentação já indicava janelas de 2 a 30 segundos no text to video, 720P e 1080P, frame rate de 30 fps e codec H.264, sinal de que a fundação técnica para os 30 segundos já estava pronta. (alibabacloud.com)
Preço, formatos e implicações de custo
O modelo de cobrança chega por segundo de saída gerada. O blog da comunidade indica valores de referência, 0,05 dólar por segundo para 480P, 0,10 dólar para 720P e 0,20 dólar para 1080P, o que coloca um vídeo completo de 30 segundos em 1080P por volta de 6 dólares, e um rascunho de 30 segundos em 480P por 1,50 dólar. Isso incentiva o fluxo rascunho em baixa resolução e finalização em alta. (alibabacloud.com)
Em termos de especificações, a documentação do text to video de Wan2.7 já suporta resoluções 720P e 1080P, e duração máxima de 30 segundos, com opção de marca d’água de IA. A chegada do Wan3.0, com os mesmos patamares de resolução, consolida 30 segundos como novo padrão de geração single pass nos produtos da casa. (alibabacloud.com)
Tudo para vídeo, inclusive documentos
O salto mais ousado está em transformar documentos diretamente em vídeo. Adicionar PPT, PDF e planilhas ao fluxo abre portas para anúncios a partir de decks de marca, aulas rápidas a partir de slides, dashboards animados a partir de dados tabulares e briefings narrados a partir de relatórios. O post oficial detalha formatos aceitos, limites de tamanho e de páginas, além do controle pelo prompt, que atua como orquestrador do conteúdo extraído e da forma final. (alibabacloud.com)
Casos exemplificados na própria publicação incluem converter um documento de apresentação de uma cafeteria em um filme de marca, com tom quente e apelo emocional. Para equipes de produto e marketing, a combinação de referência multimodal mais documento como fonte primária diminui o atrito entre planejamento e produção. (alibabacloud.com)
Realismo, consistência e o que ainda falta
A prioridade está em rostos e pessoas mais verossímeis, micro expressões naturais, além de consistência de personagens, figurinos, adereços, logos, materiais e composição espacial. Isso atende a requisitos de produção, onde a continuidade entre planos e a manutenção de identidade visual importam tanto quanto a nitidez. O comunicado também reconhece pontos a amadurecer, textura de áudio e acurácia de textos on screen, que seguem em evolução. (alibabacloud.com)
No contexto do ecossistema Alibaba, a estratégia de vídeo generativo não é isolada. A documentação do Model Studio exibe a linha Wan 2.x em múltiplos sabores, text to video e image to video, com suporte a narração sincronizada e vídeos com áudio, o que evidencia a migração da fase de pesquisa para produtos com APIs e SLAs claros. (alibabacloud.com)
Como isso muda o pipeline de criação
A unidade de trabalho deixa de ser cenas de 3 a 5 segundos e passa a ser sequências de até 30 segundos com começo, meio e fim. Na prática, um criativo pode iterar um filme de produto em 480P, validando narrativa, ritmo e enquadramentos, e só então finalizar a versão aprovada em 1080P. Equipes de social podem gerar variações de 15 e 30 segundos alinhadas a redatores e designers no mesmo dia, com consistência de personagem garantida por referência de imagem. (alibabacloud.com)
Em publicidade, a promessa é clara, do deck ao filme. Em design de produto e software, protótipos de interação ganham vida a partir de layouts, com preservação de estética e tipografia. Em turismo e destinos, a reprodução de cenas reais reduz dependência de grandes deslocamentos e libera budget para mídia e testes criativos. Esses exemplos são alinhados aos casos de uso descritos no post oficial. (alibabacloud.com)
Bench de mercado e a trilha técnica por trás
A literatura recente em difusão para vídeo aponta a convergência para arquiteturas do tipo Diffusion Transformer, com ganhos em latência e consistência de quadros. O paper da família Wan, publicado pela equipe, descreve avanços em VAE, pre treino escalável e curadoria massiva de dados que pavimentam a progressão do 2.x ao 3.0. Em paralelo, trabalhos como SANA Video mostram que modelos menores podem gerar 720x1280 com custos baixos, o que pressiona fornecedores a entregar eficiência e controle. (arxiv.org)
Em termos de produto, o Model Studio já vinha oferecendo camadas padrão e turbo na linha Wan, e documentando modos text to video e image to video, além de recursos de edição e controle de áudio imagens. Essa base explica por que a passagem para 30 segundos single pass parece mais evolução do que ruptura. (alibabacloud.com)
Integração com agentes e portfólio de IA da Alibaba
O lançamento do Wan3.0 acontece em um momento de ampliação do portfólio de modelos fundamentais, como a linha Qwen 3.7, pensada para agentes e fluxos de trabalho autônomos. No próprio hub do Model Studio aparecem cards de modelos novos, datas de lançamento e faixas de preço por token ou por segundo, uma indicação da verticalização de IA no stack da nuvem. Para desenvolvedores, isso sugere integração natural entre agentes que planejam e modelos visuais que executam, em um mesmo ambiente. (modelstudio.alibabacloud.com)
Como começar, boas práticas e um playbook rápido
- Definir o roteiro em 30 segundos. Escrever um prompt que delimite cenas, beats e tom. Exemplos práticos no blog oficial mostram como um único parágrafo orienta identidade visual, ritmo e emoção. (alibabacloud.com)
- Escolher referência. Anexar uma imagem do personagem principal, props chave e logotipos. Para manter consistência, usar as mesmas referências a cada iteração. A documentação da linha Wan destaca que a consistência é central no modo reference to video. (alibabacloud.com)
- Baratear iteração. Gerar em 480P primeiro, validando a narrativa, depois finalizar em 1080P. O pricing por segundo favorece esse fluxo. (alibabacloud.com)
- Orquestrar com documentos quando fizer sentido. Converter um PPT de lançamento em filme de marca ou um PDF de treinamento em micro aula. Respeitar limites, 1 arquivo, até 100 MB, até 50 páginas. (alibabacloud.com)
- Explorar edição sem recomeçar. Alterar falas, plot e elementos de cena com a função de edição, herdada do 2.7. (alibabacloud.com)
Limitações e riscos a gerenciar
A equipe do Wan sinaliza dois pontos em evolução, textura de áudio e precisão de texto na tela. Para marcas que dependem de lettering perfeito, a recomendação é validar títulos e supers em pós produção. Para projetos com áudio protagonista, considerar trilhas ou narrações externas até que o timbre nativo amadureça. Esses alertas são úteis para evitar retrabalho e alinhar expectativa de stakeholders. (alibabacloud.com)
Em compliance, é prudente usar a marca d’água de IA quando necessário e garantir direitos de uso de referências e logos. A API de Wan 2.7 já documentava a opção de watermark e detalhes técnicos de áudio e vídeo, sinal de que a governança está no radar do produto. (alibabacloud.com)
O que isso diz sobre a direção do mercado
Trinta segundos single pass marcam uma linha divisória. Não se trata apenas de empilhar frames, e sim de gerar continuidade visual, manter identidade de personagem, estabilizar materiais de produto e coreografar câmera e luz de maneira cinematográfica. Esse nível de controle aproxima a IA de vídeo de necessidades reais de estúdios, agências e departamentos criativos.
Do ponto de vista competitivo, a combinação de custo previsível por segundo, entrada por documentos e edição incremental cria barreiras de usabilidade. Plataformas que ficarem presas em janelas de 4 a 8 segundos ou sem coerência de referência vão parecer brinquedos perto de ferramentas que já entregam narrativa completa com consistência produtiva. Os exemplos e especificações do ecossistema Alibaba reforçam essa leitura. (alibabacloud.com)
Conclusão
Wan3.0 consolida a geração de vídeo de IA em 30 segundos como nova unidade de criação e entrega isso dentro do Model Studio, com preços por segundo e entrada multimodal que inclui documentos. Em termos práticos, criadores e marcas ganham um fluxo que começa em rascunho barato em 480P, evolui por edição incremental e termina em 1080P, sem sacrificar consistência de personagem e estética de produto. (alibabacloud.com)
O mercado de vídeo generativo tende a medir valor por história contada por chamada e não por clipe curto. A direção é clara, mais realismo, mais consistência e mais integração com agentes e dados empresariais. Para quem opera conteúdo, a oportunidade está em transformar materiais já existentes, apresentações, PDFs e protótipos, em peças audiovisuais coerentes, com melhor velocidade e custo controlado. (modelstudio.alibabacloud.com)
Leia também
LTX-2.5 faz 10 s em 6,8 s no Nvidia GB200, open weights
LTX-2.5 chega com pesos abertos e desempenho de ponta, gerando 10 s de vídeo em 6,8 s em 2x Nvidia GB200. Avanços incluem consistência multishot, novo decodificador de difusão e integração nativa em ferramentas populares. Entenda a arquitetura, métricas e aplicações práticas.
9 min de leituraInteligência ArtificialxAI lança Grok 4.6 com agentes de longa duração e visão
Grok 4.6 foi anunciado em 12 de agosto de 2026 com foco em agentes de longa duração, desempenho de fronteira em benchmarks e recursos visuais mais robustos. O modelo está disponível no Cursor e no Grok Build, com preço inicial a partir de 2 dólares por milhão de tokens de entrada e 6 dólares por milhão de saída. Para a primeira semana, há 2 vezes de uso incluso para começar a testar de imediato. Entenda o que muda na prática e como tirar proveito no desenvolvimento e no negócio.
12 min de leituraInteligência ArtificialXtalPaint AI reconstrói átomos faltantes com 97 por cento de sucesso
XtalPaint AI aplica difusão seletiva tipo inpainting para reconstruir átomos faltantes, especialmente hidrogênios, em cristais. Validado no npj Computational Materials em 11 de junho de 2026, o método atingiu 97 por cento de sucesso ao recuperar posições conhecidas ou soluções mais estáveis. Com base e extensões sobre o MatterGen da Microsoft, o XtalPaint já está aberto no GitHub e pode destravar bancos de dados inteiros para simulações de propriedades, com impacto direto em armazenamento de hid
8 min de leituraInteligência ArtificialNVIDIA NeMo Switchyard roteia agentes e corta custos 74%
Agentes de IA não precisam de um único modelo para tudo. O NVIDIA NeMo Switchyard roteia cada passo do fluxo para o modelo ideal, reduzindo custos em 74% em testes com a LangChain, com pequena queda de acurácia. Veja arquiteturas, algoritmos de roteamento e integrações que aceleram a adoção com controle e observabilidade.
10 min de leitura