Placa de circuito estilizada simbolizando IA e tecnologia
IA generativa

Microsoft lança MAI-Image-2.5-Pro e MAI-Voice-2-Flash

Dois novos modelos chegam em prévia pública com foco em qualidade de imagem e voz de baixa latência, com integrações no Bing, PowerPoint, OneDrive, Dynamics 365 e Foundry, além de preços e métricas de produção divulgados pela Microsoft.

Danilo Gato

Danilo Gato

Autor

26 de julho de 2026
10 min de leitura

Introdução

MAI-Image-2.5-Pro e MAI-Voice-2-Flash foram lançados em prévia pública em 23 de julho de 2026, com preços, integrações em produtos e métricas de produção detalhadas pela Microsoft. Palavra-chave principal: MAI-Image-2.5-Pro. O anúncio reforça a estratégia de modelos próprios, otimizados para qualidade, velocidade e custo, e já presentes em serviços usados por milhões de pessoas.

O destaque está no posicionamento claro. MAI-Image-2.5-Pro mira máxima fidelidade com edição precisa e texto em imagem confiável, enquanto MAI-Voice-2-Flash prioriza latência e escala, sendo duas vezes mais rápido e 32 por cento mais barato que o MAI-Voice-2, com preço de 15 dólares por milhão de caracteres.

O que muda com o MAI-Image-2.5-Pro

MAI-Image-2.5-Pro foi apresentado como a variante de maior fidelidade da família de modelos de imagem, voltada a cenários como hero imagery, renders comerciais com tipografia precisa dentro das imagens e fluxos de edição detalhados. O preço divulgado foi de 5 dólares por milhão de tokens de texto de entrada, 8 dólares por milhão de tokens de imagem de entrada e 106 dólares por milhão de tokens de imagem de saída.

Além de qualidade, o modelo chega com distribuição prática. Segundo a Microsoft, o Bing Image Creator passou a usar modelos MAI por padrão. Em PowerPoint, o MAI-Image-2.5 já está em produção para recursos de image-to-image, reduzindo custos de GPU em até 84 por cento em comparação com o GPT-Image-2. No OneDrive, o mesmo modelo tornou-se padrão para cenários de edição, elevando taxas de salvamento em 26 por cento, reduzindo a latência P95 em aproximadamente 25 por cento e melhorando a eficiência em 2,5 vezes sob cargas médias. Esses dados de produção sustentam o argumento de maturidade do stack.

No Foundry, há uma página de catálogo específica do MAI-Image-2.5-Pro, indicando o posicionamento como gerador de imagens e editor de alta qualidade com controle preciso de edições. Para quem desenvolve, isso significa documentação, políticas e prontidão de API em ambiente Azure, o que facilita a adoção em pipelines empresariais.

Do ponto de vista de ecossistema, notícias adicionais destacaram que a Microsoft vem substituindo gradualmente modelos de terceiros em superfícies como PowerPoint e Bing, citando ganhos de custo e controle, o que se alinha ao pivot para modelos internos. Isso foi noticiado na semana do lançamento, reforçando o contexto estratégico.

![Fundo de circuito tecnológico colorido]

Por que o MAI-Voice-2-Flash importa para voz em tempo real

MAI-Voice-2-Flash foi anunciado como variante de baixa latência e alto volume, duas vezes mais rápido e 32 por cento mais barato que o MAI-Voice-2, com preço de 15 dólares por milhão de caracteres. O foco é atender agentes de voz, IVR, assistentes e qualquer caso que exija resposta imediata com naturalidade de prosódia e qualidade acústica.

A Microsoft publicou documentação no Microsoft Learn descrevendo a família MAI-Voice como prévia pública no Azure Speech via Foundry Tools. A página lista recursos como suporte a mais de 15 idiomas e 18 localidades, controle de emoção e estilo via SSML, e instant voice cloning com acesso controlado. Há também exemplos de SSML e um conjunto de vozes predefinidas, além de orientação sobre integração com o Voice Live para experiências speech-to-speech.

Integração prática já no dia a dia. O anúncio aponta o uso do MAI-Voice-2-Flash no Dynamics 365 Contact Center, plataforma usada por empresas como T-Mobile e EasyJet, com redução de custos de GPU de até 89 por cento, e integração ao Azure Voice Live para criação de agentes de voz em escala. Esses fatos mostram que a prévia pública não é um teste isolado, e sim parte de um rollout em produtos críticos.

Do lado do catálogo do Foundry, o item de produto do MAI-Voice-2-Flash reforça o posicionamento de TTS ultrarrápido para cenários em tempo real, com documentação e suporte no Azure. Para equipes técnicas, isso simplifica a descoberta e a experimentação com o modelo.

![Microfone de estúdio com fundo azul]

Integrações prontas em produtos Microsoft

Os novos modelos foram apresentados com dados reais de produção. No Bing Image Creator, a Microsoft declara que o pipeline de imagem já é 100 por cento interno por padrão, alimentado pelo MAI-Image-2.5. Em PowerPoint, a chegada do MAI-Image-2.5 a recursos de image-to-image trouxe economia de GPU de até 84 por cento frente ao GPT-Image-2. No OneDrive, o novo padrão de edição elevou métricas de adoção e desempenho, e no Dynamics 365 Contact Center o MAI-Voice-2-Flash atua em conversas de alta prioridade de marca, com redução de custo de GPU de até 89 por cento. O Voice Live também ganhou integração com o Flash, oferecendo caminho de rápida construção de agentes de voz.

Para clientes de Microsoft 365, notas de versão indicam a presença de modelos MAI em superfícies como o Copilot no PowerPoint, com entrada de modelos de imagem da família e controle administrativo correspondente. Esse movimento de consolidar modelos próprios em produtos Office reforça a governança, a previsibilidade de custo e a integração com políticas corporativas.

No Foundry, a página de catálogo do MAI-Image-2.5-Pro funciona como porta de entrada para testes controlados e futuras implantações. Em paralelo, a documentação do Voice Live mostra regiões suportadas e requisitos de recursos para quem quer casos de uso de voz em tempo real com qualidade profissional.

Preços, performance e custo total de propriedade

Do lado de imagem, o MAI-Image-2.5-Pro veio com precificação explícita por tipo de token. Os 5 dólares por milhão de tokens de texto de entrada, 8 dólares por milhão de tokens de imagem de entrada e 106 dólares por milhão de tokens de imagem de saída permitem estimativas transparentes por projeto. Para voz, o MAI-Voice-2-Flash parte de 15 dólares por milhão de caracteres, com ganhos anunciados de desempenho e custo quando comparado ao MAI-Voice-2. Esses parâmetros tornam mais fácil simular o custo total de campanhas criativas, geração de catálogos, edições de ativos e experiências de voz.

Ilustração do artigo

Essa transparência de preços vem acompanhada de dados operacionais. Um ponto de atenção é que o Voice Live tem regiões específicas suportadas e requisitos de recurso no Azure, o que pede planejamento de latência e conformidade. A documentação oficial lista regiões e ressalta pré-requisitos de provisionamento para o uso do API em tempo real.

Casos de uso imediatos e exemplos práticos

Criação de campanhas com tipografia embutida na imagem. O MAI-Image-2.5-Pro foi destacado por renderizar texto com precisão, algo notoriamente difícil em modelos generativos, o que favorece hero images, banners e materiais impressos sem retrabalho manual. Em PowerPoint, o uso de image-to-image permite partir de uma base fotográfica ou render e iterar com edições direcionadas, com ganhos de custo reportados.

Edição e pós-produção de ativos em repositórios corporativos. No OneDrive, métricas de aumento de save rate e redução de latência com o MAI-Image-2.5 indicam que os usuários estão concluindo mais tarefas e esperando menos, um bom sinal para times de conteúdo que dependem de aprovação e versionamento.

Atendimento e voz conversacional em escala. O MAI-Voice-2-Flash foca em respostas naturais com baixa latência, sendo adequado a centrais de atendimento e assistentes que exigem tempo de resposta curto. O uso corrente no Dynamics 365 Contact Center, aliado à integração no Voice Live, mostra uma trilha clara para empresas que buscam voz em tempo real com custo previsível.

Para equipes de desenvolvimento, a página do Learn sobre MAI-Voice descreve SSML com estilos como joy, excitement, empathy e parâmetros de estilo. O suporte a mais de 15 idiomas e 18 localidades facilita experiências multilíngues, com instant voice cloning sob acesso controlado e salvaguardas. Esses recursos trazem a nuance vocal para experiências de marca sem comprometer conformidade.

Estratégia: modelos próprios, controle e custo

O anúncio cita que os modelos MAI foram treinados internamente, com dados corporativos rastreáveis e sem destilação de modelos de terceiros, posicionando a Microsoft para reduzir dependência externa em superfícies críticas como Bing, PowerPoint, OneDrive e Dynamics. O argumento central liga qualidade, latência e eficiência com evidências de produção e números de custo.

Cobertura jornalística recente destaca que a empresa vem trocando gradualmente modelos de terceiros por modelos próprios em produtos de massa, motivada por reduções substanciais de custo e maior controle do roadmap. Essa leitura pública corrobora o que foi divulgado no post oficial.

Uma consequência direta é a previsibilidade para clientes corporativos. Ao alinhar os modelos a um stack Azure, o time de TI herda controles de região, identidade, logging e política já conhecidos, o que pode acelerar auditorias e simplificar due diligence. O catálogo do Foundry, com itens como MAI-Image-2.5-Pro e MAI-Voice-2-Flash, facilita o procurement técnico e a análise de risco antes do rollout.

Como começar, sem fricção desnecessária

Para imagem, o caminho natural é experimentar o MAI-Image-2.5-Pro no Foundry, documentar prompts e criar um playbook de edição com antes e depois, medindo horas poupadas e taxa de aprovação do material. Para voz, a trilha envolve provisionar o recurso no Azure Speech em Foundry Tools, validar latência em regiões suportadas e prototipar flows no Voice Live com SSML, estilos e fallback para latências maiores quando necessário.

Uma dica prática é desenhar matrizes de decisão qualidade, tempo e custo. Para e-commerce, por exemplo, MAI-Image-2.5-Pro para fichas de produto com tipografia embutida pode reduzir retrabalho e padronizar linguagem visual. Para atendimento, MAI-Voice-2-Flash acelera IVR, confirmações e callbacks, reduzindo tempo médio de atendimento em fluxos repetitivos. Esses ganhos devem ser medidos contra indicadores como custo por contato e tempo de resolução.

Reflexões e insights

Os dados de produção divulgados são a peça que faltava para validar uma estratégia de modelos internos. Quando um modelo entrega 84 por cento de economia de GPU em um app amplamente usado como o PowerPoint, e outro reduz em até 89 por cento custos de GPU em um contact center empresarial, o impacto transcende o laboratório e atinge P&L. Para lideranças, isso abre espaço para reinvestir orçamento em curadoria de dados, segurança e automação de ponta a ponta.

Outro ponto é a governança. Modelos próprios facilitam políticas de salvaguarda, auditoria de dados e resposta a incidentes em ambientes que já operam com Microsoft 365 e Azure. O resultado é menos atrito entre times de negócio e segurança, algo difícil de alcançar quando se depende de modelos black box externos.

Por fim, a escolha arquitetural de manter famílias com variantes Pro, base e Flash cria um gradiente qualidade, velocidade e custo que conversa bem com cenários reais. Não existe um único melhor modelo. Existem trocas conscientes, informadas por métricas de produção e requisitos do produto. O lançamento de 23 de julho de 2026 mostra exatamente isso.

Conclusão

MAI-Image-2.5-Pro e MAI-Voice-2-Flash chegam com proposta clara. Qualidade de imagem com edição precisa e tipografia confiável, e voz expressiva com baixa latência e preço agressivo, já integradas a produtos amplamente usados e com números públicos de produção. Para quem lidera tecnologia, marketing e atendimento, há valor imediato em testar e medir.

O próximo passo é operacional. Equipes devem mapear onde cada variante faz mais sentido, alinhar custo por unidade gerada, latência esperada e requisitos de marca. Com catálogo no Foundry, documentação no Learn e integrações prontas, a barreira de entrada é baixa. O ciclo agora é de execução, medição e escala.

Tags

modelos de imagemsíntese de vozFoundryPowerPointDynamics 365