Xiaomi lança MiMo‑V2.6, série de IA multimodal com desenvolvimento aberto
MiMo‑V2.6 chega com pesos abertos, contexto de 1M tokens, foco em agentes e reforço em larga escala, mantendo preços de API da V2.5 e ampliando o acesso para desenvolvedores.
Danilo Gato
Autor
Introdução
Xiaomi MiMo‑V2.6 é a nova série de modelos de IA multimodal da Xiaomi, com pesos abertos, contexto de 1 milhão de tokens e foco explícito em agentes de longo horizonte. O anúncio confirma dois checkpoints nativos, Pro e Flash, além do modo Pro UltraSpeed para baixa latência, mantendo os preços de API da linha V2.5. Esses pontos desenham uma estratégia de distribuição aberta com engenharia de reforço em escala para autoaperfeiçoamento. (mimo.mi.com)
A palavra‑chave Xiaomi MiMo‑V2.6 não é apenas um nome de versão, é um conjunto de decisões técnicas e de produto que colocam código, visão, áudio e vídeo dentro do mesmo ciclo de raciocínio. O movimento inclui modelo, infraestrutura de RL, ambientes de tarefa, relatórios técnicos e repositórios públicos, o que facilita auditoria independente e integração rápida em pipelines de software. (mimo.mi.com)
O artigo explica o que foi lançado, como a arquitetura funciona, onde o MiMo‑V2.6 se posiciona nos benchmarks e, principalmente, como aplicar os modelos em cenários reais de engenharia, design e automação. Tudo com base nas fontes oficiais e em coberturas independentes com data de 21 e 22 de setembro de 2026. (vercel.com)
O que exatamente a Xiaomi lançou na versão V2.6
A série MiMo‑V2.6 chega com dois modelos nativos multimodais, MiMo‑V2.6‑Pro e MiMo‑V2.6‑Flash, ambos com janela de contexto de 1 milhão de tokens e suporte integrado a texto, imagem, vídeo e áudio. Além disso, a Xiaomi disponibiliza a variante Pro UltraSpeed como serviço hospedado, com até 20 vezes a velocidade de saída do Pro, sem comprometer qualidade. A grande diferença estratégica é o pacote aberto, que inclui pesos, ambientes de RL e um relatório técnico detalhado. (mimo.mi.com)
Na distribuição comercial, os modelos aparecem em múltiplos canais. Estão acessíveis no ecossistema da própria Xiaomi, como MiMo Desktop e MiMo Studio, e também em gateways de terceiros, com destaque para a disponibilidade anunciada no AI Gateway da Vercel em 21 de setembro de 2026. Essa diversificação reduz atrito de adoção e amplia opções de hospedagem e roteamento. (mimo.mi.com)
Em termos de preços, a Xiaomi afirma manter na V2.6 a mesma estrutura de API da V2.5. Segundo a cobertura independente mais recente, os valores e camadas de serviço se mantêm alinhados e o modo UltraSpeed aparece como um tier premium de inferência. Essa combinação reforça a tese de custo por tarefa mais competitivo em fluxos com cache e agentes persistentes. (mimo.mi.com)
Arquitetura e capacidades, o que muda frente à V2.5
O MiMo‑V2.6‑Pro adota arquitetura Sparse Mixture‑of‑Experts, com capacidade total de 1,02 trilhão de parâmetros e 42 bilhões ativados por token. O encoder de visão próprio, MiMo ViT, soma 681 milhões de parâmetros, acompanhado por um AudioTokenizer de 308 milhões e um encoder de patches de áudio de 127 milhões. O pipeline incorpora Multi‑Token Prediction com um decodificador especulativo de 5 camadas, o que acelera a inferência sem sacrificar estabilidade. (huggingface.co)
No miolo de produto, a família foi concebida para cenários de agente, com raciocínio de longo horizonte, uso de ferramentas e operações de computador. Em termos práticos, um único modelo consegue ler instruções, interpretar telas, raciocinar sobre o estado de uma interface, decidir os próximos passos e executar ações, tudo num mesmo ciclo, reduzindo orquestração externa e custos de contexto. (siliconangle.com)
A Xiaomi também destaca casos integrados que extrapolam chat. Há exemplos de construção de mundos 3D com agentes colaborativos, modelagem em Blender a partir de texto ou imagens de referência, robótica simulada com controle por visão e criação audiovisual de ponta a ponta, incluindo música e vídeo. Esses casos ilustram a ambição da série em unificar percepção, raciocínio e execução. (mimo.mi.com)
Reforço em larga escala, a aposta no autoaperfeiçoamento
O ponto técnico mais notável é a escala de RL. O time relata um treino de menos de seis dias, com 30 passos para Pro e Flash, somando cerca de 750 mil trajetórias. Cada atualização utilizou lotes muito grandes com 1.568 prompts e 16 rollouts por prompt, produzindo de 3,5 a 3,7 bilhões de tokens por passo. A ideia central é misturar tarefas de código, agentes gerais, visão e cibersegurança no mesmo ciclo, promovendo transferência de estratégias entre domínios. (mimo.mi.com)
Além da escala, a equipe descreve um laço de avaliação que compara trajetórias bem sucedidas dentro do grupo, o que gera um sinal de recompensa mais granular do que binários passa ou falha. O objetivo é orientar o modelo para caminhos mais curtos, com menos tokens e maior confiabilidade, mitigando riscos de reward hacking com verificadores adversariais e triagens automáticas. (huggingface.co)
Nos números reportados, o Flash teve aumento relativo de 25 por cento na taxa média de acerto em tarefas de treino e o Pro, 12 por cento. Em benchmark de engenharia de software mantido fora da amostra, DeepSWE v1.1, Flash subiu de 48,8 para 65,7 e Pro de 58,4 para 72,6, evidenciando ganhos de generalização. Resultados assim ainda pedem reprodução independente, mas já indicam eficiência amostral do método de RL. (mimo.mi.com)

Benchmarks e posicionamento competitivo
A Xiaomi publica uma tabela ampla na model card do Pro, comparando V2.6‑Pro e V2.6‑Flash com V2.5‑Pro e com modelos fechados líderes. Os números sugerem uma disputa equilibrada nos testes de agente e automação, com destaques como 53,1 no AutomationBench, 31,6 no Agents’ Last Exam e 89,9 no Terminal Bench 2.1 para o Pro, próximos de resultados de sistemas proprietários de referência. Em outros testes, como ProgramBench e exploração ofensiva, os modelos fechados ainda levam vantagem. (huggingface.co)
No agregado, a matéria do SiliconANGLE de 22 de setembro de 2026 contextualiza que o Pro alcançou 46,32 no Artificial Analysis Intelligence Index, à frente de Kimi K3 e Qwen3.8 Max entre os abertos enumerados, porém atrás dos topos fechados no recorte analisado. Esse retrato casa com a intenção declarada pela Xiaomi de oferecer custo benefício agressivo entre modelos de peso aberto com forte viés a tarefas agentic. (siliconangle.com)
Na prática, a avaliação precisa considerar produtividade do agente por tarefa e não só preço por milhão de tokens. A Xiaomi defende que, no mesmo patamar de inteligência, o Pro entrega custo de 1 para 20 a 1 para 60 quando comparado a modelos estrangeiros topo de linha, especialmente em fluxos com cache de tokens. Essa afirmação se ancora na manutenção de preços de API da V2.5 na V2.6 e no uso extensivo de cache em pipelines de agentes. (mimo.mi.com)
Abertura real, do peso ao pipeline completo
Além dos pesos de Pro e Flash, a publicação inclui um conjunto de recursos incomum em lançamentos corporativos, como ambientes de tarefa de RL, framework de RL fim a fim e documentação de práticas verificadas. Na Hugging Face, a coleção oficial da Xiaomi lista os repositórios MiMo‑V2.6‑Pro‑RL, MiMo‑V2.6‑Flash‑RL e MiMo‑V2.6‑Distill‑Qwen‑9B, o que facilita testes, distilação e integração em stacks já consolidados, de Transformers a vLLM e SGLang. (huggingface.co)
A escolha do MIT como licença do ciclo anterior e a continuidade do enfoque aberto apontam para uma estratégia de rede. Com pesos acessíveis, relatórios técnicos e rotas comerciais ativas, a Xiaomi cria incentivos para que comunidades de infra e de agentes testem, reproduzam e adaptem o MiMo à sua realidade, dos datacenters corporativos às plataformas unificadas de roteamento. (mimo.mi.com)
Casos de uso práticos, onde MiMo‑V2.6 faz diferença agora
- Engenharia de software com repositórios longos. O contexto de 1 milhão de tokens permite carregar docstrings, testes, logs, diffs e histórico de issues, reduzindo I/O externo. Nas demonstrações e benchmarks, o Pro manteve competitividade em DeepSWE e Terminal Bench, que mapeiam cenários de refatoração, debug e execução em terminal. Em equipes com monorepos, isso dobra de valor quando combinado com ferramentas de cache e chunking determinístico. (huggingface.co)
- Automação de computador. A capacidade nativa de entender GUIs, usar ferramentas de produtividade e checar resultados com feedback visual reduz a necessidade de ferramentas externas de visão e OCR. O ciclo ver, decidir e agir dentro do mesmo modelo simplifica a orquestração de agentes. (mimo.mi.com)
- Criação de produto e marketing. Do Figma à geração de vídeo e trilha, o MiMo‑V2.6 conecta design de interface, estética e narrativa com saídas consistentes, alinhadas por TTS e ritmadas para educação e anúncios. Isso agiliza sprints criativos e protótipos de landing pages e demos. (mimo.mi.com)
- Mundo 3D e simulação. A pipeline de Vibe World, com construção de cenas, lógica interativa e verificação, ilustra uma mecânica de produção onde requisitos viram assets e cenas jogáveis iterativamente. Em P&D, o mesmo princípio vale para simulações de materiais e provas formais em Lean. (mimo.mi.com)
Como começar, rotas de adoção e boas práticas
- Para testar rápido. Use um gateway com playground. A Vercel adicionou os modelos ao AI Gateway em 21 de setembro de 2026, o que permite prototipar com roteamento, orçamentos por chave e relatórios, antes de investir em infraestrutura própria. Essa rota acelera POCs e comparativos A e B. (vercel.com)
- Para workloads sensíveis a latência. O modo Pro UltraSpeed oferece até 20 vezes a vazão do Pro, mantendo a qualidade de saída. É útil em frontends interativos, copilots locais e operações de call center. Avalie custo marginal por tarefa e impacto na experiência. (vercel.com)
- Para operações on‑prem. Os repositórios públicos na Hugging Face permitem rodar localmente ou em clusters próprios. A model card traz instruções para Transformers, vLLM e SGLang, com dicas de paralelização multi nó para o Pro. Faça sizing cuidadoso de GPU, memória e rede. (huggingface.co)
- Para pesquisa aplicada. Explore os ambientes e o framework de RL liberados. O pacote foi desenhado para reproduzir, ablar e iterar, misturando harnesses e tarefas no mesmo batch. É uma porta de entrada para estudar loops de autoaperfeiçoamento em tarefas verificáveis. (mimo.mi.com)
Custos, licenciamento e riscos a observar
- Preço e TCO. Com preços de API mantidos em relação à V2.5 e com uso extenso de cache, a Xiaomi argumenta custo por tarefa inferior ao de modelos fechados de topo. Ainda assim, workloads com geração longa e baixa taxa de reaproveitamento de tokens podem diluir essa vantagem. Faça medições com dados e prompts reais, registrando tempo até completar e quantidade de loops do agente. (mimo.mi.com)
- Licenciamento e distribuição. O ciclo anterior, V2.5, foi aberto sob MIT e a Xiaomi reforça abertura ampla em V2.6 com pesos e recursos de RL. Essa clareza jurídica é um diferencial, porém validações internas de compliance continuam obrigatórias, especialmente em setores regulados. (mimo.mi.com)
- Reprodutibilidade e benchmark drift. Parte dos resultados vem de avaliação própria da Xiaomi e do recorte de benchmarks disponível em setembro de 2026. Mantenha ceticismo metodológico saudável, priorize reproduções internas, e monitore atualizações de suites e políticas de correção automática. (huggingface.co)
Reflexões e insights
Colocar pesos abertos, ambientes e framework de RL lado a lado com um catálogo comercial ativo cria um funil interessante. Para quem constrói agentes, significa menos tempo explicando limitações de licenciamento e mais tempo avaliando custo por tarefa. Para quem pesquisa, significa poder partir de um baseline grande com claims auditáveis. O pano de fundo é a normalização de contextos gigantes, onde 1 milhão de tokens deixa de ser exceção e vira requisito de produtividade. (huggingface.co)
Outro ponto que salta aos olhos é a integração nativa de modalidades. Ao invés de colar modelos e ferramentas externas, a Xiaomi pressiona a fronteira de raciocínio, percepção e ação dentro do mesmo ciclo. Isso não elimina a necessidade de orquestração, mas muda a natureza das integrações, que passam a ser mais sobre memória, guarda‑chuvas de ferramentas e políticas de recuperação do que sobre traduções entre modalidades. (siliconangle.com)
Conclusão
MiMo‑V2.6 posiciona a Xiaomi como um dos protagonistas do movimento de pesos abertos em escala industrial. A proposta agrega engenharia de reforço transparente, arquitetura moderna de MoE e uma distribuição que abraça desde gateways de terceiros até apps desktop. Com preços estáveis, janela de 1 milhão de tokens e foco em agentes, a série oferece um pacote pragmático para times que medem sucesso em tarefas concluídas, não apenas em gráficos de leaderboard. (mimo.mi.com)
O passo seguinte é testar no seu contexto. Combine um gateway para prototipagem rápida com um piloto local em GPU para workloads críticos, rode benchmarks internos, confirme custo por tarefa e valide segurança e conformidade. Os elementos estão à mesa, dos pesos aos ambientes de RL. O resto é engenharia aplicada, ciclos curtos e métricas claras. (huggingface.co)
Leia também
OpenAI GPT-6 melhora cache de prompts e diagnósticos
O GPT-6 melhora o cache de prompts, aumenta a taxa de acertos e traz ferramentas de diagnóstico e monitoramento para reduzir custos e latência. Entenda o que muda, como aproveitar descontos em tokens cacheados em janelas de 30 minutos e como ajustar esforço de raciocínio sem quebrar o cache para acelerar agentes persistentes.
10 min de leituraTecnologia e IATrump anuncia renomeação de "Inteligência Artificial" para "Super Inteligência" em documentos dos EUA
Em discurso na ONU em 22 de setembro de 2026, Donald Trump afirmou que o governo passará a usar "Super Inteligência" no lugar de "Inteligência Artificial" em documentos oficiais. A fala acende um debate sobre impactos reais, já que não há, até agora, decreto formal publicado. Veja o que está confirmado, o que é especulação e como organizações podem responder.
9 min de leituraIA aplicadaCua open-source CUA-S1-FORMS, modelo pequeno e especializado para preencher formulários
CUA-S1-FORMS chega como um modelo pequeno, especializado e aberto para preencher formulários em interfaces gráficas. Com decisão em uma única passada, integração com o Cua Driver e resultados publicados no Hugging Face, ele aponta para agentes mais rápidos, baratos e controláveis no mundo real.
10 min de leituraInteligência ArtificialGrok 4.6 no Amazon Bedrock com janela de 500k tokens
Grok 4.6 está disponível no Amazon Bedrock com janela de 500 mil tokens, perfis de inferência US e Global, e preços por milhão de tokens competitivos. Veja o que muda para times de IA, como integrar via endpoints Mantle e Runtime, e quando aproveitar tiers Standard, Priority e Flex.
9 min de leitura