Cabos de rede conectados em rack de servidor, ilustrando infraestrutura para IA
Inteligência Artificial

Thinking Machines lança Inkling-Small, 276B MoE igual ao Inkling com 1/4 do tamanho

Inkling-Small chega com 276B de parâmetros em MoE, 12B ativos e desempenho semelhante ao Inkling, porém com custo e latência significativamente menores, abrindo espaço para produção real.

Danilo Gato

Danilo Gato

Autor

31 de julho de 2026
9 min de leitura

Introdução

Inkling-Small, modelo open-weights da Thinking Machines lançado em 30 de julho de 2026, iguala o desempenho do Inkling em diversas tarefas com apenas um quarto do tamanho. A palavra-chave aqui é Inkling-Small, uma variação de 276 bilhões de parâmetros em arquitetura Mixture-of-Experts com apenas 12 bilhões ativos por passo, entregue com foco em eficiência de custo e latência. Segundo a empresa, o modelo mantém raciocínio, multimodalidade nativa e janelas de contexto de até 1 milhão de tokens, com preços de inferência mais baixos que o irmão maior. (thinkingmachines.ai)

O anúncio chega duas semanas após o lançamento do Inkling, o primeiro modelo aberto da companhia, um MoE multimodal com 975 bilhões de parâmetros totais e 41 bilhões ativos, também com 1 milhão de contexto e foco em controle de esforço de raciocínio. O Inkling estabeleceu a receita, o Inkling-Small executa a mesma visão com custos mais acessíveis. (thinkingmachines.ai)

O que muda com o Inkling-Small

A Thinking Machines deixou claro o objetivo: entregar performance comparável ao Inkling com muito menos computação. A especificação central traz 276B totais, 12B ativos, treinamento em sistemas NVIDIA GB300 NVL72, raciocínio ajustável por orçamento de pensamento, e suporte nativo a texto, imagem e áudio, preservando a janela de até 1M de tokens. No anúncio, a equipe destaca que o Small alcança resultados semelhantes ao Inkling no Terminal-Bench 2.1, HLE texto puro e IFBench, com vantagens relevantes em eficiência. Preço de saída por 1M de tokens foi divulgado como 1,20 dólares no Small versus 4,05 dólares no Inkling. (thinkingmachines.ai)

Essa paridade de desempenho em um formato mais leve gera duas consequências práticas. Primeiro, viabiliza protótipos rápidos e MVPs de agentes com custo previsível. Segundo, reduz barreiras para rodar inferência em provedores alternativos, inclusive setups onde placa e memória são limitantes. O conjunto de decisões, do MoE de baixa ativação ao ajuste de esforço por tarefa, foi feito para equilibrar custo, tempo e qualidade.

Por dentro dos números de benchmark

A página oficial lista comparações que merecem atenção. Em Humanity’s Last Exam, o Inkling-Small marcou 31,6 por cento contra 29,7 por cento do Inkling. Em SWEBench-Verified, o Small passou de 80 por cento. Nas curvas de esforço, o Small manteve vantagem de eficiência ao longo de diferentes orçamentos de raciocínio. Esses resultados consideram esforço de raciocínio próximo de 0,99 e temperatura 1, com padronização de tokens gerados que inclui tokens de raciocínio, seguindo metodologia do Artificial Analysis. (thinkingmachines.ai)

Além disso, a empresa reporta um índice AA v4.1 de 40 por cento para o Small, com 12B ativos em 276B totais, frente a 41B ativos em 975B totais do Inkling. Em tarefas de agentes e código, como Terminal Bench e SWEBench, o Small aparece competitivo em eficiência de tokens e custo. Para quem monta pipelines que integram RAG, ferramentas e execução de código, essa eficiência costuma se traduzir em menos gastos por tarefa resolvida e menores filas de latência sob carga. (thinkingmachines.ai)

Multimodalidade e áudio, o detalhe que importa

Os dois modelos compartilham uma arquitetura multimodal nativa, sem acoplamento pesado a encoders externos, e trabalham com dMel para áudio e divisão de imagens em patches de 40 por 40 pixels alimentados por um hMLP leve. O Inkling-Small também aprimorou o uso de Python para tarefas visuais, algo relevante para leitura de gráficos e documentos complexos. Em benchmarks como MMMU Pro e conjuntos de áudio como AudioMC, MMAU e VoiceBench, os números do Small ficam próximos dos equivalentes abertos e fechados de referência, a uma fração do custo operacional. (thinkingmachines.ai)

Na prática, multimodalidade que integra leitura visual programática com raciocínio textual reduz fricção em fluxos do mundo real. Um exemplo é auditoria de PDFs com gráficos minúsculos acompanhados de tabelas, em que recortes programáticos e zoom inteligente aumentam a robustez. Outro é triagem de áudio de call centers, unindo compreensão semântica com geração de pareceres concisos, tudo sob limites de tempo apertados.

Epistemics, previsão e segurança

A família Inkling vem enfatizando epistemics, que envolve calibrar confiança e melhorar a conduta sob incerteza. O Small foi treinado com foco semelhante, inclusive usando RL com regras de pontuação próprias de previsão, além de avaliações em conjuntos como ForecastBench e Prophet Arena. Entre 19 e 28 de julho de 2026, os testes reportados mostram Brier melhor que o Inkling sem busca, com paridade quando há busca. Isso tende a reduzir respostas com excesso de certeza em temas ambíguos e a favorecer previsões expressas com intervalos coerentes. (thinkingmachines.ai)

Em segurança, a equipe informa que o Small herdou a receita de pós-treinamento do Inkling e passou por testes internos e red-teaming externo. Nos números divulgados, o modelo é competitivo em FORTRESS, tanto em recusa a pedidos nocivos quanto em evitar recusas em conteúdo benigno, e mantém taxas de recusa muito altas no StrongREJECT. Para quem opera em ambientes regulados, esse equilíbrio entre recusar o que deve e responder quando é seguro é um indicador prático importante. (thinkingmachines.ai)

Por que 276B totais e 12B ativos fazem sentido agora

A linha Inkling adota MoE com ativação parcial como resposta ao dilema custo versus qualidade. O design com 12B ativos no Small reduz FLOPs por amostra e, combinado ao ajuste de esforço de raciocínio, cria uma curva de trade-off controlável. Em termos simples, é possível gastar menos tokens de saída, manter coerência e ainda assim destravar raciocínio quando necessário, algo que se torna crítico em agentes que codam, chamam ferramentas e mantêm estado em janelas grandes. Os gráficos oficiais do lançamento explicitam como o custo por amostra cai no Small, enquanto a qualidade se mantém próxima em tarefas representativas. (thinkingmachines.ai)

Vale lembrar que o Inkling maior inaugurou publicamente essa proposta há duas semanas, com 975B totais e 41B ativos, como um modelo aberto e ajustável. O Small surge como a peça de produção pragmática para quem precisa escalar uso em equipe e manter previsibilidade de conta. (thinkingmachines.ai)

Ilustração do artigo

Custos, provedores e onde testar agora

O anúncio lista preço de saída de 1,20 dólares por 1M de tokens para o Small contra 4,05 dólares para o Inkling, com custos estimados por amostra calculados a partir de tokens gerados e preços publicados de provedores. Os pesos completos do Inkling-Small estão disponíveis e o modelo pode ser testado e ajustado no Tinker, o ambiente da própria Thinking Machines. Esses detalhes importam para equipes que querem avaliar TCO antes de consolidar um stack. (thinkingmachines.ai)

O ecossistema ao redor do Inkling vem crescendo desde o anúncio de 15 de julho de 2026, com suporte em plataformas de inferência e menções na imprensa de tecnologia. Para quem busca acesso imediato a endpoints gerenciados e a pesos em repositórios conhecidos, os canais oficiais reúnem a documentação, a model card e as opções de execução. (ibm.com)

Aplicações práticas que já dá para colocar em produção

  • Agentes de suporte com áudio nativo. O Small processa dMel e mantém compreensão robusta de fala, útil em triagem de chamadas e roteamento assistido. A combinação de VoiceBench e MMAU sugere competitividade frente a referências abertas e fechadas, especialmente considerando custo por saída. (thinkingmachines.ai)
  • Analítica de documentos com visão programática. Patches de 40 por 40 pixels mais uso de Python facilitam inspeção de áreas pequenas em relatórios e gráficos, melhorando a exatidão de respostas em auditorias e revisões. (thinkingmachines.ai)
  • Agentes de código e tool-use. Os resultados em SWEBench-Verified, SWEBench Pro e Terminal Bench mostram que o Small sustenta pipelines de depuração, geração de PRs e chamadas de APIs com eficiência de tokens. (thinkingmachines.ai)
  • Forecasting operacional. A ênfase em epistemics, com Brier sólido e calibragem via regras próprias de previsão, torna o modelo candidato para cenários de previsão de demanda, risco e alocação de recursos, desde que os dados e limites de uso sejam bem definidos. (thinkingmachines.ai)

Como comparar com o modelo maior na prática

A decisão entre Inkling e Inkling-Small hoje passa por quatro perguntas simples.

  1. Qual é o orçamento mensal para inferência em tokens de saída. O Small custa menos por 1M de tokens, o que tende a favorecer produtos com alto volume de uso. (thinkingmachines.ai)
  2. Quanta latência pode ser tolerada por interação. Com menos parâmetros ativos e esforço controlável, o Small oferece respostas mais rápidas em muitas cargas. (thinkingmachines.ai)
  3. Qual é o grau de dependência de conhecimento de cauda longa. O Inkling ainda leva vantagem em cobertura factual e conhecimento, segundo a própria equipe. Em tarefas de raciocínio e agentes, o Small frequentemente empata ou supera. (thinkingmachines.ai)
  4. O produto precisa de áudio e visão em tempo real. A arquitetura multimodal nativa e os ganhos práticos no uso de Python para visão favorecem o Small quando custo e tempo são críticos. (thinkingmachines.ai)

Onde essa tendência encaixa no cenário maior

A chegada do Small reforça um movimento em direção a modelos abertos com controle de esforço, janelas grandes e foco prático em agentes. O Inkling original já foi coberto por veículos especializados como Wired e TechCrunch, posicionando a proposta como alternativa americana aos melhores modelos open-weights de fora. O Small traduz essa tese em operação diária, trazendo custo por amostra mais baixo e eficiência de tokens. (wired.com)

Para equipes que enfrentam restrições de hardware, o detalhe logístico faz diferença. O treinamento ocorreu em NVL72 de última geração, mas a inferência pode ser estruturada de forma elástica em provedores compatíveis. A possibilidade de baixar pesos, ajustar no Tinker e executar em fornecedores diversos reduz risco de bloqueio e dá margem para negociar preço de infraestrutura. (thinkingmachines.ai)

Conclusão

O Inkling-Small coloca na mesa uma relação custo, desempenho e controle difícil de ignorar. Com 276B totais, 12B ativos e 1M de contexto, o modelo iguala o Inkling em várias frentes, custa menos por token de saída e chega com pesos completos disponíveis, o que acelera ciclos de POC e adoção. Para quem precisa escalar agentes, visão e áudio sem explodir a conta, o timing e as escolhas técnicas fazem sentido. (thinkingmachines.ai)

A recomendação prática é simples. Avalie o Small em um recorte real do seu fluxo, medindo tokens de raciocínio e resposta, latência ponta a ponta e custo efetivo por tarefa. Se a curva de esforço controlável entregar a qualidade que o seu caso requer, há uma boa chance de o Small virar o seu cavalo de batalha, enquanto o Inkling maior fica como reserva para workloads onde cobertura factual extra compensa o custo. (thinkingmachines.ai)

Leia também

Inteligência Artificial

Muse da Meta é 2º na App Store EUA, 83k downloads

O agente de IA Muse, da Meta, alcançou o 2º lugar na App Store dos EUA com mais de 83 mil downloads, sinalizando que os agentes inteligentes saíram do laboratório e chegaram ao mainstream. Veja o que explica esse pico, como a Meta posiciona o Muse, quem são os rivais imediatos, o que já funciona bem e os pontos de atenção em privacidade, segurança e adoção. Entenda os impactos práticos para usuários, criadores e empresas.

11 min de leitura
Inteligência Artificial

OpenAI lança ChatGPT para Serviços Financeiros, GPT-6 Astra

OpenAI anunciou o ChatGPT para Serviços Financeiros, uma versão do ChatGPT Work com GPT-6 Astra e dados financeiros integrados. A proposta é acelerar pesquisa, modelagem e produção de materiais, com citações granulares, integrações com provedores como Daloopa, PitchBook e LSEG News, e controles de segurança corporativa. Veja o que muda para bancos, research e private equity, como implantar com governança e onde Astra se destaca.

9 min de leitura
Inteligência Artificial

OpenAI lança Data agent no ChatGPT Work para analytics de negócios com IA

O Data agent do ChatGPT Work conecta BigQuery, Snowflake, Databricks e mais, transforma perguntas em análises e dashboards, e leva insights acionáveis para Slack, e-mail e BI. Saiba o que muda na rotina de dados, os ganhos possíveis e como implementar com segurança e governança.

10 min de leitura
Inteligência Artificial

As notícias de IA que você perdeu na última semana completo

Tudo o que importou em IA na semana, de agentes pessoais e segurança a grandes aquisições. Muse, o novo agente da Meta, ganhou as manchetes. A Anthropic publicou um relatório com casos reais de mau uso. OpenAI sinalizou abertura para desacelerar. Nvidia confirmou a compra da Hugging Face. Veja impactos práticos e como se preparar.

8 min de leitura

Tags

LLMsMoEMultimodalidadeBenchmarksEpistemics