Cabos de rede conectados em rack de servidor, ilustrando infraestrutura para IA
Inteligência Artificial

Thinking Machines lança Inkling-Small, 276B MoE igual ao Inkling com 1/4 do tamanho

Inkling-Small chega com 276B de parâmetros em MoE, 12B ativos e desempenho semelhante ao Inkling, porém com custo e latência significativamente menores, abrindo espaço para produção real.

Danilo Gato

Danilo Gato

Autor

31 de julho de 2026
9 min de leitura

Introdução

Inkling-Small, modelo open-weights da Thinking Machines lançado em 30 de julho de 2026, iguala o desempenho do Inkling em diversas tarefas com apenas um quarto do tamanho. A palavra-chave aqui é Inkling-Small, uma variação de 276 bilhões de parâmetros em arquitetura Mixture-of-Experts com apenas 12 bilhões ativos por passo, entregue com foco em eficiência de custo e latência. Segundo a empresa, o modelo mantém raciocínio, multimodalidade nativa e janelas de contexto de até 1 milhão de tokens, com preços de inferência mais baixos que o irmão maior. (thinkingmachines.ai)

O anúncio chega duas semanas após o lançamento do Inkling, o primeiro modelo aberto da companhia, um MoE multimodal com 975 bilhões de parâmetros totais e 41 bilhões ativos, também com 1 milhão de contexto e foco em controle de esforço de raciocínio. O Inkling estabeleceu a receita, o Inkling-Small executa a mesma visão com custos mais acessíveis. (thinkingmachines.ai)

O que muda com o Inkling-Small

A Thinking Machines deixou claro o objetivo: entregar performance comparável ao Inkling com muito menos computação. A especificação central traz 276B totais, 12B ativos, treinamento em sistemas NVIDIA GB300 NVL72, raciocínio ajustável por orçamento de pensamento, e suporte nativo a texto, imagem e áudio, preservando a janela de até 1M de tokens. No anúncio, a equipe destaca que o Small alcança resultados semelhantes ao Inkling no Terminal-Bench 2.1, HLE texto puro e IFBench, com vantagens relevantes em eficiência. Preço de saída por 1M de tokens foi divulgado como 1,20 dólares no Small versus 4,05 dólares no Inkling. (thinkingmachines.ai)

Essa paridade de desempenho em um formato mais leve gera duas consequências práticas. Primeiro, viabiliza protótipos rápidos e MVPs de agentes com custo previsível. Segundo, reduz barreiras para rodar inferência em provedores alternativos, inclusive setups onde placa e memória são limitantes. O conjunto de decisões, do MoE de baixa ativação ao ajuste de esforço por tarefa, foi feito para equilibrar custo, tempo e qualidade.

Por dentro dos números de benchmark

A página oficial lista comparações que merecem atenção. Em Humanity’s Last Exam, o Inkling-Small marcou 31,6 por cento contra 29,7 por cento do Inkling. Em SWEBench-Verified, o Small passou de 80 por cento. Nas curvas de esforço, o Small manteve vantagem de eficiência ao longo de diferentes orçamentos de raciocínio. Esses resultados consideram esforço de raciocínio próximo de 0,99 e temperatura 1, com padronização de tokens gerados que inclui tokens de raciocínio, seguindo metodologia do Artificial Analysis. (thinkingmachines.ai)

Além disso, a empresa reporta um índice AA v4.1 de 40 por cento para o Small, com 12B ativos em 276B totais, frente a 41B ativos em 975B totais do Inkling. Em tarefas de agentes e código, como Terminal Bench e SWEBench, o Small aparece competitivo em eficiência de tokens e custo. Para quem monta pipelines que integram RAG, ferramentas e execução de código, essa eficiência costuma se traduzir em menos gastos por tarefa resolvida e menores filas de latência sob carga. (thinkingmachines.ai)

Multimodalidade e áudio, o detalhe que importa

Os dois modelos compartilham uma arquitetura multimodal nativa, sem acoplamento pesado a encoders externos, e trabalham com dMel para áudio e divisão de imagens em patches de 40 por 40 pixels alimentados por um hMLP leve. O Inkling-Small também aprimorou o uso de Python para tarefas visuais, algo relevante para leitura de gráficos e documentos complexos. Em benchmarks como MMMU Pro e conjuntos de áudio como AudioMC, MMAU e VoiceBench, os números do Small ficam próximos dos equivalentes abertos e fechados de referência, a uma fração do custo operacional. (thinkingmachines.ai)

Na prática, multimodalidade que integra leitura visual programática com raciocínio textual reduz fricção em fluxos do mundo real. Um exemplo é auditoria de PDFs com gráficos minúsculos acompanhados de tabelas, em que recortes programáticos e zoom inteligente aumentam a robustez. Outro é triagem de áudio de call centers, unindo compreensão semântica com geração de pareceres concisos, tudo sob limites de tempo apertados.

Epistemics, previsão e segurança

A família Inkling vem enfatizando epistemics, que envolve calibrar confiança e melhorar a conduta sob incerteza. O Small foi treinado com foco semelhante, inclusive usando RL com regras de pontuação próprias de previsão, além de avaliações em conjuntos como ForecastBench e Prophet Arena. Entre 19 e 28 de julho de 2026, os testes reportados mostram Brier melhor que o Inkling sem busca, com paridade quando há busca. Isso tende a reduzir respostas com excesso de certeza em temas ambíguos e a favorecer previsões expressas com intervalos coerentes. (thinkingmachines.ai)

Em segurança, a equipe informa que o Small herdou a receita de pós-treinamento do Inkling e passou por testes internos e red-teaming externo. Nos números divulgados, o modelo é competitivo em FORTRESS, tanto em recusa a pedidos nocivos quanto em evitar recusas em conteúdo benigno, e mantém taxas de recusa muito altas no StrongREJECT. Para quem opera em ambientes regulados, esse equilíbrio entre recusar o que deve e responder quando é seguro é um indicador prático importante. (thinkingmachines.ai)

Por que 276B totais e 12B ativos fazem sentido agora

A linha Inkling adota MoE com ativação parcial como resposta ao dilema custo versus qualidade. O design com 12B ativos no Small reduz FLOPs por amostra e, combinado ao ajuste de esforço de raciocínio, cria uma curva de trade-off controlável. Em termos simples, é possível gastar menos tokens de saída, manter coerência e ainda assim destravar raciocínio quando necessário, algo que se torna crítico em agentes que codam, chamam ferramentas e mantêm estado em janelas grandes. Os gráficos oficiais do lançamento explicitam como o custo por amostra cai no Small, enquanto a qualidade se mantém próxima em tarefas representativas. (thinkingmachines.ai)

Vale lembrar que o Inkling maior inaugurou publicamente essa proposta há duas semanas, com 975B totais e 41B ativos, como um modelo aberto e ajustável. O Small surge como a peça de produção pragmática para quem precisa escalar uso em equipe e manter previsibilidade de conta. (thinkingmachines.ai)

Ilustração do artigo

Custos, provedores e onde testar agora

O anúncio lista preço de saída de 1,20 dólares por 1M de tokens para o Small contra 4,05 dólares para o Inkling, com custos estimados por amostra calculados a partir de tokens gerados e preços publicados de provedores. Os pesos completos do Inkling-Small estão disponíveis e o modelo pode ser testado e ajustado no Tinker, o ambiente da própria Thinking Machines. Esses detalhes importam para equipes que querem avaliar TCO antes de consolidar um stack. (thinkingmachines.ai)

O ecossistema ao redor do Inkling vem crescendo desde o anúncio de 15 de julho de 2026, com suporte em plataformas de inferência e menções na imprensa de tecnologia. Para quem busca acesso imediato a endpoints gerenciados e a pesos em repositórios conhecidos, os canais oficiais reúnem a documentação, a model card e as opções de execução. (ibm.com)

Aplicações práticas que já dá para colocar em produção

  • Agentes de suporte com áudio nativo. O Small processa dMel e mantém compreensão robusta de fala, útil em triagem de chamadas e roteamento assistido. A combinação de VoiceBench e MMAU sugere competitividade frente a referências abertas e fechadas, especialmente considerando custo por saída. (thinkingmachines.ai)
  • Analítica de documentos com visão programática. Patches de 40 por 40 pixels mais uso de Python facilitam inspeção de áreas pequenas em relatórios e gráficos, melhorando a exatidão de respostas em auditorias e revisões. (thinkingmachines.ai)
  • Agentes de código e tool-use. Os resultados em SWEBench-Verified, SWEBench Pro e Terminal Bench mostram que o Small sustenta pipelines de depuração, geração de PRs e chamadas de APIs com eficiência de tokens. (thinkingmachines.ai)
  • Forecasting operacional. A ênfase em epistemics, com Brier sólido e calibragem via regras próprias de previsão, torna o modelo candidato para cenários de previsão de demanda, risco e alocação de recursos, desde que os dados e limites de uso sejam bem definidos. (thinkingmachines.ai)

Como comparar com o modelo maior na prática

A decisão entre Inkling e Inkling-Small hoje passa por quatro perguntas simples.

  1. Qual é o orçamento mensal para inferência em tokens de saída. O Small custa menos por 1M de tokens, o que tende a favorecer produtos com alto volume de uso. (thinkingmachines.ai)
  2. Quanta latência pode ser tolerada por interação. Com menos parâmetros ativos e esforço controlável, o Small oferece respostas mais rápidas em muitas cargas. (thinkingmachines.ai)
  3. Qual é o grau de dependência de conhecimento de cauda longa. O Inkling ainda leva vantagem em cobertura factual e conhecimento, segundo a própria equipe. Em tarefas de raciocínio e agentes, o Small frequentemente empata ou supera. (thinkingmachines.ai)
  4. O produto precisa de áudio e visão em tempo real. A arquitetura multimodal nativa e os ganhos práticos no uso de Python para visão favorecem o Small quando custo e tempo são críticos. (thinkingmachines.ai)

Onde essa tendência encaixa no cenário maior

A chegada do Small reforça um movimento em direção a modelos abertos com controle de esforço, janelas grandes e foco prático em agentes. O Inkling original já foi coberto por veículos especializados como Wired e TechCrunch, posicionando a proposta como alternativa americana aos melhores modelos open-weights de fora. O Small traduz essa tese em operação diária, trazendo custo por amostra mais baixo e eficiência de tokens. (wired.com)

Para equipes que enfrentam restrições de hardware, o detalhe logístico faz diferença. O treinamento ocorreu em NVL72 de última geração, mas a inferência pode ser estruturada de forma elástica em provedores compatíveis. A possibilidade de baixar pesos, ajustar no Tinker e executar em fornecedores diversos reduz risco de bloqueio e dá margem para negociar preço de infraestrutura. (thinkingmachines.ai)

Conclusão

O Inkling-Small coloca na mesa uma relação custo, desempenho e controle difícil de ignorar. Com 276B totais, 12B ativos e 1M de contexto, o modelo iguala o Inkling em várias frentes, custa menos por token de saída e chega com pesos completos disponíveis, o que acelera ciclos de POC e adoção. Para quem precisa escalar agentes, visão e áudio sem explodir a conta, o timing e as escolhas técnicas fazem sentido. (thinkingmachines.ai)

A recomendação prática é simples. Avalie o Small em um recorte real do seu fluxo, medindo tokens de raciocínio e resposta, latência ponta a ponta e custo efetivo por tarefa. Se a curva de esforço controlável entregar a qualidade que o seu caso requer, há uma boa chance de o Small virar o seu cavalo de batalha, enquanto o Inkling maior fica como reserva para workloads onde cobertura factual extra compensa o custo. (thinkingmachines.ai)

Leia também

Inteligência Artificial

Tavus lança PAL Maker no-code para companheiros de vídeo IA

O Tavus PAL Maker é uma plataforma no-code para criar companheiros de vídeo com IA, com stack próprio de modelos para expressão facial, percepção multimodal e turn-taking. Integra Google Meet, memórias, base de conhecimento e white label. Veja casos reais e como começar agora.

9 min de leitura
Inteligência Artificial

Ideogram lança P-Image-Ideogram, modelos Pareto-ótimos a partir de US$ 0,003

A Ideogram apresentou P-Image-Ideogram com promessa de modelos Pareto-ótimos e preço inicial de US$ 0,003. Na prática, o ecossistema traz tiers por megapixel e por imagem, como V4.0q hospedado na fal e o p-image da Pruna. Entenda onde esse preço se aplica, diferenças por qualidade e como explorar tipografia impecável e layout confiável sem estourar o orçamento.

10 min de leitura
IA e Modelos

OpenAI, dois ajustes de API triplicam a pontuação do GPT-5.6 Sol no ARC-AGI-3

A OpenAI revelou que habilitar duas configurações no Responses API, retenção de raciocínio e compactação, triplicou o desempenho do GPT-5.6 Sol no ARC-AGI-3. O salto foi de 13,3 por cento para 38,3 por cento na lista pública, reduzindo em 6 vezes os tokens de saída. Veja como isso afeta a forma de avaliar agentes, o que muda nos seus projetos e como reproduzir a melhoria com práticas de API.

9 min de leitura
Inteligência Artificial

Microsoft MAI corta GPU 89 por cento com MAI-Cyber-1-Flash

Modelos MAI da Microsoft mostram que performance de fronteira não exige sempre o maior modelo. Com MAI-Cyber-1-Flash dentro do MDASH, a empresa reporta 50 por cento de economia no sistema que lidera o CyberGym, enquanto Voice e Image cortam até 89 e 84 por cento em GPU. Entenda a estratégia por trás dos ganhos e como aplicar no stack.

9 min de leitura

Tags

LLMsMoEMultimodalidadeBenchmarksEpistemics