Strands lança Decider 2B, decisão open source para IA local
Decider 2B chega como um modelo de decisão pequeno, rápido e aberto, feito para experimentação, desenvolvimento local e inovação em agentes, com latências de ~115 ms em hardware comum.
Danilo Gato
Autor
Introdução
Strands Decider 2B, a palavra‑chave deste artigo, foi lançado em 1 de outubro de 2026 como um modelo de decisão open source focado em velocidade e execução local. A proposta é simples e poderosa, escolher entre opções ou atribuir notas com probabilidades calibradas, em milissegundos, sem depender de um LLM completo. (strandsagents.com)
O lançamento destaca três pontos estratégicos, latência baixa em hardware acessível, pesos abertos com receita de treinamento reproduzível e uma classe de uso emergente, system one decision models, que fazem parte de arquiteturas de agentes modernas. O anúncio detalha que o Strands Decider 2B está no GitHub, com pesos no Hugging Face, e foi construído sobre a base Qwen3.5‑2B com uma cabeça de ponte que substitui o LM head tradicional. (strandsagents.com)
O que é um “decision model” e por que isso importa
Decision models, também chamados de system one models, são redes otimizadas para resolver perguntas tipadas, por exemplo, yes or no, escolha entre N opções, ou nota em escala ordinal, e retornam a resposta com uma probabilidade calibrada. Em troca de abrir mão da geração de texto, ganham velocidade e eficiência, o que os torna ideais para tarefas de roteamento de modelos, seleção de ferramentas, guardrails, avaliações e política de classificação dentro de agentes. O post original enfatiza essa mudança de trade‑off entre flexibilidade e latência, e como isso reduz custo por decisão ao mesmo tempo que mantém confiabilidade via calibração. (strandsagents.com)
Nos últimos meses, essa categoria ganhou tração com o Jev da TypeSafe AI e seus derivados abertos. Publicações independentes vêm chamando atenção para a capacidade desses modelos de empacotar compreensão semântica com escolhas restritas e probabilidades, de modo que desenvolvedores podem usá‑los como um “recurso” de IA de propósito geral, sem a sobrecarga de treinar classificadores sob medida. (wwt.com)
Como o Strands Decider 2B funciona por dentro
A arquitetura parte de um torso LLM pré‑treinado, Qwen3.5‑2B‑Base. Em vez de gerar texto, o time remove o LM head e adiciona uma pointer head com pouco mais de um milhão de parâmetros. Essa cabeça compara o estado oculto na posição <answer> com o estado no final de cada opção e, com uma única passada, produz os logits de todas as opções. O mesmo softmax mascarado atende três tipos de pergunta, noul, choice e score. (github.com)
Essa mudança elimina o loop de decodificação caractere a caractere e permite tempos de resposta na casa de dezenas a centenas de milissegundos, mesmo localmente. O blog detalha ainda que a calibração e a acurácia são medidas no JevBench público, com números atualizados por versão e janela de contexto, e que a equipe vem iterando o design, o release v19 é o marco principal divulgado. (github.com)
Aplicação prática imediata, plug‑in de decisão barata dentro do fluxo do agente. O repositório traz um exemplo onde o decider atua antes de uma chamada de ferramenta para verificar se os argumentos estão ancorados no que o usuário disse e se não é cedo demais para chamar a ferramenta, reduzindo alucinações operacionais e idas e vindas desnecessárias. (github.com)
Desempenho, latência e ambiente de execução
Os números de referência publicados mostram que o Strands Decider 2B responde com mediana de 115 ms por pergunta em uma RTX 3090, e com cerca de 153 ms em um MacBook com chip M3, considerando tarefas pequenas. Em JevBench, as métricas reportadas incluem acurácia e Brier score, além de percentis de latência. A postagem e o README detalham tabelas e splits de tarefas, reforçando que variações pequenas entre execuções estão dentro do ruído estatístico. (strandsagents.com)
Além do PyTorch local, há conversões oficiais para ONNX que rodam via WebGPU no navegador, com quantizações q8 e q4f16, mantendo diferenças de probabilidade pequenas versus a referência em CPU fp32. O cartão ONNX indica cerca de 130 ms por pergunta curta no Chrome em Mac M3 Pro para o pipeline Transformers.js, e descreve o layout de tensores, entrada e saída da cabeça ponte. (huggingface.co)
Para times que querem começar rápido, há um pacote CLI, pip install strands-decider, com exemplos de perguntas do tipo choice e um fluxo de integração no Strands Agents. Tudo isso foi publicado em 1 de outubro de 2026, com o texto atribuído a membros do Strands Labs, e os pesos estão acessíveis no Hugging Face. (strandsagents.com)
Licença, abertura e reprodutibilidade
O projeto é publicado sob licença Apache 2.0, com repositório contendo não só o código de inferência, como também a receita e scripts de treinamento, lista de fontes de dados com licenças, contratos de reprodução e registros das rodadas de pesquisa, inclusive com pré‑registros de hipóteses e outcomes por versão. Esse padrão de engenharia aberta facilita auditoria, repetição e evolução do método pela comunidade. (github.com)
Há também uma versão ONNX mantida pela comunidade, com cartão deixando claro que a base é Qwen3.5‑2B com LoRA rank‑16 fundida nas matrizes e o LM head removido, além de orientações para uso com Transformers.js. A licença declarada nessa variante também é Apache 2.0. (huggingface.co)
Onde o Decider 2B se encaixa no cenário atual
O Strands Decider 2B entra em um ecossistema que vem se consolidando desde a “onda Jev”, com reproduções abertas, forks e explorações paralelas. Projetos como decider‑2b da Mapika documentam misturas de dados, tags de versões e comparações em benchmarks como JevBench e pacotes de tarefas públicas. Essa diversidade ajuda a balizar expectativas, entender trade‑offs e validar abordagens de calibração. (huggingface.co)
A própria comunidade de engenharia vem publicando análises sobre ascensão dos decision models, explicando por que emparelhar compreensão semântica com escolhas tipadas e probabilidades calibradas cria um building block reutilizável em agentes, sem custo de tempo de um LLM ou do ciclo de MLOps de um classificador sob medida. (wwt.com)
Por fim, artigos e notas independentes destacam o ponto estratégico, latência local com custos previsíveis. Relatos externos mencionam 115 ms de mediana em RTX 3090 e destacam que a abertura inclui pesos e dados de treino, sinalizando compromisso com reprodutibilidade. (rushcommerce.dev)
Casos de uso práticos para times de produto
- Roteamento de modelos, decidir quando escalar para um LLM caro ou ficar no caminho rápido, com probabilidade calibrada que guia o fallback. O material do Strands mostra esse padrão na prática, onde dúvidas elevadas fazem o agente perguntar mais ou subir o nível de raciocínio. (strandsagents.com)
- Seleção de ferramentas, antes de acionar uma API, o decider verifica se os argumentos estão ancorados no que o usuário disse, reduzindo chamadas inúteis e garantindo grounding. (github.com)
- Guardrails e moderação, perguntas binárias do tipo permitido ou não e classificações rápidas com score calibrado, úteis para bloquear saídas arriscadas sem penalizar a velocidade. (strandsagents.com)
- Avaliação e ranking, preferir A ou B, dar uma nota sob rubrica e usar a probabilidade para compor confiança no pipeline, inclusive em avaliações automatizadas. (strandsagents.com)
Como integrar, da prova de conceito ao produto
- Comece local, instale o CLI, carregue o modelo StrandsAgents/strands‑decider‑2B‑hobson‑v19 e exercite perguntas choice e noul com seu próprio estado. A curva de aprendizado é curta, já que o modelo fala o “idioma” de decisões tipadas em uma só passada. (strandsagents.com)
- Leve para o agente, use a intervenção before_tool_call do exemplo para decidir entre prosseguir, negar, confirmar com humano ou guiar o LLM de volta com feedback. Esse gancho reduz latência média e falhas por chute. (github.com)
- Otimize a pilha, se quiser web, avalie a versão ONNX com Transformers.js e WebGPU, onde q8 tende a preservar melhor a confiança em inputs maiores. Se a prioridade for download menor, q4f16 é opção. (huggingface.co)
- Monitore calibração, trate a probabilidade como sinal, acerte thresholds por domínio e mensure ECE ou Brier score no seu conjunto de validação. O repositório fornece scripts e ressalvas para ler resultados com rigor. (github.com)
Comparativos e limites conhecidos
Benchmarks independentes rastreiam a evolução de modelos do tipo decider, com reprodutores que reportam empates e diferenças pequenas contra originais e contra Jev, dependendo do pacote de dados e da tarefa. Há registros públicos de regressões em versões específicas e divergências em conjuntos mantidos pela comunidade, um lembrete saudável de que avaliação é arte e ciência. (github.com)
Editorialmente, isso reforça a leitura indicada pelo Strands Labs, diferenças pequenas entre execuções únicas ficam dentro do desvio padrão medido, e comparar números exige atenção à janela de contexto, quantização e layout de prompt. Esse tipo de transparência, com dados, scripts e histórico de pesquisa, é o que sustenta a utilidade de modelos abertos na prática. (github.com)
Reflexões e insights ao longo do caminho
- Velocidade muda arquitetura, quando decisões custam ~100 ms e centavos de milésimo de dólar, aparece uma nova camada entre regras rígidas e LLMs de raciocínio. Essa camada permite podar árvores de ação cedo, manter ferramentas honestas e reservar raciocínio caro para casos difíceis. (strandsagents.com)
- Calibração é produto, não só pesquisa. Probabilidade boa vira UX melhor, menos surpresas em produção e decisões alinhadas a risco. Os números de Brier e ECE publicados indicam maturidade para tarefas padrão de guardrails e roteamento. (github.com)
- Aberto acelera ciclo de feedback. Ao publicar pesos, dados e receita, mais times conseguem reproduzir, forkar e comparar, o que pressiona o estado da arte a evoluir de forma verificável, inclusive no navegador via ONNX. (huggingface.co)
Conclusão
Strands Decider 2B chega em um momento em que agentes exigem decisões rápidas, baratas e confiáveis. A combinação de latência local, calibração sólida e abertura, código, pesos e dados, oferece um caminho prático para reduzir custo e risco sem engessar o desenvolvimento. Quem trabalha com agentes, integrações e automação vai reconhecer o valor imediato desse novo bloco de construção. (strandsagents.com)
O convite é claro, experimentar. O repositório traz exemplos, a CLI acelera os primeiros testes e a comunidade já discute usos, comparativos e versões. A pilha ONNX abre a porta para o navegador e o mobile, e o ecossistema de decision models continua esquentando com reproduções e avaliações abertas. Começar pequeno hoje, com Strands Decider 2B, prepara o terreno para agentes mais rápidos e previsíveis amanhã. (huggingface.co)
Leia também
Social Media Examiner 73% usam IA, Claude vence ChatGPT 2026
O relatório de IA 2026 da Social Media Examiner crava 73% de uso diário de IA entre marketers e vira o jogo, Claude é apontada como plataforma mais importante, à frente do ChatGPT. Entenda o que muda em conteúdo, agentes de IA, governança e ROI, com ações práticas para equipes B2B e B2C.
9 min de leituraInteligência ArtificialMuse da Scale AI ganha e-mail para threads e tarefas
O Muse AI assistant passa a operar com um e-mail dedicado para centralizar threads e transformar mensagens em tarefas rastreáveis. O movimento reduz ruído na caixa de entrada, melhora o follow-up e aproxima o conceito de agente pessoal que trabalha de forma autônoma com segurança e supervisão humana.
10 min de leituraInteligência ArtificialXiaomi lança MiMo‑V2.6, série de IA multimodal com desenvolvimento aberto
A Xiaomi apresentou a série MiMo‑V2.6, modelos de IA multimodal com pesos abertos, contexto de 1 milhão de tokens e foco em agentes. O pacote inclui relatórios, ambientes de RL, API estável e distribuição via plataformas parceiras. Entenda o que muda em desempenho, preços e aplicações práticas.
11 min de leituraIA aplicada a negóciosMuse AI amplia beta de chamadas ativas para empresas nos EUA
O Muse AI começou a liberar chamadas ativas para empresas nos EUA, ampliando seu beta com foco em números verificados. A novidade coloca o agente da Meta na disputa por tarefas do mundo offline e abre oportunidades práticas em vendas, suporte e operações, desde que respeitados limites de consentimento e qualidade.
11 min de leitura