OpenAI, dois ajustes de API triplicam a pontuação do GPT-5.6 Sol no ARC-AGI-3
Retenção de raciocínio e compactação no Responses API mudaram o jogo. Entenda por que essas configurações elevaram o GPT-5.6 Sol de 13,3 por cento para 38,3 por cento no ARC-AGI-3, com 6 vezes menos tokens.
Danilo Gato
Autor
Introdução
A palavra chave aqui é configurações de API em ARC-AGI-3. No dia 29 de julho de 2026, a OpenAI detalhou como duas configurações, retenção de raciocínio e compactação, triplicaram a pontuação do GPT-5.6 Sol no benchmark ARC-AGI-3, além de cortar os tokens de saída em 6 vezes. O salto foi de 13,3 por cento com o arnês oficial para 38,3 por cento com o Responses API. Esse dado importa porque mostra que, em avaliações de agentes, pequenas decisões de execução podem distorcer resultados e conclusões sobre capacidade real. (openai.com)
O caso chama atenção porque o GPT-5.6 Sol já havia registrado números baixos no conjunto público, com 7,8 por cento em execuções iniciais e o GPT-5.5 chegando a 0,4 por cento. A mudança não veio de outro modelo, veio de como a sessão e o contexto foram gerenciados. Isso reposiciona a discussão sobre benchmarks interativos, onde o processo pesa tanto quanto o modelo. (openai.com)
O que este artigo vai abordar
- Por que o ARC-AGI-3 se tornou o novo campo de prova para inteligência agentiva.
- Como as duas configurações do Responses API funcionam e por que afetam o desempenho.
- O que os números significam à luz da métrica RHAE e do baseline humano.
- Guia prático para reproduzir ganhos, limites, riscos de overfitting de arnês e recomendações equilibradas.
ARC-AGI-3 em contexto
O ARC-AGI-3 é um benchmark interativo de raciocínio onde agentes exploram jogos 2D inéditos, inferem regras sem instruções explícitas e planejam ações em múltiplos turnos. Diferente de Q&A estático, aqui a memória de longo prazo e a coordenação entre passos decidem o resultado. O conjunto público traz 25 jogos para experimentação aberta e a série utiliza a métrica Relative Human Action Efficiency, RHAE, que compara a eficiência do agente a um baseline humano. (openai.com)
A RHAE mede duas coisas centrais, conclusão de níveis e eficiência de ações por nível em relação ao humano de referência. O escore total é a média por jogo, normalizada pelo progresso real do agente, o que impede maximizações artificiais em níveis iniciais fáceis. Essa definição é importante porque mudanças de arnês que preservam memória tendem a reduzir o número de ações e aumentar o número de níveis concluídos, afetando diretamente a RHAE. (docs.arcprize.org)
O achado da OpenAI, duas configurações que mudam tudo
A análise da OpenAI aponta dois pontos de atrito no arnês genérico do ARC-AGI-3. Um, as mensagens privadas de raciocínio eram descartadas a cada turno, o que forçava o modelo a reinterpretar o jogo repetidamente. Dois, a janela de contexto adotava truncamento rolante, fazendo com que ações antigas sumissem da visão do agente em sessões longas. Resultado, dificuldade cumulativa para formar e manter planos. (openai.com)
Ao migrar para o Responses API com as configurações corretas, a OpenAI ativou a retenção de raciocínio entre turnos, via encadeamento com previous_response_id e políticas de reasoning.context, e substituiu truncamento rolante por compactação, que resume e preserva informações salientes sem derrubar a memória funcional do agente. O efeito prático foi imediato, menos tempo pensando a cada ação, melhor aprendizado dentro do jogo e progressão mais rápida. (openai.com)
Os números publicados são claros. No conjunto público, o GPT-5.6 Sol marcou 13,3 por cento com o arnês oficial. Com retenção de raciocínio e compactação habilitadas, o escore foi para 38,3 por cento, aproximadamente 3 vezes mais alto, consumindo 6 vezes menos tokens de saída. A OpenAI estima, com base em logs oficiais de jogabilidade, que o humano médio de referência fica em torno de 48 por cento nesse conjunto. (openai.com)
O que exatamente é retenção de raciocínio e compactação
- Retenção de raciocínio, no Responses API, significa que as mensagens internas de pensamento do modelo, que antecedem saídas e chamadas de ferramenta, permanecem disponíveis como parte do histórico. Em tarefas multi turno estáveis, configurar reasoning.context para all_turns e encadear com previous_response_id torna o pensamento acumulado reutilizável, reduzindo retrabalho. (developers.openai.com)
- Compactação é uma política de gerenciamento de contexto que resume históricos longos, preservando fatos e decisões importantes enquanto elimina redundâncias. Em vez de cortar o início da conversa, a sessão é condensada estrategicamente, mantendo coerência e memória útil para a tarefa. (openai.com)
Do ponto de vista do custo, a combinação gera economia adicional porque menos tokens são gastos em raciocínios repetitivos. Em ambientes de agente, esse comportamento é crucial, já que sequências de ações podem durar centenas de turnos, com descrições de grade, estados e anotações a cada passo. (openai.com)
RHAE, baseline humano e como interpretar os 38,3 por cento
A RHAE não mede só acertos, mede eficiência de ações em relação ao humano. Para ganhar 100 por cento em um jogo, um agente precisa terminar todos os níveis e operar com eficiência próxima do humano de referência, ponderada por nível. Se o agente não chega ao último nível, a pontuação máxima possível cai, independente de quão eficiente foi antes. Isso explica por que mudanças de arnês que aumentam progressão e economizam ações têm efeito multiplicativo na RHAE. (docs.arcprize.org)
A estimativa de 48 por cento como referência humana média no conjunto público dá uma régua prática. Com 38,3 por cento após os ajustes, o GPT-5.6 Sol ainda não iguala o humano, porém o salto mostra que o gargalo não era exclusivamente o modelo. Era a forma como o histórico era gerido, algo que qualquer time pode otimizar nos seus agentes. (openai.com)
Lições para times de produto e pesquisa

- Avalie modelo e arnês como um sistema. Benchmarks não medem apenas a arquitetura, medem também decisões de execução, configurações de API e promptagem. Se o seu agente parece “esquecer” planos, há grande chance de o problema estar na sessão, não no modelo. (openai.com)
- Prefira Responses API ao legado Chat Completions em agentes complexos. Configure retention de raciocínio quando os objetivos e premissas se mantêm estáveis entre turnos. Use compactação para evitar perdas silenciosas de contexto. (openai.com)
- Compare sempre com métricas apropriadas. Em tarefas interativas, priorize métricas como RHAE, que punem ineficiência, e use conjuntos controlados onde existam logs humanos e ferramentas oficiais de scoring. (docs.arcprize.org)
Como reproduzir a melhoria no seu pipeline
- Troque para Responses API e habilite raciocínio persistido quando fizer sentido. Pro modo e níveis de effort podem ser ajustados de acordo com a relação qualidade, latência e custo da sua tarefa. Garanta que previous_response_id esteja correto a cada continuação. (developers.openai.com)
- Substitua truncamento rolante por compactação. Regule limites de janela e verifique se o resumo preserva estados, metas e hipóteses. Acompanhe cached_tokens e cache_write_tokens quando utilizar caching explícito para evitar gastos desnecessários. (developers.openai.com)
- Valide com jogos públicos do ARC-AGI-3. Rode múltiplas seeds e registre logs de eventos e ações. Use a documentação oficial para pontuar e interpretar resultados, de preferência replicando o protocolo do benchmark. (docs.arcprize.org)
- Faça ablação. Compare sessões com e sem retenção de raciocínio e com e sem compactação. Avalie impacto em número de níveis concluídos, ações por nível, tokens de saída e tempo por ação. (openai.com)
O debate mais amplo sobre evals de agentes
O lançamento do ARC-AGI-3 catalisou pesquisas e discussões sobre exploração versus profundidade, design de arnês e capacidade real dos modelos. Trabalhos recentes mostram ganhos incrementais e propõem táticas como simplificação e verificação em agentes de código, mas convergem na mesma lição, a infraestrutura de agente e o regime de memória importam tanto quanto o núcleo do LLM. A crítica metodológica também cresceu, reforçando que o conjunto público tem limitações e que o conjunto privado é mais discriminativo para “inteligência genuína”. Esse pano de fundo ajuda a interpretar qualquer nova pontuação, inclusive as da OpenAI. (arxiv.org)
Ao mesmo tempo, o ecossistema abriu logs e trajetórias, o que facilita auditoria independente, replicação e engenharia de arnês. Conjuntos em Hugging Face trazem jogadas completas com eventos, estados e manifestos de avaliação. Para times que querem ir além do marketing, esses artefatos são um atalho para reproduzir e entender por que certas configurações funcionam melhor. (huggingface.co)
Boas práticas de engenharia de arnês
- Preserve raciocínio quando a tarefa exigir continuidade. Em ambientes de jogo ou navegação, decisões de hoje carregam efeitos amanhã.
- Registre tudo. Logs de eventos, ações aceitas, estados e resumos são cruciais para depurar e ablar.
- Otimize custos com parcimônia. Se compactação salvar contexto e reduzir tokens, ótimo. Mas valide se resumos não amputam detalhes que quebram planos.
- Defina políticas de memória por tipo de tarefa. Tarefas estáveis ganham com all_turns. Tarefas episódicas podem preferir current_turn.
- Reporte com métricas alinhadas ao domínio. Em raciocínio interativo, RHAE e progresso por nível dizem mais que acurácia estática. (developers.openai.com)
Riscos e limites
- Overfitting de arnês. Otimizar demais para um benchmark público pode inflar números sem transferir para cenários de produção. A melhor defesa é avaliar em múltiplos ambientes e, quando possível, no conjunto privado ou em tarefas proprietárias controladas. (arcprize.org)
- Comparabilidade. Se um time usa truncamento rolante e outro usa compactação com retenção, as pontuações não são comparáveis de forma direta. Publicar configurações e logs é parte da solução. (docs.arcprize.org)
- Custo operacional. Retenção e compactação exigem gestão de sessão e, às vezes, snapshots ou resumos adicionais. Ainda assim, o caso da OpenAI mostra que a economia de tokens pode compensar. Meça antes de padronizar. (openai.com)
O que isso significa para a agenda de produto
Quem constrói agentes em produção, de atendimento a jogos e automação de software, ganha um mapa de ação. Primeiro, reproduzir retenção de raciocínio e compactação em um ambiente de teste representativo. Segundo, provar impacto em tempo de ciclo, taxa de sucesso e custo. Terceiro, padronizar políticas de memória e resumos. Por fim, criar um protocolo de eval que não dependa de um único benchmark, alinhando-se ao problema e ao usuário final. (developers.openai.com)
Conclusão
O estudo da OpenAI reforça que configurações de API, especialmente memória e gerenciamento de contexto, são alavancas poderosas em agentes. No ARC-AGI-3, a simples troca para retenção de raciocínio e compactação elevou o GPT-5.6 Sol de 13,3 por cento para 38,3 por cento, com 6 vezes menos tokens. Em outras palavras, não é só o que o modelo pensa, é o que ele consegue lembrar entre passos. (openai.com)
Para equipes técnicas, a lição é pragmática. Em vez de trocar de modelo na primeira queda de desempenho, ajuste o arnês. Aplique retenção de raciocínio quando houver continuidade de objetivos, use compactação para preservar memória útil e teste com métricas que reflitam o trabalho do seu agente. O ganho pode não ser apenas estatístico, pode ser operacional e econômico.
Leia também
Microsoft MAI corta GPU 89 por cento com MAI-Cyber-1-Flash
Modelos MAI da Microsoft mostram que performance de fronteira não exige sempre o maior modelo. Com MAI-Cyber-1-Flash dentro do MDASH, a empresa reporta 50 por cento de economia no sistema que lidera o CyberGym, enquanto Voice e Image cortam até 89 e 84 por cento em GPU. Entenda a estratégia por trás dos ganhos e como aplicar no stack.
9 min de leituraIA e DesenvolvimentoGemini Managed Agents: 3.6 Flash padrão, Hooks, Free Tier
A atualização dos Managed Agents da Gemini API coloca o 3.6 Flash como padrão, adiciona Hooks de ambiente para controles antes e depois de execuções e libera uma camada gratuita. Entenda o que muda na prática, como ativar, como reduzir custos e quando usar MCP remoto e webhooks.
10 min de leituraIA e RegulaçãoFuncionários da OpenAI, Anthropic e Google pedem que EUA regulem o desenvolvimento automatizado de IA
Funcionários de OpenAI, Anthropic e Google pressionam por limites claros ao uso militar e por regras que alcancem o desenvolvimento automatizado de IA. O movimento ocorre enquanto o governo dos EUA amplia vetos e avaliações prévias de acesso a modelos de ponta e Big Tech discute restrições a modelos open weight. Entenda as frentes, os riscos e como isso impacta produtos, compliance e estratégia.
12 min de leituraIA generativaMeta AI ganha recursos agentes com o Muse Spark 1.1
A Meta anunciou que o Meta AI agora não só responde, ele executa. Impulsionado pelo Muse Spark 1.1, o assistente planeja, conecta a e-mail e calendário, cria briefings diários e produz slides, com rollout inicial em mercados selecionados. Entenda impactos para produtividade, cases citados pela Meta e como desenvolvedores podem usar a nova Model API.
10 min de leitura