Google Antigravity e Gemini 3.7 Flash resolvem problemas
Antigravity, o framework de agentes do Google, e o modelo Gemini 3.7 Flash formam equipes multiagentes que atacam problemas abertos de matemática e engenharia, com provas verificadas e simulações de CPU de alta fidelidade.
Danilo Gato
Autor
Introdução
Google Antigravity e Gemini 3.7 Flash se uniram para enfrentar problemas abertos em matemática e engenharia com resultados verificáveis, incluindo sete problemas de pesquisa resolvidos e um simulador RISC V que inicializa o sistema xv6 com acurácia de ciclos. O ganho vem do casamento entre um modelo rápido e acessível, Gemini 3.7 Flash, e uma orquestração multiagente chamada Teamwork, recém atualizada no Antigravity. (blog.google)
O anúncio publicado em 31 de agosto de 2026 detalha que a combinação Antigravity mais Gemini 3.7 Flash elevou o desempenho em frentes como matemática teórica, sistemas e engenharia de software. O post oficial cita 71 por cento no TCSBench, construção de um simulador RISC V de nível de ciclo que dá boot no xv6 e melhorias aceitas upstream em Eigen e ParlayHash. (blog.google)
Como o Teamwork do Antigravity muda o jogo
O Teamwork é o framework de orquestração que organiza equipes de agentes com papéis complementares, como orquestrador, críticos, desafiadores e auditores, para conduzir projetos longos com verificação independente a cada marco. Disponível via o comando /teamwork-preview em planos pagos do Antigravity 2.0 e CLI, ele executa tarefas por horas ou dias com isolamento de diretórios, registros de estado e checagens adversariais antes de aprovar cada etapa. (antigravity.google)
Em vez de um único agente tentando fazer tudo, o Teamwork separa orquestração, implementação e verificação. O Sentinel coordena, o Project Orchestrator decompõe em marcos, Explorers investigam, Workers implementam, e uma cadeia de verificação com Critic, Challenger e Auditor impede que erros silenciosos avancem. Esse desenho minimiza o efeito eco, quando agentes concordam cedo com um erro e o amplificam. (antigravity.google)
Para o desenvolvedor, o fluxo se divide em duas fases. Primeiro, uma entrevista de escopo transforma objetivos em requisitos e critérios de aceitação mensuráveis. Depois, a execução autônoma começa, com agentes trabalhando em paralelo, cada um com diretório próprio, evidências de teste e logs. O usuário aprova a proposta inicial e acompanha pelo painel ou pelo status no CLI. (antigravity.google)
Provas longas, sete problemas abertos e 71 por cento no TCSBench
Em matemática e ciência da computação teórica, o Teamwork traz padrões especializados. O Long Proof gera estratégias em paralelo, pareia cada rota com um falsificador que tenta quebrá la, sintetiza os melhores caminhos e mantém um registro de armadilhas recorrentes. O resultado, segundo o blog do Antigravity, inclui sete problemas abertos resolvidos, como a Conjectura dos Ciclos de Knuth formalizada em Lean com prova de mais de 40 páginas, além de avanços em otimização esparsa, quantização de LLMs e fatorizações prefixo matriz. (antigravity.google)
Além do conjunto de soluções, o time reporta 71 por cento no TCSBench combinando Gemini 3.7 Flash com 3.1 Pro, superando resultados anteriores com Gemini 3.6 Flash, segundo os autores. O ponto chave é que o padrão Long Proof foi pensado para extrair o máximo de modelos Flash coordenando muitos agentes, em vez de depender apenas de um modelo maior. (antigravity.google)
Para quem pesquisa, isso significa acelerar hipóteses, refinar contraexemplos e registrar conhecimento tácito de tentativas fracassadas, com verificação formal quando possível. Para equipes de produto, abre espaço para usar um modelo mais barato e veloz dentro de um esquema de competição e crítica que aumenta a robustez das soluções.
Engenharia de sistemas, um simulador RISC V que dá boot no xv6
Em sistemas, o Teamwork construiu de ponta a ponta um simulador RISC V out of order, validado por comparação de ciclos contra um simulador BOOM e protegido contra shortcuts por sandbox do Spike. O resultado atingiu 0,71 por cento de erro médio de alinhamento de ciclos em cargas de teste não vistas, e consegue inicializar o xv6 até o shell, além de simular mais de 100 benchmarks do padrão RISC V. (antigravity.google)
Os agentes implementam unidades microarquiteturais como ROB, MSHR e cache, depois medem gaps de temporização em lockstep com oráculos de hardware. A descrição oficial destaca o desafio do silent execution gap, janelas de centenas de ciclos onde divergências microarquiteturais não aparecem no estado arquitetural. O fluxo de validação obriga lockstep contínuo e impede dependência em códigos de referência disponíveis na árvore do projeto. (antigravity.google)
Na prática, equipes que precisam de simuladores ou protótipos de microarquitetura podem usar um padrão semelhante, definindo benchmarks, regras de validação e métricas de ciclo como critérios de aceitação antes da execução autônoma. Essa postura empurra a verificação para o início do processo, reduz retrabalho e facilita auditoria posterior.
Contribuições aceitas em Eigen e ParlayHash
O anúncio também cita melhorias de engenharia de software entregues a projetos open source. Em Eigen, equipe multiagente detectou um caminho subótimo para GeMV quando a matriz tem linha ou coluna unitária, criou um fast path com acesso direto e SIMD, e passou pelo processo padrão de revisão, com commit aceito upstream. Em ParlayHash, a equipe inspirou a variante Swiss Parlay, levando a 2 vezes mais throughput em inserts iniciais com 64 threads e 25 por cento menos memória por elemento, com aproximação do melhor desempenho sequencial. Ambos os trabalhos foram confirmados como incorporados pelos mantenedores. (antigravity.google)
Para líderes técnicos, o recado é claro. Multiagentes podem não apenas sugerir patches, mas também cumprir o ciclo completo, desde desenho de microbenchmarks até revisão com critérios claros de aceitação, entregando valor real em bases de código maduras.
O que há de novo no Antigravity e como começar
Antigravity é a plataforma de desenvolvimento agent first do Google, anunciada para dar aos agentes um espaço de trabalho completo, com editor, terminal e navegador, integrados a projetos e artefatos versionáveis. O Teamwork, acessível por /teamwork-preview, está disponível em planos pagos, tanto na interface 2.0 quanto no CLI. A documentação explica papéis, fluxos de execução e modos de integridade, além de orientar a iniciar a entrevista de escopo e aprovar a execução autônoma. (developers.googleblog.com)
Para tarefas longas, o Teamwork distribui o trabalho em tracks paralelas, cria diretórios de rascunho por subagente e registra evidências de testes e logs por marco. O objetivo é permitir refatorações grandes, simulações complexas, provas longas e revisões documentais, sempre com gates de verificação independentes. (antigravity.google)
No Google I O 2026, a empresa destacou o /teamwork-preview como vitrine de equipes multiagentes com Gemini, inclusive demonstrando a construção de um sistema operacional do zero, o que contextualiza o salto em ambições e cases públicos desde então. (research.google)
Casos práticos que inspiram, da pesquisa ao produto
Os exemplos oficiais vão além de protótipos. Em matemática, a variação Long Proof formaliza verificação, incentiva competição de estratégias e conserva o que foi aprendido, mesmo de tentativas falhas. Em sistemas, a simulação de CPU com lockstep e validação temporal mostra que a plataforma não se limita a tradução de código, ela incorpora experimentação e correção guiada por benchmarks. Em engenharia de software, commits aceitos upstream e ganhos quantificados de throughput dão o selo de realidade aos resultados. (antigravity.google)
Do ponto de vista de time, faz sentido encadear três frentes ao adotar multiagentes. Primeiro, explicitar objetivos em métricas, testes e oráculos, como TCSBench, microbenchmarks, boot scripts e checklists formais. Segundo, permitir competição controlada de abordagens com críticos autônomos. Terceiro, garantir rastreabilidade completa de decisões, artefatos e logs.
Riscos, custos e como calibrar expectativas
Nem todo fluxo exige multiagentes. Para tarefas pequenas e bem delimitadas, o próprio Antigravity sugere caminhos mais leves, como o padrão de codificação iterativa. Para desafios grandes, o investimento compensa quando os critérios de verificação são claros e automatizáveis. A documentação enfatiza que o /teamwork-preview pode ajustar equipe e rodadas dinamicamente, o que ajuda a equilibrar custo e profundidade, mas a qualidade do escopo inicial continua determinante. (antigravity.google)
Dados recentes em fóruns de usuários mostram experiências variadas, desde sessões longas com dezenas de subagentes e resultados robustos até frustrações com produção de muitos arquivos auxiliares e gargalos de orquestração. Essas discussões reforçam a importância de domínio do problema, definição de oráculos e governança de mudanças para que o ganho líquido seja positivo. (reddit.com)
Oportunidades imediatas para equipes técnicas
Equipes de pesquisa podem adaptar o Long Proof a conjecturas internas, com estratégias concorrentes, falsificadores e um registry de pitfalls. Times de sistemas podem erguer harnesses de validação por lockstep e metas de erro percentual, como o caso do 0,71 por cento de desalinhamento. Engenheiros de plataforma podem usar os mesmos padrões para acelerar refatorações complexas com críticos adversariais e marcos auditáveis. Tudo isso hoje está acessível a partir do Antigravity 2.0 e do CLI, em planos pagos, com documentação prática para iniciar. (antigravity.google)
Conclusão
A combinação Google Antigravity e Gemini 3.7 Flash mostra que velocidade e custo do modelo, quando acoplados a uma orquestração multiagente rigorosa, bastam para atacar problemas tradicionalmente reservados a especialistas e ciclos longos. Provas verificadas, simuladores validados por ciclo e commits aceitos em bibliotecas populares são sinais concretos de maturidade. (blog.google)
O próximo passo é transformar esses padrões em rotina. Com objetivos claros, testes confiáveis e verificação adversarial, equipes podem usar o Teamwork para condensar semanas em dias. O valor está menos em mágica de um modelo e mais na disciplina de um processo que força qualidade a cada avanço.
Leia também
Anthropic abre uso do Claude a pesquisa independente, piloto com privacidade
A Anthropic abriu dados agregados de uso do Claude para pesquisa independente, em um piloto com auditoria de privacidade e liberação de dados. Três grupos estudaram 250 mil conversas de abril e maio de 2026 usando a ferramenta Anthropic Insights. Entenda o que foi medido, os limites do método e o que muda para pesquisadores e empresas.
11 min de leituraInteligência ArtificialRelatório OpenAI, ChatGPT soma 70 mi de conversas semanais de aprendizado além da sala de aula
OpenAI publicou um relatório detalhando como o ChatGPT sustenta 70 milhões de conversas semanais de aprendizado além da sala de aula. A análise mostra picos de mais de 460 milhões de mensagens por semana durante o ano letivo nos EUA e mais de 180 milhões no verão, além de evidências de ganhos quando IA e pensamento crítico são combinados. Entenda oportunidades, limites e como aplicar com responsabilidade.
8 min de leituraTecnologia e IAGemini Live ganha voz agentic, Spark, Daily Brief e Gmail
A nova leva de recursos do Gemini Live coloca voz agentic no centro da produtividade móvel. Com Spark, dá para orquestrar tarefas complexas. Com Daily Brief, o dia começa com um resumo inteligente. Ainda há gerenciamento de e-mails por voz no Gmail e contexto unificado via Personal Intelligence.
10 min de leituraInteligência ArtificialRadar da Particle, 130K podcasts para IA via API e MCP
O Radar da Particle indexa 130K podcasts e adiciona 20 mil episódios por dia, tornando o áudio pesquisável para agentes de IA via Search API e MCP. Com transcrição, rótulos de locutor, metadados de entidades e alertas, a plataforma atende casos como monitoramento de marcas, pesquisa competitiva e descoberta de insights. Planos começam em 29 dólares e há opção empresarial, além de integrações para agentes e desenvolvedores.
8 min de leitura