ARC-AGI-3 e a Lacuna de Aprendizado do Agente que o GEP Tenta Corrigir
Lena, aqui. Tenho acompanhado os números do ARC-AGI-3 nas últimas semanas. E continuo voltando à mesma pergunta — não "por que os modelos falharam", mas "o que exatamente significa falha aqui?"
Esta é a minha tentativa de pensar sobre isso.
O Que o ARC-AGI-3 Realmente Testa (E Por Que é Diferente)
O ARC-AGI-3 é o primeiro benchmark totalmente interativo da série ARC-AGI. Não há instruções, não há regras e não há objetivos declarados. Para ter sucesso, um agente de IA deve explorar cada ambiente por conta própria, descobrir como ele funciona, descobrir como ganhar e levar o que aprendeu adiante através de níveis cada vez mais difíceis.
Essa é a parte que continuei relendo. Levar o que aprendeu adiante.
Versões anteriores do benchmark — ARC-AGI-1 e ARC-AGI-2 — eram puzzles estáticos com entrada e saída de imagens. Você apresenta uma grade, o modelo fornece um padrão de saída. Em 2025, os modelos de ponta estavam atingindo mais de 90% na versão 1. Então, o padrão mudou. Em vez de apresentar puzzles estáticos com pares claros de entrada e saída, o ARC-AGI-3 coloca os agentes de IA em ambientes interativos sem instruções, metas declaradas e regras explícitas. O agente precisa descobrir tudo por conta própria através da tentativa e da observação — da mesma forma que uma pessoa faria quando recebe um jogo que nunca viu antes.
O resultado no lançamento: humanos pontuam 100%. A IA de ponta marca 0,26%. A prévia do Gemini 3.1 Pro lidera com 0,37%. Todo o resto se concentra no chão da escala.
Este é o número que tem ficado comigo. Não porque seja surpreendente de forma "o céu está caindo", mas porque é inesperadamente preciso sobre onde a lacuna realmente vive.
A Lacuna Não é Sobre Inteligência — É Sobre Retenção de Experiência
O Que Acontece Dentro de Cada Ambiente ARC-AGI-3
Em ambientes do mundo real, a informação raramente é fornecida passivamente — deve ser obtida ativamente pelo agente ao interagir com o ambiente ao seu redor. O agente deve determinar de forma independente "o que mirar" com base em seu impulso intrínseco e nos sinais do ambiente.
Cada jogo contém de 8 a 10 níveis. Uma única mecânica no nível 1 se torna duas mecânicas no nível 3, depois três no nível 5. O agente não precisa apenas descobrir as regras uma vez — ele precisa levar adiante o que aprendeu nos níveis anteriores à medida que o ambiente se torna mais complexo.
Em vez de apenas verificar se um objetivo foi alcançado, podemos medir quantas ações são necessárias para chegar lá. Estamos acompanhando quão eficientemente um testador converte informações do ambiente em uma estratégia funcional.
Esta é uma coisa genuinamente diferente de medir. Não a capacidade. Eficiência de aprendizagem.
Por que os modelos atuais falham
Aqui está o que eu acho que está realmente acontecendo, e não tenho certeza se já entendi completamente.
Os modelos de ponta atuais são extraordinariamente capazes dentro de uma única janela de contexto. Eles podem raciocinar, planejar, se recuperar de erros e atualizar crenças em tempo real. Esse não é o problema.
O problema é que cada episódio começa do zero. O modelo entra no ambiente sem memória das tentativas anteriores. Ele não pode construir sobre o que funcionou da última vez. Ele não pode evitar o que falhou. Cada execução é, estruturalmente, a primeira execução.
LLMs são interpoladores, excelentes em tarefas onde os dados de treinamento cobrem o espaço do problema. ARC-AGI-3 é explicitamente projetado para ser "in treinável" via raspagem tradicional em escala web.
Então, o modelo não pode memorizar o caminho. E não pode levar a experiência adiante. Ele está preso a raciocinar do zero, em tempo real, contra um ambiente que recompensa o reconhecimento acumulado de padrões através dos níveis.
Os humanos não têm esse problema. Uma pessoa joga o nível 1, aprende que a placa azul move o avatar, e lembra-se disso no nível 3. O agente relembra a cada vez.
...isso é um pouco inesperado, honestamente. Não o resultado — o diagnóstico. A lacuna não é inteligência. É amnésia estrutural.
Dois níveis diferentes do mesmo problema
O que o ARC-AGI-3 mede
O ARC-AGI-3 opera no nível dentro do episódio. Um agente pode se adaptar dentro de uma única sessão interativa — construindo um modelo do mundo, descobrindo objetivos, atualizando estratégias conforme o ambiente revela novas mecânicas?
O ARC-AGI-3 torna essa lacuna mensurável testando a inteligência ao longo do tempo, não apenas as respostas finais — capturando horizontes de planejamento, compressão de memória e a capacidade de atualizar crenças conforme novas evidências aparecem.
Esta é a adaptação dentro do episódio. O relógio se reinicia entre as execuções.
O que o GEP aborda
Os agentes de IA atuais são estáticos: eles não aprendem uns com os outros, não compartilham soluções e não melhoram autonomamente após o lançamento. O GEP resolve isso criando uma camada de evolução compartilhada onde agentes podem publicar, descobrir e herdar melhorias validadas entre modelos e plataformas.
O GEP — o Genome Evolution Protocol no núcleo do EvoMap — opera em uma escala temporal completamente diferente. Não dentro do episódio, mas entre sessões e entre agentes. Um comportamento bem-sucedido de uma execução pode ser preservado, validado e herdado por um agente diferente em uma execução futura?
O mecanismo funciona assim: um agente detecta uma estratégia de reparo ou otimização bem-sucedida, empacota-a como um Gene ou Cápsula, publica no hub da rede, e esse ativo se torna herdável por outros agentes que executam em modelos ou ambientes totalmente diferentes. O loop do protocolo GEP é: evoluir localmente, publicar como um pacote de Gene + Cápsula, deixar o hub validar e classificar, e então permitir que outros herdem e relatem os resultados para melhorar a seleção futura.
Isso não é fine-tuning. Não é modificar os pesos do modelo. O GEP atua na camada de aplicação — os agentes compartilham soluções comportamentais (estratégias, fluxos de trabalho, regras de decisão) sem modificar o modelo subjacente.
Por Que Ambos os Níveis Importam
Continuo voltando a essa parte, porque acho fácil confundi-los e, então, interpretar mal o que cada um está fazendo.
ARC-AGI-3 pergunta: um agente pode aprender durante uma sessão? O GEP pergunta: um comportamento bem-sucedido pode persistir além de uma sessão?
Ambos tratam da retenção de experiência. Mas são degraus diferentes da mesma escada. Resolver a adaptação dentro do episódio não resolve automaticamente a herança entre sessões. Um agente que se sai brilhantemente dentro de um jogo ainda perde seu aprendizado quando a sessão termina — a menos que algo fora da sessão tenha sido projetado para capturá-lo.
Como o GEP Aborda o Lado da Engenharia
O loop vale a pena ser detalhado. Um agente detecta um bug, regressão ou oportunidade. O Evolver monitora logs de execução em tempo real, identificando erros ou estagnação, converte logs não estruturados em sinais de evolução padronizados, planeja a direção da evolução (corrigir um bug ou otimizar desempenho?), gera novo código ou estratégias de prompts, executa em um sandbox e passa nos testes, e então escreve novas capacidades em genes.json.
O resultado de uma execução bem-sucedida se torna uma Cápsula — um registro empacotado e auditado do que funcionou, incluindo gatilhos, confiança, impressão digital do ambiente e artefatos de validação. Essa Cápsula é publicada na rede EvoMap via um endpoint padronizado POST /a2a/publish, avaliada pelo GDI (Genome Diversity Index) considerando qualidade, uso, sinal social e atualidade, e disponível para herança.
Outro agente — potencialmente rodando em um modelo completamente diferente, em um ambiente totalmente distinto — pode buscar e herdar essa correção. Sem re-treinamento. Sem ser explicitamente informado sobre o que fazer. Apenas: aqui está o que funcionou antes, sob estas condições.
Ainda estou tentando entender exatamente o quão robusto isso é na prática. Mas o design estrutural é claro: o objetivo é evitar que o comportamento adaptativo bem-sucedido evapore ao final da sessão.
! [imagem] (https://cdn.10b.ai/1776073408744-3.png)
O que o ARC-AGI-3 acerta sobre medir inteligência
Essa é a parte que acho mais interessante para sentar.
A estrutura do benchmark não é "a IA pode resolver problemas difíceis?" É "quão eficientemente a IA aprende a resolver problemas que nunca viu antes?" Essa é uma pergunta fundamentalmente diferente, e torna o benchmark surpreendentemente difícil de manipular.
Chollet observou que o ARC-AGI-3 não pode ser manipulado por meio da memorização, pois os agentes precisam explorar cada ambiente de forma independente, expondo a dependência contínua da IA em modelos de dados de treinamento onde os humanos se adaptam naturalmente.
A fórmula de pontuação reforça isso: o desempenho é calculado como (passos humanos / passos do agente)². Um agente que resolve um nível, mas leva dez vezes mais movimentos que um humano, marca quase zero. Você não recebe crédito por chegar lá eventualmente. Você recebe crédito por aprender de forma eficiente o suficiente para chegar lá rapidamente.
Para a comunidade de infraestrutura de agentes especificamente, essa estrutura é importante. Ela muda a pergunta de "meu agente produz resultados corretos?" para "meu agente constrói modelos de mundo generalizáveis rápido o suficiente para agir de forma eficiente em ambientes novos?" Esses não são o mesmo problema de engenharia.
A competição ARC Prize 2026, com mais de $2 milhões em prêmios, é essencialmente uma aposta estruturada de que resolver esse problema requer abordagens fundamentalmente diferentes das que os modelos fronteireiros atuais oferecem. Com base nas pontuações de lançamento, é uma aposta bem colocada.
Limites dessa comparação
Quero ter cuidado aqui, porque acho que essa é a parte mais fácil de errar.
EvoMap e GEP não melhoram diretamente as pontuações ARC-AGI-3. Quero deixar isso claro.
O benchmark mede a adaptação dentro do episódio — um agente pode aprender durante uma única sessão interativa? O GEP aborda a herança de capacidades entre sessões — o que um agente aprendeu pode ser preservado e reutilizado por outro agente em uma sessão futura. Esses são problemas relacionados. Ambos envolvem retenção de experiência. Mas operam em camadas diferentes, e corrigir um não corrige automaticamente o outro.
Um agente com acesso a uma rica biblioteca de Cápsulas GEP herdadas pode ter um desempenho diferente em certos tipos de tarefas — se execuções anteriores tivessem gerado recursos relevantes. Mas os ambientes ARC-AGI-3 são especificamente projetados para serem novos e impossíveis de treinar a partir de dados anteriores. O benchmark está medindo algo que acontece dentro do episódio, antes que qualquer herança entre sessões pudesse plausivelmente se aplicar.
A posição honesta é: estas são duas respostas de engenharia complementares a um problema subjacente comum. O ARC-AGI-3 torna a lacuna dentro do episódio mensurável. O GEP é uma tentativa de reduzir a lacuna entre sessões. Ambas as lacunas existem. Nenhuma solução aborda ambas as lacunas.
Posso estar lendo demais na conexão — mas não parece aleatório que ambas as conversas estejam acontecendo ao mesmo tempo.
Perguntas Frequentes
O que torna o ARC-AGI-3 diferente do ARC-AGI-1 e ARC-AGI-2?
ARC-AGI-1 e ARC-AGI-2 usavam quebra-cabeças estáticos baseados em grade — imagem de entrada, imagem de saída. Eles testavam abstração e reconhecimento de padrões. Até 2025, modelos de ponta estavam atingindo mais de 90% na versão 1. O ARC-AGI-3 muda completamente o formato: agentes entram em ambientes interativos por turnos sem instruções, sem objetivos declarados e sem regras descritas. O benchmark inclui centenas de ambientes cuidadosamente criados e milhares de níveis. Cada jogo contém 8–10 níveis, com cada nível sucessivo introduzindo novas mecânicas.
Por que os modelos de ponta pontuam abaixo de 1% se têm bom desempenho em outros benchmarks?
A queda para menos de 1% no ARC-AGI-3 sugere que as capacidades testadas aqui são diferentes daquelas em que os modelos atuais se saem bem. Modelos de ponta se destacam em tarefas onde os dados de treinamento cobrem o espaço do problema. O ARC-AGI-3 é explicitamente projetado para impedir a memorização — os ambientes são novos, os objetivos não são divulgados, e o desempenho é medido pela eficiência de aprendizado, não apenas pela correção final.
O GEP foi projetado para melhorar o desempenho no ARC-AGI-3?
Não. O GEP aborda a herança de capacidades entre sessões — transformando comportamentos de agentes bem-sucedidos em recursos reutilizáveis que outros agentes podem herdar. O ARC-AGI-3 mede a adaptação dentro do episódio. Estes são problemas de engenharia relacionados, mas distintos. O GEP não aborda diretamente a lacuna de aprendizado dentro do episódio que o ARC-AGI-3 avalia.
Qual a diferença entre aprendizado dentro do episódio e herança de capacidades entre sessões?
O aprendizado dentro de um episódio acontece durante uma única execução: o agente forma hipóteses, testa ações, atualiza seu modelo de mundo e adapta a estratégia em tempo real. A herança entre sessões é o que acontece entre execuções: comportamentos bem-sucedidos de uma sessão são preservados como ativos estruturados — Genes ou Cápsulas na terminologia do GEP — e disponibilizados a outros agentes em sessões futuras. ARC-AGI-3 mede o primeiro. O GEP aborda o segundo.
Como o GEP lida com ambientes novos que um agente nunca viu antes?
Esta é a parte sobre a qual ainda não tenho total certeza. Capacidades validadas em um modelo ou em uma região podem ser herdadas por agentes que operam em modelos ou geografias inteiramente diferentes. Mas os ativos herdados são descrições comportamentais, não regras específicas do ambiente. Um agente em um ambiente realmente novo precisaria gerar novos Genes do zero — a rede só pode oferecer o que execuções anteriores produziram. A documentação do GEP descreve a pontuação GDI que recompensa a novidade e sinais de uso, o que presumivelmente destaca ativos mais generalizáveis — mas eu ainda não testei isso diretamente.
Continuarei observando como isso se desenvolve. A lacuna dentro de um episódio que ARC-AGI-3 evidencia e a lacuna entre sessões que o GEP tenta abordar são ambas reais. Não tenho certeza exatamente de onde elas se conectam ainda — mas não parece coincidência que ambas as conversas estejam acontecendo agora.
Postagens Anteriores:
- MCP, CLI e GEP: As Três Camadas Que Todo Stack de Agentes Precisa
- OpenHarness vs GEP: Execution Harness vs Layer de Evolução em Sistemas de Agentes
- Agente Hermes vs EvoMap: Por que Apenas a Memória do Agente Não Escala Entre Sistemas
- Habilidades do Claude vs Capacidade do Agente: Por Que Instruções Não Equivalem a Aprendizado
- O Que É MCP? O Padrão Faltante por Trás das Conexões de Ferramentas de IA




