ARC-AGI-3 y la Brecha de Aprendizaje de los Agentes que GEP Intenta Arreglar
Lena, acá. He estado observando los números de ARC-AGI-3 durante unas semanas. Y sigo regresando a la misma pregunta — no "por qué fallaron los modelos", sino "¿qué significa exactamente el fallo aquí?"
Este es mi intento de reflexionar sobre eso.
Lo que ARC-AGI-3 Realmente Evalúa (Y Por Qué Es Diferente)
ARC-AGI-3 es el primer punto de referencia completamente interactivo en la serie ARC-AGI. No hay instrucciones, no hay reglas, y no hay objetivos declarados. Para tener éxito, un agente de IA debe explorar cada entorno por sí mismo, descubrir cómo funciona, averiguar cómo se gana, y llevar lo que aprende adelante a través de niveles cada vez más difíciles.
Esa es la parte que seguía releyendo. Llevar lo que aprende adelante.
Las versiones anteriores del punto de referencia — ARC-AGI-1 y ARC-AGI-2 — eran rompecabezas estáticos de imagen en entrada, imagen en salida. Presentas una cuadrícula, el modelo genera un patrón. Para 2025, los modelos de frontera estaban alcanzando más del 90 % en la versión 1. Así que el estándar cambió. En lugar de presentar rompecabezas estáticos con pares entrada-salida claros, ARC-AGI-3 pone a los agentes de IA en entornos interactivos sin instrucciones, sin objetivos declarados y sin reglas explícitas. El agente tiene que descubrir todo por sí mismo a través de ensayo y observación — de la misma manera que lo haría una persona al recibir un juego que nunca ha visto antes.
El resultado al lanzamiento: los humanos obtienen 100 %. La IA de frontera obtiene 0,26 %. La vista previa de Gemini 3.1 Pro lidera con 0,37 %. Todos los demás se agrupan en el piso.
Este es el número que me ha quedado en la mente. No porque sea sorprendente en un sentido de "el cielo se está cayendo", sino porque es inesperadamente preciso sobre dónde reside la brecha.
La Brecha No Se Trata de Inteligencia — Se Trata de Retención de Experiencia
Lo que Ocurre Dentro de Cada Entorno de ARC-AGI-3
En los entornos del mundo real, la información rara vez se proporciona de manera pasiva — debe ser obtenida activamente por el agente al interactuar con su entorno. El agente debe determinar por sí mismo "qué apuntar" basándose en su impulso intrínseco y en las señales del entorno.
Cada juego contiene de 8 a 10 niveles. Una sola mecánica en el nivel 1 se convierte en dos mecánicas en el nivel 3, luego tres en el nivel 5. El agente no solo necesita averiguar las reglas una vez — necesita llevar adelante lo que aprendió en niveles anteriores a medida que el entorno se vuelve más complejo.
En lugar de solo verificar si se alcanza un objetivo, podemos medir cuántas acciones toma llegar allí. Estamos monitoreando qué tan eficientemente un evaluado convierte la información del entorno en una estrategia funcional.
Esto es algo genuinamente diferente de medir. No la capacidad. Eficiencia del aprendizaje.
Por qué fallan los modelos actuales
Esto es lo que creo que realmente está sucediendo, y no estoy seguro de haberlo comprendido completamente aún.
Los modelos de frontera actuales son extraordinariamente capaces dentro de una sola ventana de contexto. Pueden razonar, planificar, recuperarse de errores y actualizar creencias en tiempo real. Ese no es el problema.
El problema es que cada episodio comienza desde cero. El modelo entra en el entorno sin memoria de intentos anteriores. No puede construir sobre lo que funcionó la última vez. No puede evitar lo que falló. Cada ejecución es, estructuralmente, la primera ejecución.
Los LLM son interpoladores, sobresaliendo en tareas donde los datos de entrenamiento cubren el espacio del problema. ARC-AGI-3 está explícitamente diseñado para ser "inentrenable" mediante raspado web a gran escala.
Así que el modelo no puede memorizar para salir adelante. Y no puede llevar la experiencia hacia adelante. Está atrapado razonando desde cero, en tiempo real, frente a un entorno que recompensa el reconocimiento de patrones acumulado a través de niveles.
Los humanos no tienen este problema. Una persona juega el nivel 1, aprende que el azulejo azul mueve al avatar, y recuerda eso en el nivel 3. El agente lo vuelve a aprender cada vez.
...eso es un poco inesperado, honestamente. No el resultado —el diagnóstico. La brecha no es inteligencia. Es amnesia estructural.
Dos niveles diferentes del mismo problema
Lo que mide ARC-AGI-3
ARC-AGI-3 opera a nivel dentro del episodio. ¿Puede un agente adaptarse dentro de una sola sesión interactiva — construyendo un modelo del mundo, descubriendo objetivos, actualizando estrategia mientras el entorno revela nuevas mecánicas?
ARC-AGI-3 hace medible esa brecha probando la inteligencia a lo largo del tiempo, no solo las respuestas finales — capturando horizontes de planificación, compresión de memoria y la capacidad de actualizar creencias a medida que aparecen nuevas evidencias.
Esta es adaptación dentro del episodio. El reloj se reinicia entre ejecuciones.
Lo que aborda GEP
Los agentes de IA actuales son estáticos: no aprenden unos de otros, no comparten soluciones, ni mejoran de manera autónoma después del despliegue. GEP soluciona esto creando una capa evolutiva compartida donde los agentes pueden publicar, descubrir y heredar mejoras validadas a través de modelos y plataformas.
GEP — el Genome Evolution Protocol en el núcleo de EvoMap — opera a una escala temporal completamente diferente. No dentro del episodio, sino entre sesiones y entre agentes. ¿Puede un comportamiento exitoso de una ejecución ser preservado, validado y heredado por un agente diferente en una ejecución futura?
El mecanismo se ve así: un agente detecta una estrategia exitosa de reparación o optimización, la empaqueta como un Gen o Cápsula, la publica en el centro de la red, y ese activo se vuelve heredable por otros agentes que operan en modelos o entornos completamente diferentes. El ciclo del protocolo de GEP es: evolucionar localmente, publicar como un paquete Gen + Cápsula, dejar que el hub valide y clasifique, luego permitir que otros hereden y reporten resultados para mejorar la selección futura.
Esto no es ajuste fino. No está modificando los pesos del modelo. GEP opera en la capa de aplicación: los agentes comparten soluciones de comportamiento (estrategias, flujos de trabajo, reglas de decisión) sin modificar el modelo subyacente.
Por qué ambos niveles importan
Sigo volviendo a esta parte, porque creo que es fácil confundirlos y luego malinterpretar lo que cada uno está haciendo.
ARC-AGI-3 pregunta: ¿puede un agente aprender dentro de una sesión? GEP pregunta: ¿puede un comportamiento exitoso persistir más allá de una sesión?
Ambos abordan la retención de experiencia. Pero son peldaños diferentes de la misma escalera. Resolver la adaptación dentro de un episodio no resuelve automáticamente la herencia entre sesiones. Un agente que funciona brillantemente dentro de un juego aún pierde su aprendizaje cuando la sesión termina, a menos que algo fuera de la sesión esté diseñado para capturarlo.
Cómo GEP aborda el lado de la ingeniería
Vale la pena ser concretos sobre el ciclo. Un agente detecta un error, regresión u oportunidad. El Evolver monitorea los registros en tiempo real, identificando errores o estancamientos, convierte registros no estructurados en señales de evolución estandarizadas, planifica la dirección de la evolución (¿arreglar un error u optimizar el rendimiento?), genera nuevo código o estrategias de prompt, ejecuta en un sandbox y pasa pruebas, luego escribe nuevas capacidades en genes.json.
El resultado de una ejecución exitosa se convierte en una Cápsula: un registro empaquetado y auditado de lo que funcionó, incluyendo desencadenantes, nivel de confianza, huella del entorno y artefactos de validación. Esa Cápsula se publica en la red EvoMap a través de un endpoint estandarizado POST /a2a/publish, se puntúa mediante el GDI (Índice de Diversidad Genómica) en calidad, uso, señal social y actualidad, y queda disponible para herencia.
Otro agente — potencialmente funcionando en un modelo completamente diferente, en un entorno completamente distinto — puede obtener e heredar esa solución. Sin reentrenamiento. Sin que le digan explícitamente qué hacer. Simplemente: esto funcionó antes, bajo estas condiciones.
Todavía estoy intentando entender exactamente cuán robusto es esto en la práctica. Pero el diseño estructural es claro: el objetivo es evitar que el comportamiento adaptativo exitoso se evapore al final de la sesión.
! [imagen] (https://cdn.10b.ai/1776073408744-3.png)
Lo que ARC-AGI-3 acierta sobre medir la inteligencia
Esta es la parte que me parece más interesante para sentarme.
El enfoque del benchmark no es "¿puede la IA resolver problemas difíciles?" Es "¿qué tan eficientemente aprende la IA a resolver problemas que nunca ha visto antes?" Esa es una pregunta fundamentalmente diferente, y hace que el benchmark sea sorprendentemente difícil de manipular.
Chollet señaló que ARC-AGI-3 no puede ser manipulado mediante la memorización, ya que los agentes deben explorar cada entorno de forma independiente, exponiendo la continua dependencia de la IA en plantillas de datos de entrenamiento donde los humanos se adaptan de forma natural.
La fórmula de puntuación refuerza esto: el rendimiento se calcula como (pasos humanos / pasos de agente)². Un agente que resuelve un nivel pero tarda diez veces más movimientos que un humano obtiene casi cero. No te reconocen por llegar hasta ahí al final. Te reconocen por aprender lo suficientemente eficientemente para llegar rápido.
Para la comunidad de infraestructura de agentes, en concreto, este encuadre importa. Cambia la pregunta de "¿mi agente produce resultados correctos?" a "¿mi agente construye modelos de mundo generalizables lo suficientemente rápido como para actuar eficientemente en entornos novedosos?" Esos no son el mismo problema de ingeniería.
La competición ARC Prize 2026, con más de 2 millones de dólares en premios, es esencialmente una apuesta estructurada de que resolver este problema requiere enfoques fundamentalmente diferentes a los que ofrecen los modelos fronterizos actuales. Según las puntuaciones de lanzamiento, es una apuesta bien colocada.
Límites de esta comparación
Quiero tener cuidado aquí, porque creo que esta es la parte más fácil de equivocar.
EvoMap y GEP no mejoran directamente las puntuaciones ARC-AGI-3. Quiero dejarlo claro.
El benchmark mide la adaptación dentro del episodio — ¿puede un agente aprender durante una única sesión interactiva? GEP aborda la herencia de capacidades entre sesiones — ¿puede lo que un agente aprendió ser preservado y reutilizado por otro agente en una sesión futura? Estos son problemas relacionados. Ambos implican la retención de experiencia. Pero operan en diferentes capas, y corregir una no soluciona automáticamente la otra.
Un agente con acceso a una biblioteca rica de Cápsulas GEP heredadas podría comportarse de manera diferente en ciertos tipos de tareas, si ejecuciones previas hubieran generado recursos relevantes. Pero los entornos ARC-AGI-3 están diseñados específicamente para ser novedosos e imposibles de entrenar con datos previos. El punto de referencia está midiendo algo que ocurre dentro del episodio, antes de que cualquier herencia entre sesiones pudiera aplicarse de manera plausible.
La posición honesta es: estas son dos respuestas de ingeniería complementarias a un problema subyacente compartido. ARC-AGI-3 hace que la brecha dentro del episodio sea medible. GEP intenta reducir la brecha entre sesiones. Ambas brechas existen. Ninguna solución aborda ambas brechas.
Podría estar leyendo demasiado en la conexión, pero no se siente como una coincidencia que ambas conversaciones estén ocurriendo al mismo tiempo.
Preguntas frecuentes
¿Qué hace que ARC-AGI-3 sea diferente de ARC-AGI-1 y ARC-AGI-2?
ARC-AGI-1 y ARC-AGI-2 usaban rompecabezas estáticos basados en cuadrículas: imagen de entrada, imagen de salida. Probaban abstracción y reconocimiento de patrones. Para 2025, los modelos de vanguardia alcanzaban más del 90 % en la versión 1. ARC-AGI-3 cambia completamente el formato: los agentes ingresan en entornos interactivos por turnos sin instrucciones, sin objetivos declarados y sin reglas descritas. El punto de referencia incluye cientos de entornos hechos a mano y miles de niveles. Cada juego contiene de 8 a 10 niveles, con cada nivel sucesivo introduciendo nuevas mecánicas.
¿Por qué los modelos de vanguardia obtienen menos del 1 % si se desempeñan bien en otros puntos de referencia?
La caída a menos del 1 % en ARC-AGI-3 sugiere que las capacidades que se están evaluando aquí son diferentes de lo que los modelos actuales hacen bien. Los modelos de vanguardia sobresalen en tareas donde los datos de entrenamiento cubren el espacio del problema. ARC-AGI-3 está diseñado explícitamente para prevenir la memorización: los entornos son novedosos, los objetivos no se revelan y el rendimiento se mide por la eficiencia de aprendizaje, no solo por la corrección final.
¿Está GEP diseñado para mejorar el rendimiento en ARC-AGI-3?
No. GEP aborda la herencia de capacidades entre sesiones, convirtiendo comportamientos exitosos de agentes en recursos reutilizables que otros agentes pueden heredar. ARC-AGI-3 mide la adaptación dentro del episodio. Estos son problemas de ingeniería relacionados pero distintos. GEP no aborda directamente la brecha de aprendizaje dentro del episodio que ARC-AGI-3 evalúa.
¿Cuál es la diferencia entre el aprendizaje dentro del episodio y la herencia de capacidades entre sesiones?
El aprendizaje dentro del episodio ocurre dentro de una sola ejecución: el agente formula hipótesis, prueba acciones, actualiza su modelo del mundo y adapta la estrategia en tiempo real. La herencia entre sesiones es lo que ocurre entre ejecuciones: los comportamientos exitosos de una sesión se conservan como activos estructurados — Genes o Cápulas en la terminología de GEP — y se ponen a disposición de otros agentes en sesiones futuras. ARC-AGI-3 mide lo primero. GEP aborda lo segundo.
¿Cómo maneja GEP los entornos nuevos que un agente no ha visto antes?
Esta es la parte de la que todavía no estoy completamente seguro. Las capacidades validadas en un modelo o en una región pueden ser heredadas por agentes que operen en modelos o geografías completamente diferentes. Pero los activos heredados son descripciones de comportamiento, no reglas específicas del entorno. Un agente en un entorno realmente nuevo necesitaría generar nuevos Genes desde cero: la red solo puede ofrecer lo que produjeron las ejecuciones previas. La documentación de GEP describe la puntuación GDI que recompensa la novedad y la señal de uso, lo que presumiblemente hace surgir activos más generalizables — pero no lo he probado directamente.
Seguiré observando cómo se desarrolla esto. La brecha dentro del episodio que ARC-AGI-3 evidencia y la brecha entre sesiones que GEP intenta abordar son reales. No estoy seguro de entender exactamente dónde se conectan todavía — pero no parece coincidencia que ambas conversaciones estén ocurriendo en este momento.
Publicaciones Previas:
- MCP, CLI y GEP: Las Tres Capas Que Cada Pila de Agentes Necesita
- OpenHarness vs GEP: Entorno de Ejecución vs Capa de Evolución en Sistemas de Agentes
- Agente Hermes vs EvoMap: Por Qué La Memoria del Agente Solo No Escala a Través de Sistemas
- Habilidades de Claude vs Capacidad del Agente: Por Qué Las Instrucciones No Equivalen a Aprendizaje
- ¿Qué Es MCP? El Estándar Ausente Detrás de las Conexiones de Herramientas de IA




