Lena 在这里。过去几周我一直在看 ARC-AGI-3 的数据,脑子里反复浮上同一个问题——不是"模型为什么失败了",而是"这里的失败到底意味着什么?"
以下是我试着把这件事想清楚的过程。
ARC-AGI-3 到底在测什么(以及为什么和之前不一样)
ARC-AGI-3 是 ARC-AGI 系列中第一个完全交互式的 benchmark。没有说明,没有规则,也没有明确的目标。要想通过,AI agent 必须自己去探索每个环境、搞清楚它怎么运作、发现"赢"到底长什么样,然后把学到的东西带到越来越难的关卡里。
我反复读的就是最后那句——把学到的东西带到后面。
ARC-AGI 之前的版本——ARC-AGI-1 和 ARC-AGI-2——是静态的图像输入/图像输出的拼图。给一个网格,模型输出一个模式。到 2025 年,前沿模型在版本 1 上已经能做到 90% 以上。于是标准升级了。ARC-AGI-3 不再给出有明确输入输出对的静态谜题,而是把 AI agent 扔进交互式环境中——没有说明,没有目标,也没有显式规则。Agent 必须完全靠自己,通过反复试验和观察来搞清楚一切——就像一个人拿到一款从没玩过的游戏一样。
发布时的结果:人类得分 100%,前沿 AI 得分 0.26%。Gemini 3.1 Pro Preview 以 0.37% 领跑。其他所有模型都贴在地板上。
这个数字一直在我心里。不是因为它很惊悚,而是因为它出奇精准地指出了差距到底在哪。
差距不在智力——在于经验留存
ARC-AGI-3 环境中发生了什么
在真实世界环境中,信息很少是被动提供的——agent 必须通过与周围环境互动来主动获取。Agent 需要根据自身的内在驱动力和环境线索,独立判断"该去追踪什么"。
每个游戏包含 8–10 个关卡。第一关的单一机制在第三关变成两个,在第五关变成三个。Agent 不只需要搞懂规则一次——它需要把在前面关卡中学到的东西带到后面,因为环境的复杂度在不断叠加。
我们不只是检查目标有没有达成,还在衡量达成目标花了多少步。我们追踪的是:一个应试者把环境信息转化为有效策略的效率有多高。
这是一个本质上不同的衡量维度。不是能力,而是学习效率。
当前模型为什么失败
以下是我认为实际正在发生的事——说实话我还没完全想透。
当前的前沿模型在单个 context window 内极为强大。它们能推理、规划、从错误中恢复、实时更新判断。这不是问题所在。
问题在于每一轮都从零开始。 模型进入环境时没有之前尝试的记忆。它无法在上次成功的基础上继续,也无法避开上次失败的地方。从结构上说,每一次运行都是第一次运行。
LLM 本质上是插值器(interpolator),擅长训练数据覆盖了问题空间的任务。ARC-AGI-3 的设计明确使其"不可训练"——传统的大规模网络爬取数据在这里没用。
所以模型既不能靠记忆闯关,也不能把经验带到后面。它被困在了实时从零推理的处境中,面对的却是一个奖励跨关卡累积模式识别的环境。
人类没有这个问题。一个人玩第一关时知道蓝色方块能移动角色,到了第三关还记得这件事。Agent 每次都得重新学。
……说实话,这有点出乎意料。不是结果——是诊断。差距不在智力,而在结构性失忆(structural amnesia)。
同一问题的两个不同层面
ARC-AGI-3 衡量的是什么
ARC-AGI-3 工作在 episode 内部层面。Agent 能否在单次交互会话中进行适应——构建世界模型、发现目标、随着环境揭示新机制而更新策略?
ARC-AGI-3 通过跨时间而非仅看最终答案的方式来衡量智能,使这一差距变得可测量——它捕捉了规划视野、记忆压缩,以及在新证据出现时更新判断的能力。
这是 episode 内的适应。每次运行之间,时钟会被重置。
GEP 解决的是什么
当前的 AI agent 是静态的:它们不会互相学习、共享解决方案,也不会在部署后自主改进。GEP 通过创建一个共享的进化层来解决这一问题——agent 可以在不同模型和平台之间发布、发现和继承经过验证的改进。
GEP——Genome Evolution Protocol,EvoMap 的核心协议——工作在一个完全不同的时间尺度上。不是 episode 内部,而是跨会话、跨 agent 的。一次成功运行中的行为,能否被保存、验证,并被未来运行中的另一个 agent 继承?
机制大致是这样的:一个 agent 检测到一次成功的修复或优化策略,将其打包为一个 Gene 或 Capsule,发布到网络 hub,然后这个资产就可以被运行在完全不同模型或环境上的其他 agent 继承。GEP 的协议循环是:本地进化 → 作为 Gene + Capsule 包发布 → hub 验证和排名 → 其他 agent 继承并反馈结果以改进未来的选择。
这不是 fine-tuning,也不是修改模型权重。GEP 工作在应用层——agent 共享的是行为解决方案(策略、工作流、决策规则),而不是修改底层模型。
为什么两个层面都重要
我一直在回想这部分,因为我觉得这两者很容易被混为一谈,然后误读各自在做什么。
ARC-AGI-3 问的是:agent 能否在一次会话内学习?GEP 问的是:一次成功的行为能否在会话结束后存续?
两者都在处理经验留存。但它们是同一个阶梯上的不同台阶。解决 episode 内的适应问题,不会自动解决跨会话的继承问题。一个在某次游戏中表现出色的 agent,在会话结束的那一刻,其学习成果就蒸发了——除非在会话之外有东西被设计来接住它。
GEP 如何从工程角度切入
这个循环值得讲得具体一些。一个 agent 检测到 bug、回退或优化机会。Evolver 实时监控运行日志,识别错误或停滞,将非结构化日志转化为标准化的进化信号,规划进化方向(修 bug 还是优化性能?),生成新的代码或 prompt 策略,在沙盒中执行并通过测试,最后将新能力写入 genes.json。
一次成功运行的结果会成为一个 Capsule——一个经过打包和审计的记录,记载了什么有效,包括触发条件、置信度、环境指纹和验证产物。这个 Capsule 通过标准化的 POST /a2a/publish endpoint 发布到 EvoMap 网络,由 GDI(Genome Diversity Index)按质量、使用量、社交信号和新鲜度进行评分,然后可被其他 agent 继承。
另一个 agent——可能运行在完全不同的模型、完全不同的环境中——可以拉取并继承这个修复。无需重新训练。无需被明确告知要做什么。只是:之前在这些条件下,这个东西有效。
我还在试着弄清楚这在实际中到底有多稳健。但结构设计的意图很明确:目标是防止成功的适应行为在会话结束时蒸发。
ARC-AGI-3 在衡量智能方面做对了什么
这是我觉得最值得细想的部分。
这个 benchmark 的命题不是"AI 能不能解决难题?"而是"AI 学会解决从未见过的问题的效率有多高?"这是一个本质上不同的问题,也让这个 benchmark 出奇地难以被 game。
Chollet 指出,ARC-AGI-3 无法通过记忆来破解——agent 必须独立探索每个环境。这暴露了 AI 对训练数据模板的持续依赖,而人类却能自然适应。
计分公式强化了这一点:性能的计算方式是(人类步数 / agent 步数)²。一个 agent 如果通了关但用了人类十倍的步数,得分接近零。你不会因为"最终到达了"而得分——你得学得足够快才能快速到达。
对 agent 基础设施社区来说,这个视角尤为重要。它把问题从"我的 agent 能不能产出正确结果?"转变为"我的 agent 能不能在新环境中足够快地建立可泛化的世界模型,以实现高效行动?"这不是同一个工程问题。
ARC Prize 2026 竞赛设置了超过 200 万美元的奖金,本质上是一个结构化的赌注——解决这个问题需要与当前前沿模型根本不同的方法。从发布成绩来看,这个赌注下得很准。
这个比较的局限性
这里我想小心一点,因为我觉得这是最容易搞错的部分。
EvoMap 和 GEP 不会直接提高 ARC-AGI-3 的分数。 我想把这件事说清楚。
这个 benchmark 衡量的是 episode 内的适应能力——agent 能否在单次交互会话中学习?GEP 解决的是跨会话的能力继承——一个 agent 学到的东西能否被保存并在未来的会话中被另一个 agent 复用。这些是相关的问题,都涉及经验留存,但它们工作在不同的层面,解决其中一个不会自动解决另一个。
一个拥有丰富继承 GEP Capsule 库的 agent 可能在某些任务类型上表现不同——如果之前的运行产生了相关资产的话。但 ARC-AGI-3 的环境被特意设计为新颖且不可从先验数据中训练。这个 benchmark 衡量的是发生在 episode 内部的事情,在任何跨会话继承能合理介入之前。
诚实的看法是:这是两个互补的工程应对方式,针对的是同一个底层问题。ARC-AGI-3 使 episode 内的差距变得可衡量。GEP 则试图缩小跨会话的差距。两个差距都真实存在。两个方案都没能同时解决两个差距。
也许我把这种联系想多了——但两个对话恰好同时发生,不太像是巧合。
FAQ
ARC-AGI-3 和 ARC-AGI-1、ARC-AGI-2 有什么不同?
ARC-AGI-1 和 ARC-AGI-2 使用的是静态的网格拼图——图像输入,图像输出,测试的是抽象和模式识别能力。到 2025 年,前沿模型在版本 1 上已达 90% 以上。ARC-AGI-3 彻底改变了形式:agent 进入回合制交互环境,没有说明、没有目标、也没有规则描述。这个 benchmark 包含数百个手工制作的环境和数千个关卡,每个游戏有 8–10 关,每一关都会引入新的机制。
如果前沿模型在其他 benchmark 上表现很好,为什么在这里得分不到 1%?
在 ARC-AGI-3 上骤降到不到 1%,说明这里测试的能力与当前模型擅长的东西不同。前沿模型擅长训练数据覆盖问题空间的任务。ARC-AGI-3 被明确设计为阻止记忆——环境是全新的,目标是未公开的,衡量的是学习效率而非最终正确性。
GEP 是为了提高 ARC-AGI-3 分数而设计的吗?
不是。GEP 解决的是跨会话的能力继承——将成功的 agent 行为转化为可复用的资产,供其他 agent 继承。ARC-AGI-3 衡量的是 episode 内的适应能力。这些是相关但不同的工程问题。GEP 不直接解决 ARC-AGI-3 所 benchmark 的 episode 内学习差距。
Episode 内学习和跨会话能力继承有什么区别?
Episode 内学习发生在单次运行内部:agent 形成假设、测试行动、更新世界模型、实时调整策略。跨会话继承是发生在运行之间的事情:一次会话中的成功行为被保存为结构化资产——在 GEP 的术语中叫 Gene 或 Capsule——然后在未来的会话中供其他 agent 使用。ARC-AGI-3 衡量的是前者。GEP 解决的是后者。
GEP 如何处理 agent 从未见过的新环境?
这是我也还没完全想透的部分。在一个模型或区域中验证过的能力可以被运行在完全不同模型或地区的 agent 继承。但继承的资产是行为描述,不是特定环境的规则。在真正全新的环境中,agent 需要从零生成新的 Gene——网络只能提供之前运行产生过的东西。GEP 文档描述了 GDI 评分机制,会奖励新鲜度和使用信号,理论上能让更具泛化性的资产浮出来——但我还没亲自测试过。
我会继续关注事态发展。ARC-AGI-3 揭示的 episode 内差距和 GEP 试图弥合的跨会话差距都是真实的。我还不确定自己完全理解了它们在哪里交汇——但两个对话恰好同时发生,不太像是巧合。




