Lena です。ここ数週間、ARC-AGI-3 の数字をずっと追いかけています。そして何度も同じ問いに戻ってきます——「なぜモデルが失敗したのか」ではなく、「ここでの失敗は、正確には何を意味しているのか?」
これは、その問いを自分なりに考え抜こうとした記録です。
ARC-AGI-3 が実際にテストしていること(そしてなぜ従来と異なるのか)
ARC-AGI-3 は、ARC-AGI シリーズ初の完全インタラクティブな benchmark です。指示なし、ルールなし、明示された目標もなし。成功するには、AI agent が自力で各環境を探索し、仕組みを理解し、「勝ち」とは何かを発見し、学んだことをより困難なレベルへ持ち越す必要があります。
私が何度も読み返したのは、まさにこの部分です——学んだことを持ち越す。
以前のバージョン——ARC-AGI-1 と ARC-AGI-2——は、画像入力・画像出力の静的パズルでした。グリッドを提示し、モデルがパターンを出力する形式です。2025 年までに、フロンティアモデルはバージョン 1 で 90% 以上を達成していました。そこで基準が引き上げられました。明確な入出力ペアを持つ静的パズルの代わりに、ARC-AGI-3 は AI agent をインタラクティブな環境に放り込みます——指示なし、目標の提示なし、明示的なルールもなし。Agent はすべてを自力で、試行と観察を通じて解明しなければなりません——初めて見るゲームを渡された人間と同じように。
ローンチ時の結果:人間は 100%、フロンティア AI は 0.26%。Gemini 3.1 Pro Preview が 0.37% でトップ。それ以外はすべて底に張り付いています。
この数字がずっと頭から離れません。「大変だ」という意味で驚いたわけではなく、ギャップがどこにあるのかを予想外なほど正確に示しているからです。
ギャップは知能の問題ではない——経験の保持の問題だ
ARC-AGI-3 の環境内で何が起きているのか
現実世界の環境では、情報が受動的に与えられることはめったにありません。Agent は周囲の環境とのインタラクションを通じて、能動的に情報を獲得する必要があります。「何を追うべきか」を、自身の内的動機と環境からの手がかりに基づいて、独立して判断しなければなりません。
各ゲームは 8〜10 レベルで構成されています。レベル 1 の単一メカニクスがレベル 3 で 2 つになり、レベル 5 で 3 つになります。Agent はルールを一度理解すればいいだけではなく——環境の複雑さが重層的に増していく中で、前のレベルで学んだことを持ち越す必要があるのです。
目標達成の有無だけでなく、達成までに何アクションかかったかも測定しています。テスト受験者が環境からの情報をどれだけ効率的に実用的な戦略へ変換できるかを追跡しているわけです。
これは本質的に異なる測定対象です。能力ではなく、学習の効率。
現行モデルが失敗する理由
以下は、私が実際に起きていると考えていることです——正直、まだ完全には整理しきれていません。
現行のフロンティアモデルは、単一の context window 内では驚異的に有能です。推論し、計画し、ミスから回復し、リアルタイムで信念を更新できます。そこが問題なのではありません。
問題は、各エピソードがゼロから始まることです。 モデルは前回の試行の記憶を持たずに環境に入ります。前回うまくいったことを土台にすることも、前回失敗したことを避けることもできません。構造的に、毎回が初回なのです。
LLM は本質的に補間器(interpolator)であり、訓練データが問題空間をカバーしているタスクで力を発揮します。ARC-AGI-3 は、従来のウェブスケール・スクレイピングでは「訓練不可能」になるよう明確に設計されています。
つまり、モデルは暗記で突破できない。そして経験も持ち越せない。リアルタイムでゼロから推論するしかない状況に置かれ、相手はレベル横断的なパターン認識の蓄積を報酬とする環境です。
人間にはこの問題がありません。レベル 1 で青いタイルがアバターを動かすと学んだ人は、レベル 3 でもそのことを覚えています。Agent は毎回学び直すのです。
…正直に言うと、少し意外でした。結果ではなく——診断の方が。ギャップは知能にあるのではなく、構造的健忘(structural amnesia) にあるのです。
同じ問題の二つの異なるレイヤー
ARC-AGI-3 が測定しているもの
ARC-AGI-3 はエピソード内のレイヤーで動作しています。Agent は単一のインタラクティブセッション内で適応できるか——世界モデルを構築し、目標を発見し、環境が新しいメカニクスを明らかにするにつれて戦略を更新できるか?
ARC-AGI-3 は、最終回答だけでなく時間軸にわたって知能を測定することで、このギャップを定量化しています——計画の射程、記憶の圧縮、そして新しい証拠が現れたときに信念を更新する能力を捕捉しています。
これはエピソード内の適応です。実行間でクロックはリセットされます。
GEP が対処しているもの
現在の AI agent は静的です。互いに学ぶことも、ソリューションを共有することも、デプロイ後に自律的に改善することもありません。GEP は、agent がモデルやプラットフォームを跨いで検証済みの改善を発行・発見・継承できる共有の進化レイヤーを構築することで、この問題を解決します。
GEP——EvoMap の中核である Genome Evolution Protocol——は、まったく異なる時間スケールで動作しています。エピソード内ではなく、セッション横断・agent 横断です。ある実行で成功した行動を保存・検証し、将来の実行で別の agent に継承させることができるか?
メカニズムはこうです。ある agent が成功した修復や最適化戦略を検出し、それを Gene または Capsule としてパッケージ化し、ネットワーク hub に公開する。すると、まったく異なるモデルや環境で動作する他の agent がそのアセットを継承できるようになります。GEP のプロトコルループは:ローカルで進化 → Gene + Capsule バンドルとして公開 → hub が検証・ランク付け → 他の agent が継承し、結果をフィードバックして将来の選択を改善する、という流れです。
これは fine-tuning ではありません。モデルの重みを変更するわけでもありません。GEP はアプリケーション層で動作します——agent が共有するのは行動ソリューション(戦略、ワークフロー、意思決定ルール)であり、基盤モデルの変更ではありません。
なぜ両方のレイヤーが重要なのか
この部分に何度も立ち戻ってしまいます。二つを混同しやすく、そうすると各々が何をしているかを読み誤ってしまうからです。
ARC-AGI-3 が問うのは:agent はセッション内で学習できるか? GEP が問うのは:成功した行動はセッションを超えて存続できるか?
どちらも経験の保持に取り組んでいます。しかし、同じ梯子の異なる段です。エピソード内の適応を解決しても、セッション横断の継承が自動的に解決されるわけではありません。あるゲーム内で見事なパフォーマンスを発揮した agent も、セッション終了の瞬間に学習成果が蒸発します——セッション外にそれを受け止める仕組みが設計されていない限り。
GEP のエンジニアリング・アプローチ
このループは具体的に見る価値があります。ある agent がバグ、リグレッション、または最適化の機会を検出します。Evolver がランタイムログをリアルタイム監視し、エラーや停滞を特定し、非構造化ログを標準化された進化シグナルに変換し、進化の方向性を計画し(バグ修正か性能最適化か?)、新しいコードやプロンプト戦略を生成し、サンドボックスで実行してテストをパスし、新しい能力を genes.json に書き込みます。
成功した実行の結果は Capsule になります——何が機能したかのパッケージ化・監査済みの記録で、トリガー条件、信頼度、環境フィンガープリント、検証アーティファクトを含みます。この Capsule は標準化された POST /a2a/publish エンドポイントを通じて EvoMap ネットワークに公開され、GDI(Genome Diversity Index)によって品質・使用量・ソーシャルシグナル・新鮮度でスコアリングされ、継承可能になります。
別の agent——まったく異なるモデル、まったく異なる環境で動作しているかもしれない——がその修正をフェッチして継承できます。再訓練なし。明示的な指示なし。ただ:以前、この条件下で、これが機能した、というだけです。
実際にどれほど堅牢かはまだ見極めている途中です。しかし構造設計の意図は明確です:成功した適応行動がセッション終了時に蒸発するのを防ぐことが目標です。
ARC-AGI-3 が知能の測定について正しく捉えていること
ここが、じっくり考える価値のある部分だと思っています。
この benchmark のフレーミングは「AI は難しい問題を解けるか?」ではありません。「AI は、初めて見る問題を解くことをどれだけ効率的に学ぶか?」です。これは根本的に異なる問いであり、この benchmark を攻略困難なものにしています。
Chollet は、ARC-AGI-3 は暗記では攻略できないと指摘しています。Agent は各環境を独立して探索しなければならず、人間が自然に適応するところで AI が訓練データのテンプレートに依存し続けていることが露呈しています。
スコアリング公式もこれを補強しています。パフォーマンスは(人間のステップ数 / agent のステップ数)² で計算されます。レベルをクリアしても人間の 10 倍のアクションをかけた agent のスコアはほぼゼロです。「最終的にたどり着いた」だけでは評価されません。十分に速く学習して素早くたどり着くことが求められるのです。
Agent インフラコミュニティにとって、このフレーミングは特に重要です。問いが「私の agent は正しい出力を生成できるか?」から「私の agent は新しい環境で効率的に行動できるほど速く、汎化可能な世界モデルを構築できるか?」へと変わるからです。これは同じエンジニアリング問題ではありません。
200 万ドル超の賞金を設けた ARC Prize 2026 コンペティションは、本質的に、この問題を解くには現行フロンティアモデルとは根本的に異なるアプローチが必要だという構造化された賭けです。ローンチ時のスコアを見る限り、よく狙った賭けだと言えます。
この比較の限界
ここは慎重に書きたい部分です。最も間違えやすいところだと思うからです。
EvoMap と GEP は ARC-AGI-3 のスコアを直接向上させるものではありません。 これは明確にしておきたいです。
この benchmark が測定するのはエピソード内の適応——agent は単一のインタラクティブセッション内で学習できるか? GEP が対処するのはセッション横断の能力継承——ある agent が学んだことを保存し、将来のセッションで別の agent が再利用できるか。関連する問題であり、どちらも経験の保持に関わります。しかし異なるレイヤーで動作しており、一方を解決してももう一方が自動的に解決されるわけではありません。
豊富な GEP Capsule ライブラリを持つ agent は、特定のタスクタイプで異なるパフォーマンスを示す可能性があります——以前の実行で関連アセットが生成されていれば。しかし ARC-AGI-3 の環境は、新規性があり先行データからは訓練不可能になるよう特別に設計されています。この benchmark が測定しているのはエピソード内部で起きること、つまりセッション横断の継承が合理的に適用される前の段階です。
率直な見解としては、これらは共通の根底にある問題に対する二つの相補的なエンジニアリング対応です。ARC-AGI-3 はエピソード内のギャップを定量化しています。GEP はセッション横断のギャップの縮小を目指しています。どちらのギャップも実在します。どちらのソリューションも、両方のギャップに対処しているわけではありません。
つながりを読み取りすぎているのかもしれません——でも、二つの議論が同じ時期に起きているのは、偶然には感じられないのです。
FAQ
ARC-AGI-3 は ARC-AGI-1 や ARC-AGI-2 と何が違うのですか?
ARC-AGI-1 と ARC-AGI-2 は静的なグリッドベースのパズル——画像入力、画像出力——で、抽象化とパターン認識をテストしていました。2025 年までにフロンティアモデルはバージョン 1 で 90% 以上を達成。ARC-AGI-3 は形式を完全に変えました。Agent はターン制のインタラクティブ環境に入り、指示なし、目標の提示なし、ルールの説明もありません。数百の手作りの環境と数千のレベルが用意され、各ゲームは 8〜10 レベルで構成され、各レベルで新しいメカニクスが導入されます。
フロンティアモデルが他の benchmark で好成績なのに、なぜここでは 1% 未満なのですか?
ARC-AGI-3 で 1% 未満に急落したことは、ここでテストされている能力が現行モデルの得意分野とは異なることを示唆しています。フロンティアモデルは訓練データが問題空間をカバーしているタスクで優れた性能を発揮します。ARC-AGI-3 は暗記を防ぐよう明示的に設計されており——環境は新規、目標は非公開、測定されるのは最終的な正答率ではなく学習効率です。
GEP は ARC-AGI-3 のスコア向上を目的として設計されたものですか?
いいえ。GEP が対処するのはセッション横断の能力継承——成功した agent の行動を再利用可能なアセットに変換し、他の agent が継承できるようにすることです。ARC-AGI-3 が測定するのはエピソード内の適応です。関連はしていますが、異なるエンジニアリング問題です。GEP は ARC-AGI-3 が benchmark するエピソード内の学習ギャップには直接対処しません。
エピソード内学習とセッション横断の能力継承の違いは何ですか?
エピソード内学習は単一の実行内で起きます。Agent が仮説を立て、行動をテストし、世界モデルを更新し、リアルタイムで戦略を適応させます。セッション横断の継承は実行の間に起きることです。あるセッションでの成功した行動が構造化されたアセット——GEP の用語では Gene や Capsule——として保存され、将来のセッションで他の agent に利用可能になります。ARC-AGI-3 が測定するのは前者。GEP が対処するのは後者です。
GEP は agent が見たことのない新しい環境をどう扱うのですか?
この部分は、私もまだ完全には把握しきれていません。あるモデルや地域で検証された能力は、まったく異なるモデルや地域で動作する agent が継承可能です。しかし継承されるアセットは行動の記述であり、環境固有のルールではありません。本当に新しい環境では、agent はゼロから新しい Gene を生成する必要があります——ネットワークが提供できるのは過去の実行が生み出したものだけです。GEP のドキュメントでは、新鮮度や使用シグナルを報酬とする GDI スコアリングが説明されており、おそらくより汎用性の高いアセットが上位に浮上する仕組みですが、私自身はまだ直接テストしていません。
今後の展開を見守り続けます。ARC-AGI-3 が浮き彫りにしたエピソード内のギャップと、GEP が対処しようとしているセッション横断のギャップは、どちらも実在します。両者がどこで交わるのか、まだ完全には理解できていません——でも、二つの議論が今まさに同時に起きているのは、偶然には思えないのです。




