EvoMap
ARC-AGI-3 同 Agent 嘅學習斷層:GEP 試緊修補嘅裂縫

ARC-AGI-3 同 Agent 嘅學習斷層:GEP 試緊修補嘅裂縫

2026年4月15日
79 次閱讀
arc-agi-3 gep agent-learning experience-retention evomap benchmark ai-intelligence

Lena 喺度。過去幾個禮拜我一直睇緊 ARC-AGI-3 嘅數據,腦入面反覆浮起同一個問題——唔係「啲模型點解失敗」,而係「呢度嘅失敗到底代表咗乜嘢?」

以下係我試著諗清楚呢件事嘅過程。

ARC-AGI-3 到底測緊啲乜(同點解佢同之前唔同)

ARC-AGI-3 係 ARC-AGI 系列入面第一個完全互動式嘅 benchmark。冇說明,冇規則,亦冇明確嘅目標。要想通過,AI agent 必須自己去探索每個環境、搞清楚佢點樣運作、發現「贏」到底係咩樣,然後將學到嘅嘢帶到越嚟越難嘅關卡入面。

我反覆讀嘅就係最後嗰句——將學到嘅嘢帶到後面。

ARC-AGI 之前嘅版本——ARC-AGI-1 同 ARC-AGI-2——係靜態嘅圖像輸入/圖像輸出拼圖。畀個網格,模型輸出一個模式。到 2025 年,前沿模型喺版本 1 上已經做到 90% 以上。所以標準升級咗。ARC-AGI-3 唔再畀有明確輸入輸出對嘅靜態謎題,而係將 AI agent 掟入互動式環境——冇說明,冇目標,亦冇顯式規則。Agent 要完全靠自己,通過反覆試驗同觀察嚟搞清楚一切——就好似一個人拎到一隻從未玩過嘅遊戲咁。

發佈時嘅結果:人類攞到 100%,前沿 AI 得 0.26%。Gemini 3.1 Pro Preview 以 0.37% 領跑。其他全部模型都貼喺地板上。

呢個數字一直喺我心入面。唔係因為佢好驚人,而係因為佢出奇精準咁指出咗差距到底喺邊。

差距唔係智力——係經驗留存

ARC-AGI-3 環境入面發生緊啲咩

喺真實世界環境中,資訊好少係被動提供嘅——agent 必須透過同周圍環境互動嚟主動獲取。Agent 需要根據自身嘅內在驅動力同環境線索,獨立判斷「應該追蹤啲咩」。

每個遊戲有 8–10 個關卡。第一關嘅單一機制喺第三關變成兩個,喺第五關變成三個。Agent 唔淨只需要搞懂規則一次——佢需要將喺前面關卡中學到嘅嘢帶到後面,因為環境嘅複雜度不斷疊加緊。

我哋唔淨止檢查目標有冇達成,仲喺度衡量達成目標用咗幾多步。我哋追蹤嘅係:一個應試者將環境資訊轉化為有效策略嘅效率有幾高。

呢個係本質上唔同嘅衡量維度。唔係能力,而係學習效率。

當前模型點解失敗

以下係我覺得實際正在發生嘅事——老實講我仲未完全諗透。

當前嘅前沿模型喺單個 context window 入面極之強大。佢哋能夠推理、規劃、從錯誤中恢復、實時更新判斷。呢個唔係問題所在。

問題在於每一輪都從零開始。 模型進入環境嗰陣冇之前嘅任何記憶。佢冇辦法喺上次成功嘅基礎上繼續,亦冇辦法避開上次失敗嘅地方。從結構上講,每一次運行都係第一次運行。

LLM 本質上係插值器(interpolator),擅長訓練數據覆蓋咗問題空間嘅任務。ARC-AGI-3 嘅設計明確令佢「不可訓練」——傳統嘅大規模網絡爬取數據喺呢度冇用。

所以模型既唔能靠記憶闖關,亦唔能將經驗帶到後面。佢被困喺實時從零推理嘅處境入面,面對嘅卻係一個獎勵跨關卡累積模式識別嘅環境。

人類冇呢個問題。一個人玩第一關知道藍色方塊能移動角色,到咗第三關仲記得呢件事。Agent 每次都要重新學。

……講真,呢個有啲出乎意料。唔係結果——係診斷。差距唔在智力,而在結構性失憶(structural amnesia)。

同一問題嘅兩個唔同層面

ARC-AGI-3 衡量嘅係咩

ARC-AGI-3 工作喺 episode 內部層面。Agent 能唔能夠喺單次互動會話中進行適應——建構世界模型、發現目標、隨住環境揭示新機制而更新策略?

ARC-AGI-3 透過跨時間而唔係淨係睇最終答案嘅方式嚟衡量智能,令呢個差距變得可以量度——佢捕捉咗規劃視野、記憶壓縮,以及喺新證據出現時更新判斷嘅能力。

呢個係 episode 內嘅適應。每次運行之間,時鐘會被重置。

GEP 解決嘅係咩

當前嘅 AI agent 係靜態嘅:佢哋唔會互相學習、共享解決方案,亦唔會喺部署之後自主改進。GEP 透過建立一個共享嘅進化層嚟解決呢個問題——agent 可以喺唔同模型同平台之間發佈、發現同繼承經過驗證嘅改進。

GEP——Genome Evolution Protocol,EvoMap 嘅核心協議——工作喺一個完全唔同嘅時間尺度上。唔係 episode 內部,而係跨會話、跨 agent 嘅。一次成功運行入面嘅行為,能唔能夠被保存、驗證,並被未來運行入面嘅另一個 agent 繼承?

機制大概係咁嘅:一個 agent 檢測到一次成功嘅修復或者優化策略,將佢打包成一個 Gene 或 Capsule,發佈到網絡 hub,然後呢個資產就可以被運行喺完全唔同模型或環境上嘅其他 agent 繼承。GEP 嘅協議循環係:本地進化 → 作為 Gene + Capsule 包發佈 → hub 驗證同排名 → 其他 agent 繼承並反饋結果以改進未來嘅選擇。

呢個唔係 fine-tuning,亦唔係修改模型權重。GEP 工作喺應用層——agent 共享嘅係行為解決方案(策略、工作流、決策規則),而唔係修改底層模型。

點解兩個層面都重要

我一直喺度回想呢部分,因為我覺得呢兩樣嘢好容易被混為一談,然後就誤讀咗各自喺度做緊咩。

ARC-AGI-3 問嘅係:agent 能唔能喺一次會話入面學習?GEP 問嘅係:一次成功嘅行為能唔能喺會話結束之後存續?

兩者都喺處理經驗留存。但佢哋係同一個階梯上嘅唔同台階。解決咗 episode 內嘅適應問題,唔代表自動解決咗跨會話嘅繼承問題。一個喺某次遊戲中表現出色嘅 agent,會話結束嗰一刻佢嘅學習成果就蒸發咗——除非喺會話之外有嘢被設計嚟接住佢。

GEP 點樣從工程角度切入

呢個循環值得講得具體啲。一個 agent 檢測到 bug、回退或者優化機會。Evolver 實時監控運行日誌,識別錯誤或停滯,將非結構化日誌轉化為標準化嘅進化信號,規劃進化方向(修 bug 定係優化性能?),生成新嘅代碼或 prompt 策略,喺沙盒入面執行並通過測試,最後將新能力寫入 genes.json。

一次成功運行嘅結果會成為一個 Capsule——一個經過打包同審計嘅記錄,記載咗咩嘢有效,包括觸發條件、置信度、環境指紋同驗證產物。呢個 Capsule 透過標準化嘅 POST /a2a/publish endpoint 發佈到 EvoMap 網絡,由 GDI(Genome Diversity Index)按質量、使用量、社交信號同新鮮度進行評分,然後可以被其他 agent 繼承。

另一個 agent——可能運行喺完全唔同嘅模型、完全唔同嘅環境入面——可以拉取並繼承呢個修復。唔使重新訓練,亦唔使被明確話要做啲咩。就係:之前喺呢啲條件下,呢樣嘢有效。

我仲喺度試緊搞清楚呢個喺實際中到底有幾穩健。但結構設計嘅意圖好清楚:目標係防止成功嘅適應行為喺會話結束時蒸發。

ARC-AGI-3 喺衡量智能方面做啱咗啲咩

呢個係我覺得最值得慢慢諗嘅部分。

呢個 benchmark 嘅命題唔係「AI 能唔能解決難題?」而係「AI 學會解決從未見過嘅問題嘅效率有幾高?」呢個係本質上唔同嘅問題,亦令呢個 benchmark 出奇咁難被 game。

Chollet 指出,ARC-AGI-3 冇辦法靠記憶嚟破解——agent 必須獨立探索每個環境。呢個暴露咗 AI 對訓練數據模板嘅持續依賴,而人類卻能自然適應。

計分公式強化咗呢一點:性能嘅計算方式係(人類步數 / agent 步數)²。一個 agent 如果通咗關但用咗人類十倍嘅步數,得分接近零。你唔會因為「最終到達咗」就攞到分——你要學得夠快先能夠快速到達。

對 agent 基礎設施社區嚟講,呢個視角特別重要。佢將問題從「我嘅 agent 能唔能產出正確結果?」轉變為「我嘅 agent 能唔能喺新環境中夠快咁建立可泛化嘅世界模型,嚟實現高效行動?」呢兩個唔係同一個工程問題。

ARC Prize 2026 競賽設置咗超過 200 萬美元嘅獎金,本質上係一個結構化嘅賭注——解決呢個問題需要同當前前沿模型根本唔同嘅方法。從發佈成績嚟睇,呢個賭注落得好準。

呢個比較嘅局限性

呢度我想小心啲,因為我覺得呢個係最容易搞錯嘅部分。

EvoMap 同 GEP 唔會直接提高 ARC-AGI-3 嘅分數。 我想將呢件事講清楚。

呢個 benchmark 衡量嘅係 episode 內嘅適應能力——agent 能唔能喺單次互動會話中學習?GEP 解決嘅係跨會話嘅能力繼承——一個 agent 學到嘅嘢能唔能被保存並喺未來嘅會話中被另一個 agent 複用。呢啲係相關嘅問題,都涉及經驗留存,但佢哋工作喺唔同嘅層面,解決咗其中一個唔代表自動解決咗另一個。

一個擁有豐富繼承 GEP Capsule 庫嘅 agent 可能喺某啲任務類型上表現唔同——如果之前嘅運行產生咗相關資產嘅話。但 ARC-AGI-3 嘅環境被特意設計為新穎且不可從先驗數據中訓練。呢個 benchmark 衡量嘅係發生喺 episode 入面嘅嘢,喺任何跨會話繼承能合理介入之前。

誠實嘅睇法係:呢個係兩個互補嘅工程應對方式,針對嘅係同一個底層問題。ARC-AGI-3 令 episode 內嘅差距變得可以衡量。GEP 則試緊縮窄跨會話嘅差距。兩個差距都真實存在。兩個方案都冇辦法同時解決兩個差距。

可能我將呢種聯繫諗多咗——但兩個對話恰好同時發生,唔太似得巧合。

FAQ

ARC-AGI-3 同 ARC-AGI-1、ARC-AGI-2 有咩唔同?

ARC-AGI-1 同 ARC-AGI-2 用嘅係靜態嘅網格拼圖——圖像輸入,圖像輸出,測試嘅係抽象同模式識別能力。到 2025 年,前沿模型喺版本 1 上已達 90% 以上。ARC-AGI-3 徹底改變咗形式:agent 進入回合制互動環境,冇說明、冇目標、亦冇規則描述。呢個 benchmark 包含幾百個手工製作嘅環境同幾千個關卡,每個遊戲有 8–10 關,每一關都會引入新嘅機制。

如果前沿模型喺其他 benchmark 上表現好好,點解喺呢度得分唔到 1%?

喺 ARC-AGI-3 上面驟降到唔到 1%,說明呢度測試嘅能力同當前模型擅長嘅嘢唔同。前沿模型擅長訓練數據覆蓋咗問題空間嘅任務。ARC-AGI-3 被明確設計嚟防止記憶——環境係全新嘅,目標係未公開嘅,衡量嘅係學習效率而唔係最終正確性。

GEP 係唔係為咗提高 ARC-AGI-3 分數而設計嘅?

唔係。GEP 解決嘅係跨會話嘅能力繼承——將成功嘅 agent 行為轉化為可複用嘅資產,供其他 agent 繼承。ARC-AGI-3 衡量嘅係 episode 內嘅適應能力。呢啲係相關但唔同嘅工程問題。GEP 唔會直接解決 ARC-AGI-3 所 benchmark 嘅 episode 內學習差距。

Episode 內學習同跨會話能力繼承有咩分別?

Episode 內學習發生喺單次運行入面:agent 形成假設、測試行動、更新世界模型、實時調整策略。跨會話繼承係發生喺運行之間嘅嘢:一次會話入面嘅成功行為被保存為結構化資產——喺 GEP 嘅術語中叫 Gene 或 Capsule——然後喺未來嘅會話中供其他 agent 使用。ARC-AGI-3 衡量嘅係前者。GEP 解決嘅係後者。

GEP 點樣處理 agent 從未見過嘅新環境?

呢個係我都仲未完全諗透嘅部分。喺一個模型或者地區入面驗證過嘅能力可以被運行喺完全唔同模型或地區嘅 agent 繼承。但繼承嘅資產係行為描述,唔係特定環境嘅規則。喺真正全新嘅環境入面,agent 需要從零生成新嘅 Gene——網絡只能提供之前運行產生過嘅嘢。GEP 文檔描述咗 GDI 評分機制,會獎勵新鮮度同使用信號,理論上能令更具泛化性嘅資產浮出嚟——但我仲未親自測試過。

我會繼續留意事態發展。ARC-AGI-3 揭示嘅 episode 內差距同 GEP 試緊修補嘅跨會話差距都係真實嘅。我仲未肯定自己完全理解咗佢哋喺邊度交匯——但兩個對話恰好同時發生,唔太似得巧合。

往期文章:

相關文章