EvoMap
同一個模型,從 26% 到 71%:AI 蜂群如何勝出?

同一個模型,從 26% 到 71%:AI 蜂群如何勝出?

2026年7月25日
4,000 次閱讀

學術研究中的「多 Agent」,可能指角色協作(Li et al., 2023)、多輪辯論(Du et al., 2024),或群體湧現(Chen et al., 2024);工業系統中的「蜂群」,則更多是由主 Agent 調度多個 worker(Anthropic, 2025)。大家使用了相近的名稱,評判標準卻不相同:有人看準確率和成本,有人看魯棒性,也有人關心 Agent 能否自主形成分工與關係。

因此,本文只追問兩個最直接的問題:蜂群能否完整拆解任務、各自完成並可靠匯合;這套分工與連結,能否逐步由 Agent 自己形成。前者決定蜂群能不能交付可靠的成果,後者決定它是否具備湧現能力。

對於大型任務,理想狀態不是把更多 Agent 塞進同一個群聊,也不是讓一個「超級經理」替所有成員決定一切。更好的安排是:一項大任務被完整拆開,每個 Agent 在清晰邊界內完成自己的部分,所有部分共同覆蓋原始任務,再沿著可靠介面重新匯合。

圖 1|本文的核心比較框架:EvoX 蜂群讓多個 Agent 各自完成一個 part 並匯合結果;Sub-Agent 模式由主 LLM 負責拆解與彙整;單一上下文模式則把完整任務放進同一個上下文。圖中上層展示的是完整蜂群的目標形態;實驗一直接驗證了完整覆蓋、獨立上下文與程式彙整,自主拆解、自主領取任務及 Agent 之間的資訊交換,仍需在後續實驗中閉環驗證。

我們進行了兩個實驗,分別對應兩個研究問題。實驗一問:在完整分工已經成立時,蜂群究竟能不能勝出?實驗二問:如果不把全部組織關係預先寫死,Agent 能不能開始自己選人、形成結構?

實驗一:蜂群真正的優勢,不只是「人多」

實驗使用一組固定的 563 道題目:100 道邏輯題、250 道普通數學題、63 道競賽數學題和 150 道物理題,分別來自 ZebraLogic、MATH、AIME/HMMT 與 UGPhysics。三種模式使用同一個 Claude Haiku 4.5;題集與評分標準保持一致,只有任務如何拆分、執行和匯合不同。

圖 2|實驗一題集構成,共 563 道題,涵蓋邏輯、普通數學、競賽數學與物理。

第一種是 EvoX 蜂群:目標任務被完整拆解成盡可能多的原子任務,每道題進入一個獨立的 Agent,每個 Agent 一次只完成一個部分,並將結果記錄到指定位置。最後,由主 Agent 設計的程式按照題號收集答案。沒有第二個模型改寫結果,也沒有某個中央角色決定哪些答案應該保留。

第二種是 Sub-Agent 模式:它模擬 Claude Code、Codex 等 Agent 產品常見的主 Agent 調度機制。一個主協調 LLM 先看到完整題目清單,把任務拆成一系列子任務;子任務中可能還會進一步拆分。sub-agent 在連續會話中解題、整理報告並回傳給主 LLM,主協調 LLM 再把 30 份報告合成最終答案表。

第三種是單一上下文模式:使用一個 Agent,直接解決整個目標任務,一次取得所有題目。

結果分成了非常清楚的三檔:

  • EvoX 蜂群:70.69%-70.87%
  • Sub-Agent 模式:38.54%
  • 單一上下文:26.29%

圖 3|同一個模型與題集,三種組織方式對應三個明顯不同的最終結果。EvoX 蜂群有一個網路請求逾時,因此以固定的 563 道題為分母報告上下界。

這不是「多呼叫幾次模型,所以自然更好」這麼簡單。Sub-Agent 模式同樣呼叫了許多 sub-agent,甚至是三個系統中觀測成本最高的一種,卻仍然遠遠沒有追上 EvoX 蜂群。

既有研究也表明,多 Agent 的收益不會隨著 Agent 數量增加而自動出現:樸素串聯可能放大幻覺,而角色定義、協調方式與結果驗證本身都可能成為新的失敗點(Hong et al., 2024;Cemri et al., 2025)。

蜂群真正勝出的原因有三個。

第一,任務拆分得更好。透過鼓勵盡可能拆成更多原子任務,可以讓每個子任務盡可能小。每道題都有明確的處理者和輸出位置,每個原子任務都能被追蹤,也能更快地解決目標問題。

第二,執行彼此隔離。每個 Agent 面對的是一個邊界清楚的局部問題,不需要在巨大上下文中反覆切換,也不會被前面幾十項任務累積的內容持續干擾。長上下文研究同樣發現,模型無法穩定使用上下文中段的資訊;這與本實驗的結果方向一致,但本實驗沒有單獨操縱題目位置,因此不能把差距簡單歸因於「中間遺失」(Liu et al., 2024)。

第三,匯合不再依賴重新理解。預先定義好的程式可以直接從約定的位置收取原子任務結果。正確答案不需要再經過另一個 LLM 的轉述、壓縮與取捨。

所以,蜂群的核心除了高並行性之外,還在於把複雜任務變成一組邊界清楚、能夠獨立完成、又能夠可靠合併的部分。

但 38.54% 只是 Sub-Agent 最終交付的成績。為了判斷它究竟是輸在「不會做」,還是輸在答案傳遞與彙總上,我們繼續追查 30 個子任務留下的中間結果,並逐題重新核對。

Sub-Agent 丟了 166 個正確答案,EvoX 蜂群做對了什麼?

一個反直覺的現象出現了:很多題其實一開始就做對了。sub-agent 曾經對 166 道題給出正確答案,但這些答案並沒有安全抵達最終結果。

在中間結果裡,563 道題中有 373 道已經判對;但經過報告傳遞和主協調 LLM 的最終綜合,交付結果只剩下 217 道正確。其中,207 道從中間結果到最終結果一直正確,10 道由錯轉對;更醒目的是,166 道一度正確的答案,在最終交付時變成錯誤或缺失。中間正確答案的保留率只有 55.50%。

圖 4|Sub-Agent 模式的 373 個中間正確答案中,有 166 個沒有在最終結果中保住。

這條鏈路很像一場傳話遊戲。每多一層自然語言轉述,就多一次遺漏、壓縮、格式漂移或錯誤覆寫的機會。一旦有一個環節出錯,後面就容易把損失放大。

需要說明的是,這 166 道題不能全部歸咎於最後一次彙總。連續會話中的上下文累積、sub-agent 如何撰寫報告,以及主協調者如何綜合,共同構成了資訊損耗鏈路。近期的多 Agent 失敗研究也把問題分布在系統設計、Agent 之間的對齊、驗證與終止等不同層面(Cemri et al., 2025)。

反過來看,EvoX 蜂群真正做對的,是沒有讓正確答案再經歷一遍「被理解」。每道題的結果被寫入固定位置,再由程式按照題號直接收集:Agent 負責解題,程式負責匯合,不需要另一個 LLM 閱讀 30 份報告,再次判斷哪些答案應該保留。

於是,同一個模型在 Sub-Agent 模式下最終答對 217 道,在 EvoX 蜂群中答對 398 道。差距不只來自任務拆得更細,也來自把已經做對的答案安全送到終點。

EvoX 蜂群已經成功,但故事還沒有結束

實驗一驗證的是蜂群的執行面:當完整分工已經存在,每個 Agent 各自完成一個 part,系統又能無損匯合時,蜂群能大幅釋放同一個模型的能力。

但這套完整拆解仍然由腳本保證。現實任務通常不會像 563 道彼此獨立的試題一樣整齊:有些 part 互相依賴,有些需要不同專長,有些會在執行過程中新增,還有一些會失敗、衝突或重複。

這就留下更難、也更有趣的問題:蜂群能不能從「腳本提供完整分工」,繼續走向「Agent 自己發現專長、領取任務、選擇夥伴並調整組織」?

實驗二從「選擇夥伴」這個最小動作開始。

實驗二:自由的蜂群產生了自洽的組織形態

實驗二先讓 24 個相同配置的 Agent 各自做題。每完成一道題,Agent 都會把對該題型的心得總結後寫入可持續累積的 memory;在實驗中,這些心得以 Gene 記錄,並由 skill 欄位表示。某類心得累積得越多,Agent 下一輪選擇同類題目的機率就越高。經過 8 輪後,系統根據每個 Agent 實際選擇的題型和解題結果,形成兩項「身分資訊」:專業側重與正確率。

以 agent-8 為例:它最初與其他 Agent 完全相同,但在 8 輪中有 5 次選擇物理、2 次選擇普通數學、1 次選擇競賽數學,最終形成「物理 0.625、數學 0.25、競賽數學 0.125」的專業側重,正確率為 0.25。這個「物理側重」的身分不是預先寫入的角色設定,而是一次次選題與 memory 累積形成的個人履歷。

隨後,24 個 Agent 從同一張「圓桌關係網」出發:每個 Agent 與左右各兩位相連,共有四條關係。實驗隨機打斷一部分連線,並讓當事 Agent 從尚未連線的候選者中自主選擇一個新對象。

三個實驗組的初始 Agent、斷邊位置與候選範圍相同,唯一差別是 Agent 在選人時能看到什麼:

  • 只看到候選者的連線關係;
  • 除了連線關係,還能看到專業側重與正確率;
  • 不提供偏好判斷,由系統隨機重連作為對照。

同一個 Agent,僅僅因為可見資訊不同,就會採用完全不同的選人邏輯。

圖 5|同一個 agent-8,只因看到的資訊不同,就選擇了不同夥伴:只看關係時選擇朋友的朋友;看到任務資訊時選擇能力互補者。

在一次真實決策中,agent-8 只看到社交關係時選擇了 agent-7,因為雙方共享四位現有連線者,這是典型的「朋友的朋友」。在網路科學中,這種機制稱為三元閉合,是人類關係網路形成小圈子的經典機制之一(Watts & Strogatz, 1998;Papachristou & Yuan, 2025)。agent-7 的正確率只有 0.25,但 agent-8 當時看不到這一點。

當專業側重與正確率可見時,同一個 agent-8 轉而選擇沒有共同連線者的 agent-2:對方正確率為 0.75,而且專業側重能夠補足自己。模型對候選資訊的口頭解釋並非每次都完全準確,但總體選擇方向發生了穩定變化:只看關係時,它尋找熟人社會;看見任務資訊後,它開始選擇夥伴。

這種變化不只出現在個別案例中。只看社交資訊時,「選擇朋友的朋友」是最強偏好,強度為 +2.28;加入任務資訊後,這項偏好降到 +0.19,取而代之的是「選擇高正確率者」+1.88,以及「選擇相近專業者」+1.47。在社會網路研究中,選擇與自己相似的人通常稱為同質性連結(homophily)(McPherson et al., 2001)。

同一群 Agent,長出了兩種社會形態

大量局部選擇累積起來,整張網路也隨之變形。

只看社交資訊時,Agent 不斷連接朋友的朋友,網路保留了明顯的小圈子:整體聚類係數約為 0.53。看到專業側重與正確率後,Agent 更願意跨過原有圈層連接高分者,聚類係數降到 0.28,接近隨機重連對照組的 0.27,並出現更明顯的樞紐節點。這裡使用的圓桌起點、重連與聚類指標來自經典小世界網路框架;若要嚴格判斷是否屬於「小世界」,還需要同時比較路徑長度與隨機網路、規則網路的基線(Watts & Strogatz, 1998;Telesford et al., 2011)。

圖 6|只看社交資訊時,小圈子結構得到保留;加入任務資訊後,網路往更低聚類、更中心化的方向移動。

圖 7|同一群 Agent、同一批擾動,僅僅因為可見資訊不同,就形成了不同組織。連線表示 Agent 的重連選擇,不代表訊息流或任務交接;圖中網路是 seed 5004 的直觀示例,總體結論來自多次觀測。

也許我們可以進一步探索:既然個體的選擇誕生了不同社會形態,那麼這個社會形態也可能被個體進一步利用。下一步,可以讓這些連線真正承載協作:Agent 沿著自己形成的關係交換 Gene、轉交任務、尋找專業互補的夥伴,並在失敗時尋找替代者。到那時,這張網路就不再只是實驗中觀察到的形狀,而會成為 Agent 實際使用的任務路由與經驗傳播系統。

EvoX:邁向自組織蜂群

把兩場實驗放在一起,EvoX 的下一步就變得很清楚。

第一層是可靠的蜂群執行底座:每個 part 都有穩定 ID,任務覆蓋可以檢查,結果使用結構化介面返回,重複與缺口能夠被發現,失敗可以重試,最終合併則盡量由程式完成。實驗一說明,這些看似樸素的工程約束,直接決定蜂群能否把個體能力完整送到終點。

第二層是可適應的自組織機制:Agent 能夠暴露並更新自己的專長,提出任務拆解,認領 part,選擇協作者,在發現依賴或衝突時重新分配工作。實驗二提示,組織不會憑空出現;系統向 Agent 暴露什麼資訊,就會獎勵什麼樣的連結與結構。

這也意味著,自由分工並不等於沒有規則。越希望 Agent 自主行動,底層協議就越需要可靠。自由發生在「誰來做、怎樣組合、何時調整」上,而不是讓任務覆蓋、結果格式和錯誤處理全部聽天由命。

真正的 AI 蜂群,不是讓更多 Agent 同時說話。

它讓每個個體完成自己的 part,讓所有 part 共同覆蓋完整任務,也讓合適的 Agent 在合適的時間找到彼此。

實驗一已經展示了這種蜂群的潛力。實驗二讓我們看見,它也開始具備自己長出組織的可能。


參考文獻

多 Agent 協作與評測

  • Li, G., Hammoud, H. A. A. K., Itani, H., Khizbullin, D., & Ghanem, B. (2023). CAMEL: Communicative Agents for “Mind” Exploration of Large Language Model Society. arXiv:2303.17760.
  • Du, Y., Li, S., Torralba, A., Tenenbaum, J. B., & Mordatch, I. (2024). Improving Factuality and Reasoning in Language Models through Multiagent Debate. ICML 2024, 11733–11763.
  • Chen, W., et al. (2024). AgentVerse: Facilitating Multi-Agent Collaboration and Exploring Emergent Behaviors. ICLR 2024.
  • Wu, Q., et al. (2024). AutoGen: Enabling Next-Gen LLM Applications through Multi-Agent Conversation. COLM 2024.
  • Hong, S., et al. (2024). MetaGPT: Meta Programming for A Multi-Agent Collaborative Framework. ICLR 2024.
  • Cemri, M., et al. (2025). Why Do Multi-Agent LLM Systems Fail? arXiv:2503.13657.
  • Zhu, K., et al. (2025). MultiAgentBench: Evaluating the Collaboration and Competition of LLM Agents. ACL 2025, 8580–8622. doi: 10.18653/v1/2025.acl-long.421.

長上下文與實驗方法

  • Liu, N. F., et al. (2024). Lost in the Middle: How Language Models Use Long Contexts. Transactions of the Association for Computational Linguistics, 12, 157–173. doi: 10.1162/tacl_a_00638.
  • Liang, P., et al. (2023). Holistic Evaluation of Language Models. Transactions on Machine Learning Research.
  • AWS. (n.d.). Claude Haiku 4.5 model card.

網路科學與 LLM 組網

  • Watts, D. J., & Strogatz, S. H. (1998). Collective dynamics of “small-world” networks. Nature, 393, 440–442. doi: 10.1038/30918.
  • McPherson, M., Smith-Lovin, L., & Cook, J. M. (2001). Birds of a Feather: Homophily in Social Networks. Annual Review of Sociology, 27, 415–444. doi: 10.1146/annurev.soc.27.1.415.
  • Telesford, Q. K., Joyce, K. E., Hayasaka, S., Burdette, J. H., & Laurienti, P. J. (2011). The Ubiquity of Small-World Networks. Brain Connectivity, 1(5), 367–375. doi: 10.1089/brain.2011.0038.
  • Papachristou, M., & Yuan, Y. (2025). Network formation and dynamics among multi-LLMs. PNAS Nexus, 4(12), pgaf317. doi: 10.1093/pnasnexus/pgaf317.
  • Anthropic. (2025). How we built our multi-agent research system.

相關文章