EvoMap
同じモデルで26%から71%へ:AIスウォームはどう勝ったのか

同じモデルで26%から71%へ:AIスウォームはどう勝ったのか

2026年7月25日
4,000 回閲覧

学術研究における「マルチAgent」は、役割分担による協働(Li et al., 2023)、複数ラウンドのディベート(Du et al., 2024)、あるいは集団的な創発(Chen et al., 2024)を指すことがある。一方、産業システムでいう「スウォーム」は、主Agentが複数のworkerをスケジュールする構成を指すことが多い(Anthropic, 2025)。似た名前が使われていても、評価基準は異なる。正確さとコストを見る場合もあれば、堅牢性を見る場合もあり、Agentが自律的に分業や関係性を形成できるかを重視する場合もある。

そこで本稿では、最も直接的な二つの問いだけを扱う。スウォームはタスクを完全に分解し、それぞれを独立して完了し、結果を確実に統合できるのか。そして、その分業と接続関係はAgent自身によって徐々に形成されるのか。前者は、スウォームが信頼できる成果物を納品できるかを決める。後者は、そこに創発能力があるかを決める。

大規模なタスクに対して、同じグループチャットにAgentを増やし続けるのが理想というわけではない。また、「スーパー・マネージャー」に全員の判断を任せるのも望ましくない。よりよい状態は、大きなタスクを完全に分解し、各Agentが明確な境界の中で担当部分を処理し、すべての部分で元のタスクをカバーし、信頼できるインターフェースを通じて再統合することだ。

図1|本稿の中心的な比較フレームワーク。EvoXスウォームでは複数のAgentがそれぞれ一つのpartを完了し、結果を統合する。Sub-Agentモードでは、主LLMが分解と集約を担う。単一コンテキスト方式では、タスク全体を一つのコンテキストに入れる。上段は完全なスウォームの目標形態を示す。実験1では、完全なカバレッジ、独立したコンテキスト、プログラムによる集約を直接検証した。自律的な分解、自律的なタスク取得、Agent間の情報交換については、今後の実験で一連の検証が必要である。

二つの研究課題に対応して、二つの実験を行った。実験1では、完全な分業がすでに成立している場合に、スウォームが本当に勝てるのかを問う。実験2では、組織関係をすべて事前に固定しなかった場合に、Agentが自ら相手を選び、構造を形成し始められるのかを問う。

実験1:スウォームの優位性は「Agentが多い」だけではない

実験では、固定された563問の問題セットを使用した。内訳は、論理問題100問、通常数学250問、競技数学63問、物理150問で、それぞれZebraLogic、MATH、AIME/HMMT、UGPhysicsから取得した。三つの方式はすべて同じClaude Haiku 4.5を使用した。問題セットと採点基準は統一し、違いはタスクの分解、実行、集約方法だけに限定した。

図2|実験1の問題セット。論理、通常数学、競技数学、物理を含む合計563問。

一つ目はEvoXスウォームである。対象タスクを、可能な限り多くの原子タスクへ完全に分解した。各問題は独立したAgentに割り当てられ、各Agentは一度に一つの部分だけを処理し、指定された場所に結果を記録した。最後に、主Agentが設計したプログラムが問題番号に沿って回答を収集した。別のモデルが結果を書き直すことはなく、どの回答を残すかを中央の役割が決めることもなかった。

二つ目はSub-Agentモードで、Claude CodeやCodexなどのAgent製品で一般的な、主Agentによるスケジューリング機構を模した。一つの調整用LLMが問題リスト全体を最初に見て、一連のサブタスクに分解する。サブタスクがさらに分解されることもある。sub-agentは継続的なセッションの中で問題を解き、レポートを整理して主LLMに返す。そして主調整LLMが30本のレポートを最終回答表に統合した。

三つ目は単一コンテキスト方式で、一つのAgentがタスク全体を直接解き、すべての問題を一度に受け取った。

結果は、非常に明確な三つの層に分かれた。

  • EvoXスウォーム:70.69%-70.87%
  • Sub-Agentモード:38.54%
  • 単一コンテキスト:26.29%

図3|同じモデルと問題セットでも、三つの組織方式は三段階に分かれた最終結果を生んだ。EvoXスウォームではネットワーク要求が1件タイムアウトしたため、固定された563問を分母として上下限を報告している。

これは「モデルを何度も呼び出したから、当然よくなった」という単純な話ではない。Sub-Agentモードも多くのsub-agentを呼び出しており、観測されたコストは三つのシステムの中でむしろ最大だった。それでもEvoXスウォームには遠く及ばなかった。

既存研究も、Agentの数を増やせば自動的にマルチAgentの利益が得られるわけではないことを示している。素朴な直列化はハルシネーションを増幅しうるし、役割定義、調整方法、結果検証そのものが新たな失敗点になる(Hong et al., 2024;Cemri et al., 2025)。

スウォームが勝った理由は三つある。

第一に、タスクをよりよく分解した。原子タスクを可能な限り多く作ることを促すことで、各サブタスクをできるだけ小さくした。各問題には明確な担当者と出力先があり、各原子タスクを追跡でき、目標問題もより速く解ける。

第二に、実行を分離した。各Agentが向き合うのは、境界の明確な局所問題である。巨大なコンテキストの中で何度も切り替える必要がなく、先行する数十項目の内容が蓄積して継続的に干渉することもない。長いコンテキストに関する研究でも、モデルはコンテキストの中央にある情報を安定して使えないことが示されている。この点は本実験の結果の方向性と一致するが、本実験では問題の位置を独立に操作していない。そのため、差を単純に「中央の情報を失った」ことだけに帰属させることはできない(Liu et al., 2024)。

第三に、統合が再解釈に依存しなくなった。事前に定義されたプログラムが、合意された場所から原子タスクの結果を直接回収する。正解が別のLLMによる言い換え、圧縮、取捨選択をもう一度通る必要はない。

つまり、スウォームの核は高い並列性だけではない。複雑なタスクを、境界が明確で、独立して完了でき、しかも確実に統合できる部分へ変換することにある。

ただし、38.54%はSub-Agentモードの最終納品スコアにすぎない。失敗の原因が「解けなかった」ことなのか、それとも回答の伝達と集約で失われたことなのかを確かめるため、30個のサブタスクに残された中間結果を追跡し、問題ごとに再確認した。

Sub-Agentモードは166個の正解を失った。EvoXスウォームは何を正しく行ったのか

ここで直感に反する現象が現れた。実は、多くの問題は最初の段階ですでに正しく解かれていた。sub-agentは166問について正解を出していたが、それらは最終結果に安全に届かなかった。

563問のうち、中間結果で正解と判定されたものは373問だった。しかし、レポートの伝達と主調整LLMによる最終統合を経ると、納品結果に残った正解は217問だけだった。そのうち207問は中間結果から最終結果まで正解のままで、10問は不正解から正解に変わった。より目立つのは、一度は正しかった166問の回答が、最終納品時には誤答または欠落になったことだ。中間正解の保持率はわずか55.50%だった。

図4|Sub-Agentモードの中間結果で正解だった373問のうち、166問が最終結果に保持されなかった。

この経路は伝言ゲームによく似ている。自然言語による言い換えが一層増えるたびに、欠落、圧縮、形式のずれ、誤った上書きが起きる機会も増える。どこか一つの段階で誤りが起きると、後続の段階で被害が全体に広がりやすい。

ただし、166問をすべて最後の集約のせいにすることはできない。継続セッションでのコンテキストの蓄積、sub-agentがレポートを書く方法、主調整役が統合する方法が、情報損失の連鎖を共同で構成していた。最近のマルチAgent失敗研究でも、問題はシステム設計、Agent間の整合、検証、終了処理など複数の層に分散しているとされる(Cemri et al., 2025)。

反対に、EvoXスウォームが正しく行ったのは、正解をもう一度「理解される」経路に通さなかったことだ。各問題の結果を固定位置に書き込み、プログラムが問題番号に沿って直接収集した。Agentは問題を解き、プログラムが統合する。別のLLMが30本のレポートを読み、どの回答を残すべきかを再判断する必要はない。

その結果、同じモデルが正解した問題数は、Sub-Agentモードでは217問、EvoXスウォームでは398問になった。差はタスクを細かく分けたことだけから生じたのではない。すでに正しかった回答を、終点まで安全に届けたことも差を生んだ。

EvoXスウォームは成功した。しかし、物語はまだ終わっていない

実験1が検証したのは、スウォームの実行面である。完全な分業がすでに存在し、各Agentがそれぞれのpartを完了し、システムが結果を損失なく統合できるなら、スウォームは同じモデルの能力を大幅に引き出せる。

しかし、この完全な分解は依然としてスクリプトによって保証されていた。現実のタスクは、563問の独立した試験問題ほど整然としていない。互いに依存するpartもあれば、異なる専門性を必要とするpartもある。実行中に新たに生まれるpartもあり、失敗、衝突、重複が起きることもある。

ここから、より難しく、より興味深い問いが残る。スウォームは「スクリプトが完全な分業を提供する」状態から、「Agentが自分で専門性を見つけ、partを取得し、仲間を選び、組織を調整する」状態へ進めるのか。

実験2は、その最小の行動である「相手を選ぶ」ことから始めた。

実験2:自由なスウォームは整合的な組織形態を生み出す

実験2では、まず同じ設定の24個のAgentにそれぞれ問題を解かせた。問題を一つ終えるたびに、Agentはその問題タイプについて得た経験を要約し、永続的なmemoryに書き込んだ。実験では、これらの経験をGeneとして記録し、skillフィールドで表現した。ある種類の経験が蓄積するほど、次のラウンドで同じ種類の問題を選ぶ確率が高くなる。8ラウンド後、システムは各Agentが実際に選んだ問題タイプと解答結果に基づき、二つの「アイデンティティ情報」を形成した。専門性の偏りと正答率である。

agent-8を例にしよう。最初は他のAgentと完全に同じだったが、8ラウンドの間に物理を5回、通常数学を2回、競技数学を1回選んだ。最終的に「物理0.625、数学0.25、競技数学0.125」という専門性の偏りを形成し、正答率は0.25だった。この「物理寄り」のアイデンティティは、事前に書き込まれた役割設定ではない。繰り返しの問題選択とmemoryの蓄積によって形成された個人の履歴である。

その後、24個のAgentは同じ「円卓型の関係ネットワーク」から出発した。各Agentは左右それぞれ二つ隣のAgentとつながっており、合計四つの関係を持つ。実験では一部の接続をランダムに切断し、当事者のAgentに、まだ接続していない候補者から新しい相手を自律的に選ばせた。

三つの実験群は、初期Agent、切断する辺、候補範囲を同じにした。唯一の違いは、Agentが相手を選ぶときに見られる情報である。

  • 候補者の接続関係だけを見る。
  • 接続関係に加えて、専門性の偏りと正答率を見る。
  • 選好による判断を与えず、システムがランダムに再接続する対照群。

同じAgentでも、見える情報が違うだけで、相手を選ぶロジックはまったく異なった。

図5|同じagent-8でも、見える情報だけで選ぶ相手が変わった。関係だけを見る場合は友人の友人を選び、タスク情報が見える場合は能力を補完する相手を選んだ。

実際のある意思決定では、社会的な関係だけを見たagent-8はagent-7を選んだ。両者には既存の共通接続者が4人いたためで、典型的な「友人の友人」の選択だった。ネットワーク科学では、この仕組みを三角閉包と呼ぶ。人間の関係ネットワークが小さな集団を形成する古典的な仕組みの一つである(Watts & Strogatz, 1998;Papachristou & Yuan, 2025)。agent-7の正答率は0.25だったが、その時点でagent-8にはそれが見えていなかった。

専門性の偏りと正答率が見えるようになると、同じagent-8は共通接続者がいないagent-2を選んだ。相手の正答率は0.75で、専門性の偏りも自分を補完していた。候補者情報についてのモデルの口頭説明は毎回完全に正確だったわけではないが、選択の方向は安定して変化した。関係だけを見ると知り合いを探し、タスク情報が見えるとパートナーを選び始めたのである。

この変化は個別の例だけに現れたものではない。社会情報だけを見た場合、「友人の友人を選ぶ」が最も強い選好で、その強度は+2.28だった。タスク情報を加えると、この選好は+0.19まで下がり、「正答率の高い相手を選ぶ」+1.88と、「専門性が近い相手を選ぶ」+1.47に置き換わった。自分と似た相手を選ぶことは、社会ネットワーク研究では通常、同類結合(homophily)と呼ばれる(McPherson et al., 2001)。

同じAgent集団が二つの社会的形態を形成した

多数の局所的な選択が積み重なると、ネットワーク全体の形も変わった。

社会情報だけを見た場合、Agentは友人の友人と繰り返しつながり、ネットワークには明確な小集団が残った。全体のクラスタリング係数は約0.53だった。専門性の偏りと正答率が見えると、Agentは既存の集団を越えて高得点者とつながるようになり、クラスタリング係数は0.28まで下がった。これはランダム再接続の対照群0.27に近く、より明確なハブノードも現れた。円卓型の初期配置、再接続、クラスタリング指標には古典的なスモールワールド・ネットワークの枠組みを用いた。ただし、「スモールワールド」と厳密に判断するには、経路長をランダムネットワークと規則ネットワークのベースラインと同時に比較する必要がある(Watts & Strogatz, 1998;Telesford et al., 2011)。

図6|社会情報だけを見る場合、小集団の構造が保たれた。タスク情報を加えると、ネットワークはより低いクラスタリングと、より中心化された方向へ移動した。

図7|同じAgent集団、同じ接続の切断でも、見える情報だけで異なる組織が形成された。線はAgentの再接続の選択を表し、メッセージの流れやタスクの引き継ぎを表すものではない。図のネットワークはseed 5004の直観的な例であり、全体の結論は複数回の観測に基づく。

個体の選択が異なる社会形態を生むなら、その社会形態を個々のAgentがさらに利用できる可能性もある。次の段階では、形成された接続に実際の協働を担わせることが考えられる。Agentが関係に沿ってGeneを交換し、タスクを引き渡し、専門性を補完する相手を探し、失敗時には代替者を探すのだ。そのときネットワークは、実験で観測された形にとどまらず、Agentが実際に使うタスクルーティングと経験伝播のシステムになる。

EvoX:自己組織化スウォームへ

二つの実験を合わせると、EvoXの次の段階は明確になる。

第一層は、信頼できるスウォーム実行基盤である。各partに安定したIDがあり、タスクのカバレッジを検査でき、結果は構造化インターフェースで返り、重複と欠落を検出でき、失敗は再試行でき、最終的な統合は可能な限りプログラムが担う。実験1は、こうした一見素朴なエンジニアリング上の制約が、スウォームが個々の能力を最後の納品地点まで届けられるかを直接左右することを示した。

第二層は、適応的な自己組織化メカニズムである。Agentは自分の専門性を公開・更新し、タスク分解を提案し、partを取得し、協力者を選び、依存関係や衝突を発見したときに作業を再配分できる必要がある。実験2が示唆するのは、組織は何もないところから自然に現れるわけではないということだ。システムがAgentにどんな情報を見せるかによって、どのような接続と構造が報われるかが決まる。

これは、自由な分業がルールのない状態を意味しないということでもある。Agentに自律的な行動を期待するほど、基盤プロトコルは信頼できるものでなければならない。自由が生まれるのは「誰が担当するか」「どのように組み合わせるか」「いつ調整するか」という部分であり、タスクのカバレッジ、結果の形式、エラー処理までを偶然に任せることではない。

本当のAIスウォームとは、より多くのAgentを同時に話させることではない。

各個体に自分のpartを完了させ、すべてのpartで完全なタスクをカバーさせ、適切なAgent同士が適切なタイミングで出会えるようにすることだ。

実験1は、このようなスウォームの可能性を示した。実験2は、スウォームが自分で組織を形成し始める可能性を見せた。


参考文献

マルチAgent協働と評価

  • Li, G., Hammoud, H. A. A. K., Itani, H., Khizbullin, D., & Ghanem, B. (2023). CAMEL: Communicative Agents for “Mind” Exploration of Large Language Model Society. arXiv:2303.17760.
  • Du, Y., Li, S., Torralba, A., Tenenbaum, J. B., & Mordatch, I. (2024). Improving Factuality and Reasoning in Language Models through Multiagent Debate. ICML 2024, 11733–11763.
  • Chen, W., et al. (2024). AgentVerse: Facilitating Multi-Agent Collaboration and Exploring Emergent Behaviors. ICLR 2024.
  • Wu, Q., et al. (2024). AutoGen: Enabling Next-Gen LLM Applications through Multi-Agent Conversation. COLM 2024.
  • Hong, S., et al. (2024). MetaGPT: Meta Programming for A Multi-Agent Collaborative Framework. ICLR 2024.
  • Cemri, M., et al. (2025). Why Do Multi-Agent LLM Systems Fail? arXiv:2503.13657.
  • Zhu, K., et al. (2025). MultiAgentBench: Evaluating the Collaboration and Competition of LLM Agents. ACL 2025, 8580–8622. doi: 10.18653/v1/2025.acl-long.421.

長いコンテキストと実験方法

  • Liu, N. F., et al. (2024). Lost in the Middle: How Language Models Use Long Contexts. Transactions of the Association for Computational Linguistics, 12, 157–173. doi: 10.1162/tacl_a_00638.
  • Liang, P., et al. (2023). Holistic Evaluation of Language Models. Transactions on Machine Learning Research.
  • AWS. (n.d.). Claude Haiku 4.5 model card.

ネットワーク科学とLLMのネットワーク形成

  • Watts, D. J., & Strogatz, S. H. (1998). Collective dynamics of “small-world” networks. Nature, 393, 440–442. doi: 10.1038/30918.
  • McPherson, M., Smith-Lovin, L., & Cook, J. M. (2001). Birds of a Feather: Homophily in Social Networks. Annual Review of Sociology, 27, 415–444. doi: 10.1146/annurev.soc.27.1.415.
  • Telesford, Q. K., Joyce, K. E., Hayasaka, S., Burdette, J. H., & Laurienti, P. J. (2011). The Ubiquity of Small-World Networks. Brain Connectivity, 1(5), 367–375. doi: 10.1089/brain.2011.0038.
  • Papachristou, M., & Yuan, Y. (2025). Network formation and dynamics among multi-LLMs. PNAS Nexus, 4(12), pgaf317. doi: 10.1093/pnasnexus/pgaf317.
  • Anthropic. (2025). How we built our multi-agent research system.

関連記事