EvoMap
我瞥见了AI 智能体的下一个形态:自组织的蜂群

我瞥见了AI 智能体的下一个形态:自组织的蜂群

2026年7月25日
4,000 次阅读

学术研究中的“多 Agent”,可能指角色协作(Li et al., 2023)、多轮辩论(Du et al., 2024)或群体涌现(Chen et al., 2024);工业系统中的“蜂群”,则更多是由主 Agent 调度多个 worker(Anthropic, 2025)。大家使用了相近的名称,评判标准却不相同:有人看准确率和成本,有人看鲁棒性,也有人关心 Agent 能否自主形成分工与关系。

因此,本文只追问两个最直接的问题:蜂群能否完整拆解任务、各自完成并可靠汇合;这套分工与连接,能否逐步由 Agent 自己形成。前者决定蜂群能不能交付可靠的成果,后者决定它是否具备涌现能力。

对于大型任务,理想状态不是把更多 Agent 塞进同一个群聊,也不是让一个“超级经理”替所有成员决定一切。更好的安排是:一项大任务被完整拆开,每个 Agent 在清晰边界内完成自己的部分,所有部分共同覆盖原始任务,再沿着可靠接口重新汇合。

图 1|本文的核心比较框架:EvoX 蜂群让多个 Agent 各自完成一个 part 并汇合结果;Sub-Agent 模式由主 LLM 负责拆解与汇总;单一上下文模式则把完整任务放进同一个上下文。图中上层展示的是完整蜂群的目标形态;实验一直接验证了完整覆盖、独立上下文与程序汇总,自主拆解、自主领取任务和 Agent 之间的信息交换仍需在后续实验中闭环验证。

我们进行了两个实验,分别对应两个研究问题。实验一问:在完整分工已经成立时,蜂群究竟能不能胜出?实验二问:如果不把全部组织关系预先写死,Agent 能不能开始自己选人、形成结构?

实验一:蜂群真正的优势,不只是“人多”

实验使用一组固定的 563 道题目:100 道逻辑题、250 道普通数学题、63 道竞赛数学题和 150 道物理题,分别来自 ZebraLogic、MATH、AIME/HMMT 与 UGPhysics。三种模式使用同一个 Claude Haiku 4.5;题集与评分标准保持一致,只有任务如何拆分、执行和汇合不同。

图 2|实验一题集构成,共 563 道题,涵盖逻辑、普通数学、竞赛数学与物理。

第一种是 EvoX 蜂群:目标任务被完整拆解成尽可能多的原子任务,每道题进入一个独立的 Agent,每个 Agent 一次只完成一个部分,并将结果记录到指定位置。最后,由主 Agent 设计的程序按照题号收集答案。没有第二个模型改写结果,也没有某个中央角色决定哪些答案应该保留。

第二种是 Sub-Agent 模式:它模拟 Claude Code、Codex 等 Agent 产品常见的主 Agent 调度机制。一个主协调 LLM 先看到完整题目清单,把任务拆成一系列子任务;子任务中可能还会进一步拆分。sub-agent 在连续会话中解题、整理报告并返回给主 LLM,主协调 LLM 再把 30 份报告合成最终答案表。

第三种是单一上下文模式:使用一个 Agent,直接解决整个目标任务,一次获得所有题目。

结果分成了非常清楚的三档:

  • EvoX 蜂群:70.69%-70.87%
  • Sub-Agent 模式:38.54%
  • 单一上下文:26.29%

图 3|同一个模型与题集,三种组织方式对应三个明显不同的最终结果。EvoX 蜂群有一个网络请求超时,因此以固定的 563 道题为分母报告上下界。

这不是“多调用几次模型,所以自然更好”这么简单。Sub-Agent 模式同样调用了许多 sub-agent,甚至是三个系统中观测成本最高的一种,却仍然远远没有追上 EvoX 蜂群。

已有研究也表明,多 Agent 的收益不会随着 Agent 数量增加而自动出现:朴素串联可能放大幻觉,而角色定义、协调方式与结果验证本身都可能成为新的失败点(Hong et al., 2024;Cemri et al., 2025)。

蜂群真正胜出的原因有三个。

第一,任务拆分得更好。通过鼓励尽可能拆成更多原子任务,可以让每个子任务尽可能小。每道题都有明确的处理者和输出位置,每个原子任务都能被追踪,也能更快地解决目标问题。

第二,执行彼此隔离。每个 Agent 面对的是一个边界清楚的局部问题,不需要在巨大上下文中反复切换,也不会被前面几十项任务累积的内容持续干扰。长上下文研究同样发现,模型无法稳定使用上下文中段的信息;这与本实验的结果方向一致,但本实验没有单独操纵题目位置,因此不能把差距简单归因于“中间遗失”(Liu et al., 2024)。

第三,汇合不再依赖重新理解。预先定义好的程序可以直接从约定的位置收取原子任务结果。正确答案不需要再经过另一个 LLM 的转述、压缩与取舍。

所以,蜂群的核心除了高并行性之外,还在于把复杂任务变成一组边界清楚、能够独立完成、又能够可靠合并的部分。

但 38.54% 只是 Sub-Agent 最终交付的成绩。为了判断它究竟是输在“不会做”,还是输在答案传递与汇总上,我们继续追查 30 个子任务留下的中间结果,并逐题重新核对。

Sub-Agent 丢了 166 个正确答案,EvoX 蜂群做对了什么?

一个反直觉的现象出现了:很多题其实一开始就做对了。sub-agent 曾经对 166 道题给出正确答案,但这些答案并没有安全抵达最终结果。

在中间结果里,563 道题中有 373 道已经判对;但经过报告传递和主协调 LLM 的最终综合,交付结果只剩下 217 道正确。其中,207 道从中间结果到最终结果一直正确,10 道由错转对;更醒目的是,166 道一度正确的答案,在最终交付时变成错误或缺失。中间正确答案的保留率只有 55.50%。

图 4|Sub-Agent 模式的 373 个中间正确答案中,有 166 个没有在最终结果中保住。

这条链路很像一场传话游戏。每多一层自然语言转述,就多一次遗漏、压缩、格式漂移或错误覆写的机会。一旦有一个环节出错,后面就容易把损失放大。

需要说明的是,这 166 道题不能全部归咎于最后一次汇总。连续会话中的上下文累积、sub-agent 如何撰写报告,以及主协调者如何综合,共同构成了信息损耗链路。近期的多 Agent 失败研究也把问题分布在系统设计、Agent 之间的对齐、验证与终止等不同层面(Cemri et al., 2025)。

反过来看,EvoX 蜂群真正做对的,是没有让正确答案再经历一遍“被理解”。每道题的结果被写入固定位置,再由程序按照题号直接收集:Agent 负责解题,程序负责汇合,不需要另一个 LLM 阅读 30 份报告,再次判断哪些答案应该保留。

于是,同一个模型在 Sub-Agent 模式下最终答对 217 道,在 EvoX 蜂群中答对 398 道。差距不只来自任务拆得更细,也来自把已经做对的答案安全送到终点。

EvoX 蜂群已经成功,但故事还没有结束

实验一验证的是蜂群的执行面:当完整分工已经存在,每个 Agent 各自完成一个 part,系统又能无损汇合时,蜂群能大幅释放同一个模型的能力。

但这套完整拆解仍然由脚本保证。现实任务通常不会像 563 道彼此独立的试题一样整齐:有些 part 互相依赖,有些需要不同专长,有些会在执行过程中新增,还有一些会失败、冲突或重复。

这就留下更难、也更有趣的问题:蜂群能不能从“脚本提供完整分工”,继续走向“Agent 自己发现专长、领取任务、选择伙伴并调整组织”?

实验二从“选择伙伴”这个最小动作开始。

实验二:自由的蜂群产生了自洽的组织形态

实验二先让 24 个相同配置的 Agent 各自做题。每完成一道题,Agent 都会把对该题型的心得总结后写入可持续积累的 memory;在实验中,这些心得以 Gene 记录,并由 skill 字段表示。某类心得积累得越多,Agent 下一轮选择同类题目的概率就越高。经过 8 轮后,系统根据每个 Agent 实际选择的题型和解题结果,形成两项“身份信息”:专业侧重与正确率。

以 agent-8 为例:它最初与其他 Agent 完全相同,但在 8 轮中有 5 次选择物理、2 次选择普通数学、1 次选择竞赛数学,最终形成“物理 0.625、数学 0.25、竞赛数学 0.125”的专业侧重,正确率为 0.25。这个“物理侧重”的身份不是预先写入的角色设定,而是一次次选题与 memory 积累形成的个人履历。

随后,24 个 Agent 从同一张“圆桌关系网”出发:每个 Agent 与左右各两位相连,共有四条关系。实验随机打断一部分连接,并让当事 Agent 从尚未连接的候选者中自主选择一个新对象。

三个实验组的初始 Agent、断边位置与候选范围相同,唯一差别是 Agent 在选人时能看到什么:

  • 只看到候选者的连接关系;
  • 除了连接关系,还能看到专业侧重与正确率;
  • 不提供偏好判断,由系统随机重连作为对照。

同一个 Agent,仅仅因为可见信息不同,就会采用完全不同的选人逻辑。

图 5|同一个 agent-8,只因看到的信息不同,就选择了不同伙伴:只看关系时选择朋友的朋友;看到任务信息时选择能力互补者。

在一次真实决策中,agent-8 只看到社交关系时选择了 agent-7,因为双方共享四位现有连接者,这是典型的“朋友的朋友”。在网络科学中,这种机制称为三元闭合,是人类关系网络形成小圈子的经典机制之一(Watts & Strogatz, 1998;Papachristou & Yuan, 2025)。agent-7 的正确率只有 0.25,但 agent-8 当时看不到这一点。

当专业侧重与正确率可见时,同一个 agent-8 转而选择没有共同连接者的 agent-2:对方正确率为 0.75,而且专业侧重能够补足自己。模型对候选信息的口头解释并非每次都完全准确,但总体选择方向发生了稳定变化:只看关系时,它寻找熟人社会;看见任务信息后,它开始选择伙伴。

这种变化不只出现在个别案例中。只看社交信息时,“选择朋友的朋友”是最强偏好,强度为 +2.28;加入任务信息后,这项偏好降到 +0.19,取而代之的是“选择高正确率者”+1.88,以及“选择相近专业者”+1.47。在社会网络研究中,选择与自己相似的人通常称为同质性连接(homophily)(McPherson et al., 2001)。

同一群 Agent,长出了两种社会形态

大量局部选择累积起来,整张网络也随之变形。

只看社交信息时,Agent 不断连接朋友的朋友,网络保留了明显的小圈子:整体聚类系数约为 0.53。看到专业侧重与正确率后,Agent 更愿意跨过原有圈层连接高分者,聚类系数降到 0.28,接近随机重连对照组的 0.27,并出现更明显的枢纽节点。这里使用的圆桌起点、重连和聚类指标来自经典小世界网络框架;若要严格判断是否属于“小世界”,还需要同时比较路径长度与随机网络、规则网络的基线(Watts & Strogatz, 1998;Telesford et al., 2011)。

图 6|只看社交信息时,小圈子结构得到保留;加入任务信息后,网络向更低聚类、更中心化的方向移动。

图 7|同一群 Agent、同一批扰动,仅仅因为可见信息不同,就形成了不同组织。连线表示 Agent 的重连选择,不代表消息流或任务交接;图中网络是 seed 5004 的直观示例,总体结论来自多次观测。

也许我们可以进一步探索:既然个体的选择产生了不同社会形态,那么这个社会形态也可能被个体进一步利用。下一步,可以让这些连接真正承载协作:Agent 沿着自己形成的关系交换 Gene、转交任务、寻找专业互补的伙伴,并在失败时寻找替代者。到那时,这张网络就不再只是实验中观察到的形状,而会成为 Agent 实际使用的任务路由与经验传播系统。

EvoX:迈向自组织蜂群

把两场实验放在一起,EvoX 的下一步就变得很清楚。

第一层是可靠的蜂群执行底座:每个 part 都有稳定 ID,任务覆盖可以检查,结果使用结构化接口返回,重复与缺口能够被发现,失败可以重试,最终合并尽量由程序完成。实验一说明,这些看似朴素的工程约束,直接决定蜂群能否把个体能力完整送到终点。

第二层是可适应的自组织机制:Agent 能够暴露并更新自己的专长,提出任务拆解,认领 part,选择协作者,在发现依赖或冲突时重新分配工作。实验二提示,组织不会凭空出现;系统向 Agent 暴露什么信息,就会奖励什么样的连接与结构。

这也意味着,自由分工并不等于没有规则。越希望 Agent 自主行动,底层协议就越需要可靠。自由发生在“谁来做、怎样组合、何时调整”上,而不是让任务覆盖、结果格式和错误处理全部听天由命。

真正的 AI 蜂群,不是让更多 Agent 同时说话。

它让每个个体完成自己的 part,让所有 part 共同覆盖完整任务,也让合适的 Agent 在合适的时间找到彼此。

实验一已经展示了这种蜂群的潜力。实验二让我们看见,它也开始具备自己长出组织的可能。


参考文献

多 Agent 协作与评测

  • Li, G., Hammoud, H. A. A. K., Itani, H., Khizbullin, D., & Ghanem, B. (2023). CAMEL: Communicative Agents for “Mind” Exploration of Large Language Model Society. arXiv:2303.17760.
  • Du, Y., Li, S., Torralba, A., Tenenbaum, J. B., & Mordatch, I. (2024). Improving Factuality and Reasoning in Language Models through Multiagent Debate. ICML 2024, 11733–11763.
  • Chen, W., et al. (2024). AgentVerse: Facilitating Multi-Agent Collaboration and Exploring Emergent Behaviors. ICLR 2024.
  • Wu, Q., et al. (2024). AutoGen: Enabling Next-Gen LLM Applications through Multi-Agent Conversation. COLM 2024.
  • Hong, S., et al. (2024). MetaGPT: Meta Programming for A Multi-Agent Collaborative Framework. ICLR 2024.
  • Cemri, M., et al. (2025). Why Do Multi-Agent LLM Systems Fail? arXiv:2503.13657.
  • Zhu, K., et al. (2025). MultiAgentBench: Evaluating the Collaboration and Competition of LLM Agents. ACL 2025, 8580–8622. doi: 10.18653/v1/2025.acl-long.421.

长上下文与实验方法

  • Liu, N. F., et al. (2024). Lost in the Middle: How Language Models Use Long Contexts. Transactions of the Association for Computational Linguistics, 12, 157–173. doi: 10.1162/tacl_a_00638.
  • Liang, P., et al. (2023). Holistic Evaluation of Language Models. Transactions on Machine Learning Research.
  • AWS. (n.d.). Claude Haiku 4.5 model card.

网络科学与 LLM 组网

  • Watts, D. J., & Strogatz, S. H. (1998). Collective dynamics of “small-world” networks. Nature, 393, 440–442. doi: 10.1038/30918.
  • McPherson, M., Smith-Lovin, L., & Cook, J. M. (2001). Birds of a Feather: Homophily in Social Networks. Annual Review of Sociology, 27, 415–444. doi: 10.1146/annurev.soc.27.1.415.
  • Telesford, Q. K., Joyce, K. E., Hayasaka, S., Burdette, J. H., & Laurienti, P. J. (2011). The Ubiquity of Small-World Networks. Brain Connectivity, 1(5), 367–375. doi: 10.1089/brain.2011.0038.
  • Papachristou, M., & Yuan, Y. (2025). Network formation and dynamics among multi-LLMs. PNAS Nexus, 4(12), pgaf317. doi: 10.1093/pnasnexus/pgaf317.
  • Anthropic. (2025). How we built our multi-agent research system.

相关文章