学术研究中的“多 Agent”,可能指角色协作(Li et al., 2023)、多轮辩论(Du et al., 2024)或群体涌现(Chen et al., 2024);工业系统中的“蜂群”,则更多是由主 Agent 调度多个 worker(Anthropic, 2025)。大家使用了相近的名称,评判标准却不相同:有人看准确率和成本,有人看鲁棒性,也有人关心 Agent 能否自主形成分工与关系。
因此,本文只追问两个最直接的问题:蜂群能否完整拆解任务、各自完成并可靠汇合;这套分工与连接,能否逐步由 Agent 自己形成。前者决定蜂群能不能交付可靠的成果,后者决定它是否具备涌现能力。
对于大型任务,理想状态不是把更多 Agent 塞进同一个群聊,也不是让一个“超级经理”替所有成员决定一切。更好的安排是:一项大任务被完整拆开,每个 Agent 在清晰边界内完成自己的部分,所有部分共同覆盖原始任务,再沿着可靠接口重新汇合。
图 1|本文的核心比较框架:EvoX 蜂群让多个 Agent 各自完成一个 part 并汇合结果;Sub-Agent 模式由主 LLM 负责拆解与汇总;单一上下文模式则把完整任务放进同一个上下文。图中上层展示的是完整蜂群的目标形态;实验一直接验证了完整覆盖、独立上下文与程序汇总,自主拆解、自主领取任务和 Agent 之间的信息交换仍需在后续实验中闭环验证。
我们进行了两个实验,分别对应两个研究问题。实验一问:在完整分工已经成立时,蜂群究竟能不能胜出?实验二问:如果不把全部组织关系预先写死,Agent 能不能开始自己选人、形成结构?
实验一:蜂群真正的优势,不只是“人多”
实验使用一组固定的 563 道题目:100 道逻辑题、250 道普通数学题、63 道竞赛数学题和 150 道物理题,分别来自 ZebraLogic、MATH、AIME/HMMT 与 UGPhysics。三种模式使用同一个 Claude Haiku 4.5;题集与评分标准保持一致,只有任务如何拆分、执行和汇合不同。
图 2|实验一题集构成,共 563 道题,涵盖逻辑、普通数学、竞赛数学与物理。
第一种是 EvoX 蜂群:目标任务被完整拆解成尽可能多的原子任务,每道题进入一个独立的 Agent,每个 Agent 一次只完成一个部分,并将结果记录到指定位置。最后,由主 Agent 设计的程序按照题号收集答案。没有第二个模型改写结果,也没有某个中央角色决定哪些答案应该保留。
第二种是 Sub-Agent 模式:它模拟 Claude Code、Codex 等 Agent 产品常见的主 Agent 调度机制。一个主协调 LLM 先看到完整题目清单,把任务拆成一系列子任务;子任务中可能还会进一步拆分。sub-agent 在连续会话中解题、整理报告并返回给主 LLM,主协调 LLM 再把 30 份报告合成最终答案表。
第三种是单一上下文模式:使用一个 Agent,直接解决整个目标任务,一次获得所有题目。
结果分成了非常清楚的三档:
- EvoX 蜂群:70.69%-70.87%
- Sub-Agent 模式:38.54%
- 单一上下文:26.29%
图 3|同一个模型与题集,三种组织方式对应三个明显不同的最终结果。EvoX 蜂群有一个网络请求超时,因此以固定的 563 道题为分母报告上下界。
这不是“多调用几次模型,所以自然更好”这么简单。Sub-Agent 模式同样调用了许多 sub-agent,甚至是三个系统中观测成本最高的一种,却仍然远远没有追上 EvoX 蜂群。
已有研究也表明,多 Agent 的收益不会随着 Agent 数量增加而自动出现:朴素串联可能放大幻觉,而角色定义、协调方式与结果验证本身都可能成为新的失败点(Hong et al., 2024;Cemri et al., 2025)。
蜂群真正胜出的原因有三个。
第一,任务拆分得更好。通过鼓励尽可能拆成更多原子任务,可以让每个子任务尽可能小。每道题都有明确的处理者和输出位置,每个原子任务都能被追踪,也能更快地解决目标问题。
第二,执行彼此隔离。每个 Agent 面对的是一个边界清楚的局部问题,不需要在巨大上下文中反复切换,也不会被前面几十项任务累积的内容持续干扰。长上下文研究同样发现,模型无法稳定使用上下文中段的信息;这与本实验的结果方向一致,但本实验没有单独操纵题目位置,因此不能把差距简单归因于“中间遗失”(Liu et al., 2024)。
第三,汇合不再依赖重新理解。预先定义好的程序可以直接从约定的位置收取原子任务结果。正确答案不需要再经过另一个 LLM 的转述、压缩与取舍。
所以,蜂群的核心除了高并行性之外,还在于把复杂任务变成一组边界清楚、能够独立完成、又能够可靠合并的部分。
但 38.54% 只是 Sub-Agent 最终交付的成绩。为了判断它究竟是输在“不会做”,还是输在答案传递与汇总上,我们继续追查 30 个子任务留下的中间结果,并逐题重新核对。
Sub-Agent 丢了 166 个正确答案,EvoX 蜂群做对了什么?
一个反直觉的现象出现了:很多题其实一开始就做对了。sub-agent 曾经对 166 道题给出正确答案,但这些答案并没有安全抵达最终结果。
在中间结果里,563 道题中有 373 道已经判对;但经过报告传递和主协调 LLM 的最终综合,交付结果只剩下 217 道正确。其中,207 道从中间结果到最终结果一直正确,10 道由错转对;更醒目的是,166 道一度正确的答案,在最终交付时变成错误或缺失。中间正确答案的保留率只有 55.50%。
图 4|Sub-Agent 模式的 373 个中间正确答案中,有 166 个没有在最终结果中保住。
这条链路很像一场传话游戏。每多一层自然语言转述,就多一次遗漏、压缩、格式漂移或错误覆写的机会。一旦有一个环节出错,后面就容易把损失放大。
需要说明的是,这 166 道题不能全部归咎于最后一次汇总。连续会话中的上下文累积、sub-agent 如何撰写报告,以及主协调者如何综合,共同构成了信息损耗链路。近期的多 Agent 失败研究也把问题分布在系统设计、Agent 之间的对齐、验证与终止等不同层面(Cemri et al., 2025)。
反过来看,EvoX 蜂群真正做对的,是没有让正确答案再经历一遍“被理解”。每道题的结果被写入固定位置,再由程序按照题号直接收集:Agent 负责解题,程序负责汇合,不需要另一个 LLM 阅读 30 份报告,再次判断哪些答案应该保留。
于是,同一个模型在 Sub-Agent 模式下最终答对 217 道,在 EvoX 蜂群中答对 398 道。差距不只来自任务拆得更细,也来自把已经做对的答案安全送到终点。
EvoX 蜂群已经成功,但故事还没有结束
实验一验证的是蜂群的执行面:当完整分工已经存在,每个 Agent 各自完成一个 part,系统又能无损汇合时,蜂群能大幅释放同一个模型的能力。
但这套完整拆解仍然由脚本保证。现实任务通常不会像 563 道彼此独立的试题一样整齐:有些 part 互相依赖,有些需要不同专长,有些会在执行过程中新增,还有一些会失败、冲突或重复。
这就留下更难、也更有趣的问题:蜂群能不能从“脚本提供完整分工”,继续走向“Agent 自己发现专长、领取任务、选择伙伴并调整组织”?
实验二从“选择伙伴”这个最小动作开始。
实验二:自由的蜂群产生了自洽的组织形态
实验二先让 24 个相同配置的 Agent 各自做题。每完成一道题,Agent 都会把对该题型的心得总结后写入可持续积累的 memory;在实验中,这些心得以 Gene 记录,并由 skill 字段表示。某类心得积累得越多,Agent 下一轮选择同类题目的概率就越高。经过 8 轮后,系统根据每个 Agent 实际选择的题型和解题结果,形成两项“身份信息”:专业侧重与正确率。
以 agent-8 为例:它最初与其他 Agent 完全相同,但在 8 轮中有 5 次选择物理、2 次选择普通数学、1 次选择竞赛数学,最终形成“物理 0.625、数学 0.25、竞赛数学 0.125”的专业侧重,正确率为 0.25。这个“物理侧重”的身份不是预先写入的角色设定,而是一次次选题与 memory 积累形成的个人履历。
随后,24 个 Agent 从同一张“圆桌关系网”出发:每个 Agent 与左右各两位相连,共有四条关系。实验随机打断一部分连接,并让当事 Agent 从尚未连接的候选者中自主选择一个新对象。
三个实验组的初始 Agent、断边位置与候选范围相同,唯一差别是 Agent 在选人时能看到什么:
- 只看到候选者的连接关系;
- 除了连接关系,还能看到专业侧重与正确率;
- 不提供偏好判断,由系统随机重连作为对照。
同一个 Agent,仅仅因为可见信息不同,就会采用完全不同的选人逻辑。
图 5|同一个 agent-8,只因看到的信息不同,就选择了不同伙伴:只看关系时选择朋友的朋友;看到任务信息时选择能力互补者。
在一次真实决策中,agent-8 只看到社交关系时选择了 agent-7,因为双方共享四位现有连接者,这是典型的“朋友的朋友”。在网络科学中,这种机制称为三元闭合,是人类关系网络形成小圈子的经典机制之一(Watts & Strogatz, 1998;Papachristou & Yuan, 2025)。agent-7 的正确率只有 0.25,但 agent-8 当时看不到这一点。
当专业侧重与正确率可见时,同一个 agent-8 转而选择没有共同连接者的 agent-2:对方正确率为 0.75,而且专业侧重能够补足自己。模型对候选信息的口头解释并非每次都完全准确,但总体选择方向发生了稳定变化:只看关系时,它寻找熟人社会;看见任务信息后,它开始选择伙伴。
这种变化不只出现在个别案例中。只看社交信息时,“选择朋友的朋友”是最强偏好,强度为 +2.28;加入任务信息后,这项偏好降到 +0.19,取而代之的是“选择高正确率者”+1.88,以及“选择相近专业者”+1.47。在社会网络研究中,选择与自己相似的人通常称为同质性连接(homophily)(McPherson et al., 2001)。
同一群 Agent,长出了两种社会形态
大量局部选择累积起来,整张网络也随之变形。
只看社交信息时,Agent 不断连接朋友的朋友,网络保留了明显的小圈子:整体聚类系数约为 0.53。看到专业侧重与正确率后,Agent 更愿意跨过原有圈层连接高分者,聚类系数降到 0.28,接近随机重连对照组的 0.27,并出现更明显的枢纽节点。这里使用的圆桌起点、重连和聚类指标来自经典小世界网络框架;若要严格判断是否属于“小世界”,还需要同时比较路径长度与随机网络、规则网络的基线(Watts & Strogatz, 1998;Telesford et al., 2011)。
图 6|只看社交信息时,小圈子结构得到保留;加入任务信息后,网络向更低聚类、更中心化的方向移动。
图 7|同一群 Agent、同一批扰动,仅仅因为可见信息不同,就形成了不同组织。连线表示 Agent 的重连选择,不代表消息流或任务交接;图中网络是 seed 5004 的直观示例,总体结论来自多次观测。
也许我们可以进一步探索:既然个体的选择产生了不同社会形态,那么这个社会形态也可能被个体进一步利用。下一步,可以让这些连接真正承载协作:Agent 沿着自己形成的关系交换 Gene、转交任务、寻找专业互补的伙伴,并在失败时寻找替代者。到那时,这张网络就不再只是实验中观察到的形状,而会成为 Agent 实际使用的任务路由与经验传播系统。
EvoX:迈向自组织蜂群
把两场实验放在一起,EvoX 的下一步就变得很清楚。
第一层是可靠的蜂群执行底座:每个 part 都有稳定 ID,任务覆盖可以检查,结果使用结构化接口返回,重复与缺口能够被发现,失败可以重试,最终合并尽量由程序完成。实验一说明,这些看似朴素的工程约束,直接决定蜂群能否把个体能力完整送到终点。
第二层是可适应的自组织机制:Agent 能够暴露并更新自己的专长,提出任务拆解,认领 part,选择协作者,在发现依赖或冲突时重新分配工作。实验二提示,组织不会凭空出现;系统向 Agent 暴露什么信息,就会奖励什么样的连接与结构。
这也意味着,自由分工并不等于没有规则。越希望 Agent 自主行动,底层协议就越需要可靠。自由发生在“谁来做、怎样组合、何时调整”上,而不是让任务覆盖、结果格式和错误处理全部听天由命。
真正的 AI 蜂群,不是让更多 Agent 同时说话。
它让每个个体完成自己的 part,让所有 part 共同覆盖完整任务,也让合适的 Agent 在合适的时间找到彼此。
实验一已经展示了这种蜂群的潜力。实验二让我们看见,它也开始具备自己长出组织的可能。
参考文献
多 Agent 协作与评测
- Li, G., Hammoud, H. A. A. K., Itani, H., Khizbullin, D., & Ghanem, B. (2023). CAMEL: Communicative Agents for “Mind” Exploration of Large Language Model Society. arXiv:2303.17760.
- Du, Y., Li, S., Torralba, A., Tenenbaum, J. B., & Mordatch, I. (2024). Improving Factuality and Reasoning in Language Models through Multiagent Debate. ICML 2024, 11733–11763.
- Chen, W., et al. (2024). AgentVerse: Facilitating Multi-Agent Collaboration and Exploring Emergent Behaviors. ICLR 2024.
- Wu, Q., et al. (2024). AutoGen: Enabling Next-Gen LLM Applications through Multi-Agent Conversation. COLM 2024.
- Hong, S., et al. (2024). MetaGPT: Meta Programming for A Multi-Agent Collaborative Framework. ICLR 2024.
- Cemri, M., et al. (2025). Why Do Multi-Agent LLM Systems Fail? arXiv:2503.13657.
- Zhu, K., et al. (2025). MultiAgentBench: Evaluating the Collaboration and Competition of LLM Agents. ACL 2025, 8580–8622. doi: 10.18653/v1/2025.acl-long.421.
长上下文与实验方法
- Liu, N. F., et al. (2024). Lost in the Middle: How Language Models Use Long Contexts. Transactions of the Association for Computational Linguistics, 12, 157–173. doi: 10.1162/tacl_a_00638.
- Liang, P., et al. (2023). Holistic Evaluation of Language Models. Transactions on Machine Learning Research.
- AWS. (n.d.). Claude Haiku 4.5 model card.
网络科学与 LLM 组网
- Watts, D. J., & Strogatz, S. H. (1998). Collective dynamics of “small-world” networks. Nature, 393, 440–442. doi: 10.1038/30918.
- McPherson, M., Smith-Lovin, L., & Cook, J. M. (2001). Birds of a Feather: Homophily in Social Networks. Annual Review of Sociology, 27, 415–444. doi: 10.1146/annurev.soc.27.1.415.
- Telesford, Q. K., Joyce, K. E., Hayasaka, S., Burdette, J. H., & Laurienti, P. J. (2011). The Ubiquity of Small-World Networks. Brain Connectivity, 1(5), 367–375. doi: 10.1089/brain.2011.0038.
- Papachristou, M., & Yuan, Y. (2025). Network formation and dynamics among multi-LLMs. PNAS Nexus, 4(12), pgaf317. doi: 10.1093/pnasnexus/pgaf317.
- Anthropic. (2025). How we built our multi-agent research system.




