#多智能体路径规划、#多智能体系统、#强化学习
引用本文: Liu Q D, Li X W, Zhan C, et al. DPCN: enabling efficient multi-agent path finding via decentralized-planning-centralized-negotiation paradigm. Sci China Inf Sci, 2026, 69(8): 189202, https://doi.org/10.1007/s11432-025-4796-2

研究意义
多智能体路径规划(Multi-Agent Path Finding, MAPF)旨在为多个智能体在共享环境中规划无冲突的路径,使其从各自起点安全、高效地抵达目标位置。该问题广泛应用于自动化仓储、服务机器人调度、机场物流等现实场景。传统MAPF方法多采用集中式规划策略,依赖中央控制器对所有智能体进行全局协调。尽管这类方法在小规模问题上表现优异,但在面对大规模智能体团队时,其计算复杂度急剧上升,难以满足实时性需求。近年来,基于强化学习(Reinforcement Learning, RL)的分散式方法因其良好的可扩展性和对动态环境的适应能力而受到广泛关注。然而,分散式方法通常受限于局部观测视野,且各智能体倾向于优化个体奖励,容易引发阻塞、碰撞甚至死锁等问题。现有的基于强化学习的 MAPF方法大致可分为三类:- 规划前预防冲突:通过专家策略或单智能体规划器引导分散决策,提前规避潜在冲突;
- 规划中缓解冲突:利用通信机制聚合邻近智能体信息,提升感知范围以降低冲突概率;
- 规划后解决冲突:基于优先级机制处理已发生的冲突,但往往依赖固定或启发式规则,缺乏灵活性和鲁棒性。
针对上述挑战,亟需一种既能保留分散式方法可扩展性,又能有效处理动态冲突的新型框架。本文提出了一种新颖的“分散式规划–集中式协商”(Decentralized-Planning-Centralized-Negotiation, DPCN)范式,用于高效求解MAPF问题。如图1所示,DPCN将每个时间步划分为两个阶段:
规划阶段:每个智能体 i(如AGV)基于局部观测信息 o_i^t(视野为 3 * 3),独立生成一个动作意图 a ̃_i^t ϵ A,其中
。
协商阶段:系统检测所有潜在冲突(包括顶点冲突和交换冲突),并将涉及冲突的智能体动态聚合成“超级智能体”(super-agents)。每个超级智能体内部包含相互冲突的一组成员智能体。随后,通过本文提出的可学习的PNSE网络(Pointer Network Special Edition),根据当前环境状态,从该冲突集内部的成员智能体中选出一名“获胜者”执行其原始意图,其余智能体则保持静止或根据策略重新采样新动作。
图1 DPCN总体架构图
然而,该设计面临着两大挑战:
1. 动作集不一致:超级智能体的动作集由其内部成员智能体构成,不同冲突集拥有不同的成员智能体,因此无法使用固定动作集进行建模。
2. 动态训练困难:环境中的超级智能体会随着时间动态变化,这种动态性使得无法为每个超级智能体分配特定的策略网络 π_k 和动作价值函数 Q_k,从而导致训练困难。
为了应对上述挑战,本文受到指针网络的启发,设计了PNSE网络,它能够根据当前环境状态和冲突集内部关系,动态输出优先级分布,并选择最优执行者(即获胜者)。进一步地,本文提出一种定制化的策略梯度强化学习训练机制,采用平均场场近似(mean-field approximation)对全局回报进行公平分配,从而实现对动态超级智能体的有效训练。
本文的主要贡献如下:
1. 本文提出了分散式规划-集中式协商(DPCN)范式来解决多智能体路径规划(MAPF)问题。在该范式下,本文引入了一个新概念——超级智能体,它是代表一组智能体的概念性实体,而不是一个物理或独立的智能体。为了训练能够在动态且不断变化的超级智能体环境中有效运作的策略网络,本文设计了一种定制的多智能体强化学习(MARL)方法。
2. 本文设计了PNSE网络,其具备处理变长输入与不一致动作空间的能力,限制提升冲突解决效率。
3. 本文在小规模团队实例上训练模型,然后在具有不同团队规模、地图大小和障碍密度的大规模实例上进行测试。实验结果表明,得益于PNSE的高效协调与冲突解决能力,DPCN模型保持了出色的可扩展性,并优于现有基于强化学习的MAPF规划器。本文在标准MAPF基准和随机地图上对DPCN进行了全面评估,对比对象包括两类集中式规划器(ODrM*、BALANCE)和三种前沿RL-based方法(SCRIMP、DCC、PICO)。实验设置了不同地图尺寸(30×30 至 100×100)、障碍密度(0%–30%)及智能体数量(32–256),每种设置重复实验200次,并报告成功率(Success Rate, SR)、任务完成步数(Episode Length, EL)等关键指标。从下图的实验结果中可以看出,DPCN始终维持高成功率与低任务耗时。尤其在高障碍密度(30%)和大规模场景中,DPCN不仅大幅领先其他RL方法,还超越了ODrM*和追求近优解的BALANCE算法,充分验证了PNSE在复杂冲突场景下的优越性。为了评估 DPCN 在结构化地图上的泛化能力,本文在三类典型的地图上评估了其性能,每张地图包含 25 个问题实例。第一张地图是一个多房间环境,尺寸为 32×32,房间的尺寸为 3×3。第二张地图是类似礼堂的环境,尺寸为 162×141。第三张地图表示一个复杂的仓库环境,尺寸为 170×84,货架之间的通道宽度仅为 2 个格子。实验结果表明,DPCN具有出色的泛化能力,在这些复杂结构中仍能高效协调大规模团队,越超对比算法。总之,DPCN通过“分散规划 + 集中协商”的创新架构,在保持分散式方法可扩展性的同时,有效解决了局部视野下的冲突协调难题。其核心模块PNSE不仅具备强大的学习能力,还能在极有限感知条件下实现高效协作。未来,我们将探索DPCN在动态障碍、异构智能体及真实机器人平台上的应用,进一步推动多智能体协同技术走向实际部署。