智算多多联系我们

官方邮箱:sw@zsdodo.com

公司地址:北京市丰台区南四环西路188号总部基地三区国联股份数字经济总部(邮 编:100070)
关注我们

公众号

视频号
◎2025 北京智算多多科技有限公司版权所有 京ICP备 2025150592号-1
京公网安备11010602202532号
京公网安备11010602202532号 在多智能体强化学习(MARL)中,独立学习方法指每个智能体将环境视为静态或仅由自身控制,忽略其他智能体的策略变化。该方法实现简单,但存在非平稳性问题:由于其他智能体策略不断更新,单个智能体所面对的环境动态持续变化,导致训练不稳定。
计算复杂度与智能体数量呈线性关系,即 $ O(n) $,其中 $ n $ 为智能体数量。形式上可表示为:
$ Q_i(0) = \mathbb{E}_{a_{-i}} [R(s, a_i, a_{-i}) - D(s)] $
混合网络通过结合集中式与分布式组件,在训练和执行阶段实现信息融合与策略解耦。
CTDE 是 MARL 中的核心范式:训练时利用全局信息(如所有智能体的状态、动作)进行中心化学习;执行时仅依赖局部观测进行去中心化决策,兼顾学习效率与部署可行性。
CommNet 引入通信机制,允许智能体在通信内容中传递任意与任务相关的信息(如位置、意图信息),从而增强协同能力。
下面是一个完整的 QMIX 算法流程概述:
由于其他智能体策略持续更新,环境对单个智能体而言是非平稳的,易引发训练震荡甚至发散。
超参数应根据任务时程动态调整,关键配置如下:
| 超参数 | 推荐范围 |
|---|---|
| 经验缓冲区大小 | 32 ~ 128 |
| 目标网络更新频率 | 0.95 ~ 0.99 |
| 软更新系数 τ | 0.01 |
ABE 提式在处理非线性方面具有显著优势。
