首页
产品服务
模型广场
Token工厂
算力市场算力商情行业资讯
注册

【深度强化学习精通】第13讲 | 多智能体强化学习:从博弈到协作

发布日期:2026-03-21 来源:CSDN软件开发网作者:CSDN软件开发网

多智能体环境的形式化定义

3. 独立学习方法

  在多智能体强化学习(MARL)中,独立学习方法指每个智能体将环境视为静态或仅由自身控制,忽略其他智能体的策略变化。该方法实现简单,但存在非平稳性问题:由于其他智能体策略不断更新,单个智能体所面对的环境动态持续变化,导致训练不稳定。

  计算复杂度与智能体数量呈线性关系,即 $ O(n) $,其中 $ n $ 为智能体数量。形式上可表示为:

  $ Q_i(0) = \mathbb{E}_{a_{-i}} [R(s, a_i, a_{-i}) - D(s)] $

混合网络架构

  混合网络通过结合集中式与分布式组件,在训练和执行阶段实现信息融合与策略解耦。

4. 中心化训练去中心化执行(CTDE)

  CTDE 是 MARL 中的核心范式:训练时利用全局信息(如所有智能体的状态、动作)进行中心化学习;执行时仅依赖局部观测进行去中心化决策,兼顾学习效率与部署可行性。

典型涌现现象

  • 社会规范:智能体自发形成协作规则,如轮流通行、资源分配协议等。

CommNet

  CommNet 引入通信机制,允许智能体在通信内容中传递任意与任务相关的信息(如位置、意图信息),从而增强协同能力。

6. QMIX算法实现

  下面是一个完整的 QMIX 算法流程概述:

  • 采用值分解网络(VDN)结构扩展,通过混合网络将个体 Q 值组合为全局 Q 值;
  • 满足单调性约束:$ \frac{\partial Q_{tot}}{\partial Q_i} \geq 0 $;
  • 支持同步行动场景下的联合动作价值估计。

1:非平稳性导致的训练发散

  由于其他智能体策略持续更新,环境对单个智能体而言是非平稳的,易引发训练震荡甚至发散。

9.2 超参数调优建议

  超参数应根据任务时程动态调整,关键配置如下:

超参数 推荐范围
经验缓冲区大小 32 ~ 128
目标网络更新频率 0.95 ~ 0.99
软更新系数 τ 0.01

10. 延伸阅读

10.1 经典论文

  ABE 提式在处理非线性方面具有显著优势。

本文转载自CSDN软件开发网, 作者:CSDN软件开发网, 原文标题:《 【深度强化学习精通】第13讲 | 多智能体强化学习:从博弈到协作 》, 原文链接: https://blog.csdn.net/qq_62890351/article/details/159314040。 本平台仅做分享和推荐,不涉及任何商业用途。文章版权归原作者所有。如涉及作品内容、版权和其它问题,请与我们联系,我们将在第一时间删除内容!
本文相关推荐
暂无相关推荐
点击立即订阅