/documents/76970/
基本信息
文件基本信息
名称
The Surprising Effectiveness of PPO in Cooperative, Multi-Agent Games
描述
近端策略优化(PPO)是一种普遍存在的同策略强化学习算法,但在多智能体设置中,其利用率明显低于离策略学习算法。这通常是因为人们相信 PPO 的样本效率明显低于多智能体系统中的离策略方法。在这项工作中,我们仔细研究了 PPO 在协作多智能体环境中的性能。我们证明,基于 PPO 的多智能体算法在四个流行的多智能体测试平台中实现了令人惊讶的强大性能:粒子世界环境、星际争霸多智能体挑战、Google Research Football 和 Hanabi 挑战,只需最少的超参数调整,并且无需任何特定于领域的算法修改或架构。重要的是,与竞争性的离策略方法相比,PPO 通常在最终回报和样本效率方面都取得了有竞争力或更好的结果。最后,通过消融研究,我们分析了对 PPO 实证性能至关重要的实现和超参数因素,并针对这些因素给出了具体的实用建议。我们的结果表明,在使用这些实践时,简单的基于 PPO 的方法可以成为协作多智能体强化学习的强大基线。源代码发布于\url{此 https URL} ...