Model Adaptation · Software component

Multi-Agent Policy Learner

Software componentModel AdaptationModelsVariation point (abstract)arc:MultiAgentPolicyLearner

An abstract policy learner that trains policies for multiple agents learning simultaneously in a shared cooperative, competitive, or mixed-motive environment.

Responsibility. Trains multiple agents' policies under mutual non-stationarity.

Also known as: Multi-agent reinforcement learning

Variant of Policy Learner abstract

reads; writesinvokesspecializesis specialized byis specialized byOpponent Policy League: reads; writesOpponent Policy LeagueEnvironment Simulator: invokesEnvironment SimulatorPolicy Learner: specializesPolicy LearnerCentralized-Training Decentralized-Execution Learner: is specialized byCentralized-Training Dec…Independent Multi-Agent Learner: is specialized byIndependent Multi-Agent …
Direct neighbourhood (hover for relationship types)

Variants

VariantWhen to choose
Centralized-Training Decentralized-Execution LearnerChoose when training can occur with full observability (e.g., simulation) but deployment requires distributed execution with limited communication.
Independent Multi-Agent LearnerChoose when agents interact loosely so the environment appears approximately stationary to each agent.

Relationships

invokes dependency

reads dependency

writes dependency

Classification

Patterns
Self-playLeague training with exploiter policiesLearned communicationCredit assignment
Risks mitigated
Non-stationarity from co-learning agentsCyclic self-play dynamics

Sources

  1. Ch5.12: T. Nguyen, "Learning-Based Decision Making Fundamentals," in Mastering Agentic AI Systems: Guide for the NVIDIA NCP-AAI Exam, 1st ed. 2026, ch. 5.12. ISBN: 9798244538229.