Cognition · Software component

MDP Policy Solver

Software componentCognitionCognition & Memoryarc:MDPPolicySolver

A decision engine that models a problem as a Markov decision process and derives a policy maximizing expected discounted sum of future rewards.

Responsibility. Computes action policies maximizing long-term discounted utility over state transitions.

Also known as: Sequential utility-based decision maker, Markov Decision Process planner

Variant of Decision Engine abstract

When to choose. Choose for sequential decisions where current actions affect future options and the state is (or has been augmented to be) Markovian.

specializesis configured byinvokesreceives data fromalternative toDecision Engine: specializesDecision EngineReward Function Specification: is configured byReward Function Specific…Outcome Probability Estimator: invokesOutcome Probability Esti…Markov State Augmenter: receives data fromMarkov State AugmenterPOMDP Policy Solver: alternative toPOMDP Policy Solver
Direct neighbourhood (hover for relationship types)

Relationships

is configured by structural

invokes dependency

receives data from dynamic

alternative to variability

Design guidance

Classification

Patterns
Markov Decision ProcessDiscounted expected returnSequential expected utility over treatment/decision pathways
Quality attributes
Functional suitability: correctness and validity (ISO/IEC 25010 | NIST AI RMF: valid)
Risks mitigated
Myopic optimization of immediate rewards

Sources

  1. Ch5.10: T. Nguyen, "Utility-Based Decision Making Fundamentals," in Mastering Agentic AI Systems: Guide for the NVIDIA NCP-AAI Exam, 1st ed. 2026, ch. 5.10. ISBN: 9798244538229.