Model Adaptation · Software component

Preference Optimizer

Software componentModel AdaptationModelsVariation point (abstract)arc:PreferenceOptimizer

An abstract model-adaptation component that updates a supervised-fine-tuned policy model so its outputs better match human preferences expressed as comparative judgments.

Responsibility. Aligns a policy model to learned preferences.

Also known as: Preference alignment, RLHF/DPO alignment training

is triggered byis orchestrated bytrainsis specialized byis specialized byis configured byFine-Tuning Pipeline: is triggered byFine-Tuning PipelineTraining Pipeline Orchestrator: is orchestrated byTraining Pipeline Orches…Fine-Tuned Agent Model: trainsFine-Tuned Agent ModelRLHF Policy Optimizer: is specialized byRLHF Policy OptimizerDirect Preference Optimizer: is specialized byDirect Preference Optimi…Preference Optimization Config: is configured byPreference Optimization …
Direct neighbourhood (hover for relationship types)

Variants

VariantWhen to choose
Direct Preference OptimizerChoose first for simpler preference-learning tasks where direct optimization suffices and lower compute is desired.
RLHF Policy OptimizerChoose for complex multi-dimensional preferences where explicit reward modeling provides interpretability benefits.

Relationships

is configured by structural

is triggered by dynamic

is orchestrated by control

trains lifecycle

Design guidance

Quantitative guidance

As stated by the sources; verify before use.

Classification

Patterns
Reinforcement learning from human feedbackPreference learningRLHF three-phase pipeline (SFT -> reward modeling -> RL)Preference-based alignment
Technologies
NVIDIA NeMo Customizer
Quality attributes
Functional suitability: correctness and validity (ISO/IEC 25010 | NIST AI RMF: valid)Reliability (ISO/IEC 25010 | NIST AI RMF: valid and reliable)
Risks mitigated
Behaviour that resists explicit demonstration or rule specificationReward specification intractability

Sources

  1. Ch3.5: T. Nguyen, "Prompt Optimization, Few-Shot Learning, Fine-Tuning," in Mastering Agentic AI Systems: Guide for the NVIDIA NCP-AAI Exam, 1st ed. 2026, ch. 3.5. ISBN: 9798244538229.
  2. Ch10.3: T. Nguyen, "RLHF Methodology," in Mastering Agentic AI Systems: Guide for the NVIDIA NCP-AAI Exam, 1st ed. 2026, ch. 10.3. ISBN: 9798244538229.