Model Adaptation · Model asset

Constitutionally Aligned Model

Model assetModel AdaptationModelsarc:ConstitutionallyAlignedModel

A language model checkpoint whose weights were trained by critique-revision supervised fine-tuning and AI-feedback preference optimization to adhere to a constitution.

Responsibility. Generates responses that embody constitutional principles by default.

Also known as: CAI-trained model, RL-CAI policy, Aligned policy model

deployed onis trained byis evaluated byis trained byis monitored byis evaluated byis evaluated byis evaluated byis evaluated byLLM Inference Service: deployed onLLM Inference ServiceFine-Tuning Pipeline: is trained byFine-Tuning PipelineBias Evaluator: is evaluated byBias EvaluatorRLHF Policy Optimizer: is trained byRLHF Policy OptimizerAlignment Drift Monitor: is monitored byAlignment Drift MonitorRed Team Tester: is evaluated byRed Team TesterPrinciple Adherence Evaluator: is evaluated byPrinciple Adherence Eval…Adversarial Robustness Evaluator: is evaluated byAdversarial Robustness E…Helpfulness Preservation Evaluator: is evaluated byHelpfulness Preservation…
Direct neighbourhood (hover for relationship types)

Relationships

deployed on structural

is evaluated by assurance

is monitored by assurance

is trained by lifecycle

Design guidance

Classification

Patterns
Training-time alignmentHelpful, harmless, honest (HHH)
Quality attributes
Safety (ISO/IEC 25010 | NIST AI RMF: safe)Reliability (ISO/IEC 25010 | NIST AI RMF: valid and reliable)Functional suitability: correctness and validity (ISO/IEC 25010 | NIST AI RMF: valid)
Risks mitigated
Prompt-only safety overridden by jailbreaks or injectionHelpfulness-harmlessness trade-off

Sources

  1. Ch9.5: T. Nguyen, "Constitutional AI," in Mastering Agentic AI Systems: Guide for the NVIDIA NCP-AAI Exam, 1st ed. 2026, ch. 9.5. ISBN: 9798244538229.