Model Adaptation · Model asset
Constitutionally Aligned Model
Model assetModel AdaptationModelsarc:ConstitutionallyAlignedModel
A language model checkpoint whose weights were trained by critique-revision supervised fine-tuning and AI-feedback preference optimization to adhere to a constitution.
Responsibility. Generates responses that embody constitutional principles by default.
Also known as: CAI-trained model, RL-CAI policy, Aligned policy model
Relationships
deployed on structural
is evaluated by assurance
is monitored by assurance
is trained by lifecycle
Design guidance
- MUST be continuously monitored and periodically retrained; alignment degrades through distribution shift, fine-tuning drift, adversarial attacks, interpretation drift and catastrophic forgetting.
- SHOULD include explicit alignment maintenance whenever domain fine-tuning is applied.
Classification
- Patterns
- Training-time alignmentHelpful, harmless, honest (HHH)
- Quality attributes
- Safety (ISO/IEC 25010 | NIST AI RMF: safe)Reliability (ISO/IEC 25010 | NIST AI RMF: valid and reliable)Functional suitability: correctness and validity (ISO/IEC 25010 | NIST AI RMF: valid)
- Risks mitigated
- Prompt-only safety overridden by jailbreaks or injectionHelpfulness-harmlessness trade-off
Sources
- Ch9.5: T. Nguyen, "Constitutional AI," in Mastering Agentic AI Systems: Guide for the NVIDIA NCP-AAI Exam, 1st ed. 2026, ch. 9.5. ISBN: 9798244538229.