Model Adaptation · Data artifact
Red-Team Prompt Dataset
Data artifactModel AdaptationModelsarc:RedTeamPromptDataset
A collection of challenging prompts deliberately designed to elicit harmful, toxic, deceptive or biased responses, used as inputs to supervised critique-revision training.
Responsibility. Supplies harm-eliciting prompts for alignment training.
Also known as: Harmful prompts, Challenging prompts, Red-team prompts
Relationships
is read by dependency
Classification
- Quality attributes
- Functional suitability: correctness and validity (ISO/IEC 25010 | NIST AI RMF: valid)
- Risks mitigated
- Untested principle boundaries
Sources
- Ch9.5: T. Nguyen, "Constitutional AI," in Mastering Agentic AI Systems: Guide for the NVIDIA NCP-AAI Exam, 1st ed. 2026, ch. 9.5. ISBN: 9798244538229.