Model Adaptation · Data artifact

Red-Team Prompt Dataset

Data artifactModel AdaptationModelsarc:RedTeamPromptDataset

A collection of challenging prompts deliberately designed to elicit harmful, toxic, deceptive or biased responses, used as inputs to supervised critique-revision training.

Responsibility. Supplies harm-eliciting prompts for alignment training.

Also known as: Harmful prompts, Challenging prompts, Red-team prompts

is read byCritique-Revision Generator: is read byCritique-Revision Genera…
Direct neighbourhood (hover for relationship types)

Relationships

is read by dependency

Classification

Quality attributes
Functional suitability: correctness and validity (ISO/IEC 25010 | NIST AI RMF: valid)
Risks mitigated
Untested principle boundaries

Sources

  1. Ch9.5: T. Nguyen, "Constitutional AI," in Mastering Agentic AI Systems: Guide for the NVIDIA NCP-AAI Exam, 1st ed. 2026, ch. 9.5. ISBN: 9798244538229.