Model Adaptation · Data artifact
Curated Training Corpus
Data artifactModel AdaptationModelsarc:CuratedTrainingCorpus
A filtered, deduplicated, PII-redacted and domain-prioritized training dataset saved in an efficient format, output of the curation pipeline and input to model training.
Responsibility. Provides high-quality, domain-matched training examples for pretraining or fine-tuning.
Also known as: Curated dataset, High-quality training corpus
Relationships
is read by dependency
receives data from dynamic
is evaluated by assurance
is produced by lifecycle
Design guidance
- SHOULD NOT mix languages in one training set for a multilingual agent; SHOULD produce separate language-specific subsets.
- SHOULD limit synthetic content to at most 5-10% of the corpus.
Quantitative guidance
As stated by the sources; verify before use.
- Deduplication improves downstream task performance by 5-15% and cuts training cost by 20-50% (empirical studies cited in Ch7.5).
Classification
- Quality attributes
- Functional suitability: correctness and validity (ISO/IEC 25010 | NIST AI RMF: valid)Privacy (NIST AI RMF: privacy-enhanced)
- Risks mitigated
- Hallucination from noisy training dataDomain mismatch
Sources
- Ch7.5: T. Nguyen, "NeMo Curator, Riva Speech AI & Multimodal Integration," in Mastering Agentic AI Systems: Guide for the NVIDIA NCP-AAI Exam, 1st ed. 2026, ch. 7.5. ISBN: 9798244538229.
- Ch9.1: T. Nguyen, "Output Filtering and Content Moderation," in Mastering Agentic AI Systems: Guide for the NVIDIA NCP-AAI Exam, 1st ed. 2026, ch. 9.1. ISBN: 9798244538229.
- Ch10.5: T. Nguyen, "Human-over-the-Loop," in Mastering Agentic AI Systems: Guide for the NVIDIA NCP-AAI Exam, 1st ed. 2026, ch. 10.5. ISBN: 9798244538229.