Model Adaptation · Data artifact

Curated Training Corpus

Data artifactModel AdaptationModelsarc:CuratedTrainingCorpus

A filtered, deduplicated, PII-redacted and domain-prioritized training dataset saved in an efficient format, output of the curation pipeline and input to model training.

Responsibility. Provides high-quality, domain-matched training examples for pretraining or fine-tuning.

Also known as: Curated dataset, High-quality training corpus

is read byis produced byis evaluated byreceives data fromis read byFine-Tuning Pipeline: is read byFine-Tuning PipelineData Curator: is produced byData CuratorEvaluation Failure Analyzer: is evaluated byEvaluation Failure Analy…Synthetic Dataset: receives data fromSynthetic DatasetContinued Pretrainer: is read byContinued Pretrainer
Direct neighbourhood (hover for relationship types)

Relationships

is read by dependency

receives data from dynamic

is evaluated by assurance

is produced by lifecycle

Design guidance

Quantitative guidance

As stated by the sources; verify before use.

Classification

Quality attributes
Functional suitability: correctness and validity (ISO/IEC 25010 | NIST AI RMF: valid)Privacy (NIST AI RMF: privacy-enhanced)
Risks mitigated
Hallucination from noisy training dataDomain mismatch

Sources

  1. Ch7.5: T. Nguyen, "NeMo Curator, Riva Speech AI & Multimodal Integration," in Mastering Agentic AI Systems: Guide for the NVIDIA NCP-AAI Exam, 1st ed. 2026, ch. 7.5. ISBN: 9798244538229.
  2. Ch9.1: T. Nguyen, "Output Filtering and Content Moderation," in Mastering Agentic AI Systems: Guide for the NVIDIA NCP-AAI Exam, 1st ed. 2026, ch. 9.1. ISBN: 9798244538229.
  3. Ch10.5: T. Nguyen, "Human-over-the-Loop," in Mastering Agentic AI Systems: Guide for the NVIDIA NCP-AAI Exam, 1st ed. 2026, ch. 10.5. ISBN: 9798244538229.