Model Adaptation · Data artifact

Domain Text Corpus

Data artifactModel AdaptationModelsarc:DomainTextCorpus

An unlabeled corpus of domain-specific text, such as technical manuals, research papers, textbooks and internal documentation, used for continued pretraining.

Responsibility. Supplies domain vocabulary and knowledge for continued pretraining.

Also known as: Domain corpus, CPT corpus, Clinical notes corpus

is read byis read byis read byis read byFine-Tuning Pipeline: is read byFine-Tuning PipelineData Curator: is read byData CuratorContinued Pretrainer: is read byContinued PretrainerASR Language Model Trainer: is read byASR Language Model Trainer
Direct neighbourhood (hover for relationship types)

Relationships

is read by dependency

Classification

Patterns
Continued pretraining
Quality attributes
Functional suitability: correctness and validity (ISO/IEC 25010 | NIST AI RMF: valid)

Sources

  1. Ch3.5: T. Nguyen, "Prompt Optimization, Few-Shot Learning, Fine-Tuning," in Mastering Agentic AI Systems: Guide for the NVIDIA NCP-AAI Exam, 1st ed. 2026, ch. 3.5. ISBN: 9798244538229.
  2. Ch7.5: T. Nguyen, "NeMo Curator, Riva Speech AI & Multimodal Integration," in Mastering Agentic AI Systems: Guide for the NVIDIA NCP-AAI Exam, 1st ed. 2026, ch. 7.5. ISBN: 9798244538229.
  3. Ref6.01: S. Schürch, "How to Make Your LLM More Accurate with RAG & Fine-Tuning," Towards Data Science, Mar. 11, 2025. [Online]. Available: https://towardsdatascience.com/how-to-make-your-llm-more-accurate-with-rag-fine-tuning/