Model Adaptation · Data artifact
Domain Text Corpus
Data artifactModel AdaptationModelsarc:DomainTextCorpus
An unlabeled corpus of domain-specific text, such as technical manuals, research papers, textbooks and internal documentation, used for continued pretraining.
Responsibility. Supplies domain vocabulary and knowledge for continued pretraining.
Also known as: Domain corpus, CPT corpus, Clinical notes corpus
Relationships
is read by dependency
Classification
- Patterns
- Continued pretraining
- Quality attributes
- Functional suitability: correctness and validity (ISO/IEC 25010 | NIST AI RMF: valid)
Sources
- Ch3.5: T. Nguyen, "Prompt Optimization, Few-Shot Learning, Fine-Tuning," in Mastering Agentic AI Systems: Guide for the NVIDIA NCP-AAI Exam, 1st ed. 2026, ch. 3.5. ISBN: 9798244538229.
- Ch7.5: T. Nguyen, "NeMo Curator, Riva Speech AI & Multimodal Integration," in Mastering Agentic AI Systems: Guide for the NVIDIA NCP-AAI Exam, 1st ed. 2026, ch. 7.5. ISBN: 9798244538229.
- Ref6.01: S. Schürch, "How to Make Your LLM More Accurate with RAG & Fine-Tuning," Towards Data Science, Mar. 11, 2025. [Online]. Available: https://towardsdatascience.com/how-to-make-your-llm-more-accurate-with-rag-fine-tuning/