Infrastructure · Data artifact
GPU Partition Reconfiguration Policy
Data artifactInfrastructureInfrastructurearc:GPUPartitionReconfigurationPolicy
A declarative policy governing how partition-layout changes roll out: reconfiguration mode, validation delay between GPUs, and spare capacity preserved for evicted workloads.
Responsibility. Bounds the disruption caused by changing GPU partition geometry.
Also known as: drain-one-at-a-time reconfigure mode, N+1 capacity rule
Relationships
constrains control
Design guidance
- MUST keep at least N+1 GPU capacity so evicted workloads can reschedule during reconfiguration.
- SHOULD keep 10-15% of GPU capacity unused as reconfiguration headroom.
Quantitative guidance
As stated by the sources; verify before use.
- Example validation delay: 60 s between GPUs (Ch7.6).
Classification
- Quality attributes
- Reliability (ISO/IEC 25010 | NIST AI RMF: valid and reliable)
- Risks mitigated
- Cluster capacity exhaustion while a GPU is drained
Sources
- Ch7.6: T. Nguyen, "Multi-Instance GPU," in Mastering Agentic AI Systems: Guide for the NVIDIA NCP-AAI Exam, 1st ed. 2026, ch. 7.6. ISBN: 9798244538229.