Infrastructure · Software component
GPU Partition Manager
Software componentInfrastructureInfrastructurearc:GPUPartitionManager
A node-level controller that applies a declared GPU partition layout by draining affected workloads, destroying existing partition and compute instances, and recreating them in the new geometry.
Responsibility. Reconciles each GPU's hardware partitioning with the declared partition layout.
Also known as: MIG manager, nvidia-mig-manager
Relationships
deployed on structural
reads dependency
- GPU Partition Layout abstract Ch7.6
is triggered by dynamic
is constrained by control
is orchestrated by control
scales control
Design guidance
- SHOULD reconfigure one GPU at a time with a validation delay between GPUs.
- MUST drain workloads before reconfiguring, because a partition change requires a GPU reset.
Quantitative guidance
As stated by the sources; verify before use.
- Reconfiguring a GPU (drain, destroy, recreate) takes 90-120 seconds, or 2-3 minutes within a maintenance window (Ch7.6).
Classification
- Patterns
- Declarative reconciliationDrain-reconfigure-uncordon
- Technologies
- nvidia-mig-manager DaemonSetnvidia-smi migKubernetes
- Quality attributes
- Maintainability (ISO/IEC 25010)Reliability (ISO/IEC 25010 | NIST AI RMF: valid and reliable)
- Risks mitigated
- Capacity loss during partition reconfiguration
Sources
- Ch7.6: T. Nguyen, "Multi-Instance GPU," in Mastering Agentic AI Systems: Guide for the NVIDIA NCP-AAI Exam, 1st ed. 2026, ch. 7.6. ISBN: 9798244538229.