Observability & Evaluation · Interface

Inference Metrics Endpoint

InterfaceObservability & EvaluationObservability & Evaluationarc:InferenceMetricsEndpoint

A scrapeable endpoint on a model-serving process publishing inference-specific metrics such as queue depth, latency percentiles, batch sizes, error rates and per-model GPU usage.

Responsibility. Exposes serving-level operational metrics for collection.

Also known as: Triton metrics port 8002, Prometheus metrics exporter, NIM /metrics endpoint, Inference server /metrics endpoint

Variant of Metrics Endpoint abstract

is exposed byis exposed byis invoked byspecializesLLM Inference Service: is exposed byLLM Inference ServiceInference Server: is exposed byInference ServerMetrics Collector: is invoked byMetrics CollectorMetrics Endpoint: specializesMetrics Endpoint
Direct neighbourhood (hover for relationship types)

Relationships

is exposed by structural

is invoked by dependency

Design guidance

Quantitative guidance

As stated by the sources; verify before use.

Classification

Technologies
Prometheus exposition formatNVIDIA NIMNVIDIA Triton Inference Server metrics (port 8002)

Sources

  1. Ch4.5: T. Nguyen, "NVIDIA NIM and Triton Inference Server," in Mastering Agentic AI Systems: Guide for the NVIDIA NCP-AAI Exam, 1st ed. 2026, ch. 4.5. ISBN: 9798244538229.
  2. Ch7.2: T. Nguyen, "Performance Optimization and Production Monitoring," in Mastering Agentic AI Systems: Guide for the NVIDIA NCP-AAI Exam, 1st ed. 2026, ch. 7.2. ISBN: 9798244538229.
  3. Ch8.1: T. Nguyen, "Latency Metrics," in Mastering Agentic AI Systems: Guide for the NVIDIA NCP-AAI Exam, 1st ed. 2026, ch. 8.1. ISBN: 9798244538229.
  4. Ref7.04: NVIDIA, "NVIDIA NIM," NVIDIA Docs. Accessed: Sep. 27, 2026. [Online]. Available: https://docs.nvidia.com/nim/
  5. Ref7.08: NVIDIA, "NVIDIA Deep Learning Triton Inference Server Documentation," NVIDIA Docs. Accessed: Sep. 27, 2026. [Online]. Available: https://docs.nvidia.com/deeplearning/triton-inference-server/