MLOps Path

5.1.3 · блок 5

GPU и ML runtime метрики

GPU и ML runtime метрики

Зачем это нужно

Inference на GPU — дорого и узко. CPU at 40% при GPU OOM или queue depth 500 — разные проблемы. GPU metrics (NVIDIA DCGM) и ML runtime (TorchServe, Triton, custom batching) дают USE-сигналы для capacity planning и incident response.

Без GPU observability команда либо переплачивает за простаивающие карты, либо ловит timeout при скрытой saturation.

Основные идеи

NVIDIA DCGM (Data Center GPU Manager).

Ключевые DCGM метрики.

| Метрика | Смысл |

|---------|--------|

| `DCGM_FI_DEV_GPU_UTIL` | SM utilization % |

| `DCGM_FI_DEV_MEM_COPY_UTIL` | Memory interface busy |

| `DCGM_FI_DEV_FB_USED / FREE` | GPU memory |

| `DCGM_FI_DEV_POWER_USAGE` | Watts — thermal/power cap |

| `DCGM_FI_DEV_XID_ERRORS` | Hardware/driver errors |

| `DCGM_FI_DEV_GPU_TEMP` | Throttling risk |

Utilization vs memory. GPU util 30% но memory 95% — large model, small batch; util 95% memory 50% — compute bound, можно batching.

MIG (Multi-Instance GPU). На A100/H100 — fractional GPU; labels gpu, GPU_I_ID для instance-level dashboards.

ML runtime metrics (application level).

Beyond DCGM, serving framework exposes:

Examples: Triton nv_inference_queue_duration_us, TorchServe custom counters.

Kubernetes + GPU.

Train vs inference.

Cost observability. GPU-seconds per model version × tariff — FinOps dashboard (advanced); DCGM power × time proxy.

Как это выглядит на практике

Grafana row «GPU — churn-serving nodes»:

Inference deployment:


resources:
  limits:
    nvidia.com/gpu: 1
readinessProbe:
  httpGet:
    path: /v1/models/churn/ready
    port: 8080
  initialDelaySeconds: 60  # model load on GPU

Compare dashboards:

Nightly train Workflow: post-job report average GPU util; if < 40%, increase num_workers in DataLoader.

Что сделать после занятия

Официальные материалы

Открыть интерактивную версию