AI Inference Platform & GPU Operations Control Plane

GPU fleet telemetry · model routing · request queue · failure/failover tracking · cost analysis 1 LAB GPU 31 SIMULATED GPUs

Fleet Overview

Loading...

GPU Fleet

GPU IDSourceModelUtilization VRAMTempPowerHealthLocation

Model Performance MEASURED — from stored request records

ModelBackendRequestsError Rate p50 (ms)p95 (ms)p99 (ms) TTFT (ms)Tokens/secThroughput

Latency percentiles computed from individual request records in SQLite — not hardcoded.

Load Test Results MEASURED

ModelUsersReq/s p50p95p99Err%

Reproducible load test: scripts/run_load_test.py · raw JSON in results/

Request Queue

Loading...

Failure Events

TimeTypeGPUFailedLatency Impact

Failover Log

TimeFrom →ToReasonDetect (ms)Failover (ms)

Failure Scenarios MEASURED — before/after metrics

TypeInjectionDetectionFailover Failed ReqsBefore (ms)After (ms)Δ Latency

Reproducible: scripts/run_failure_scenario.py · raw JSON in results/failure_scenarios.json

Estimated Inference Cost

Loading...

Per-Model Cost

ModelGPU $/hrTokens$/1M tokens$/request

Computed from actual request tokens + representative GPU pricing (see README).

Data sources: LAB 1 real GPU (RTX 4090 config) · SIMULATED 31 synthetic fleet GPUs · MEASURED load tests & failure scenarios