M-01
Driver LifecycleDriver-levenscyclus
CUDA / ROCm driver, firmware and BIOS lifecycle management with controlled rollout.
CUDA / ROCm driver-, firmware- en BIOS-levenscyclusbeheer met gecontroleerde uitrol.
M-02
24/7 Monitoring24/7 Monitoring
Prometheus, Grafana and Loki dashboards with alerting to your team and ours.
Prometheus-, Grafana- en Loki-dashboards met alerting naar uw team en het onze.
M-03
On-Call EngineeringOn-Call Engineering
Human engineers available 24/7 via ticket, email and emergency phone.
Menselijke engineers 24/7 beschikbaar via ticket, e-mail en noodtelefoon.
M-04
Hardware ReplacementHardwarevervanging
4-hour replacement SLA for GPUs, NICs, NVMe drives and power supplies on reserved plans.
4-uurs vervangings-SLA voor GPU's, NIC's, NVMe-drives en voedingen op reserved plannen.
M-05
Cluster DeploymentCluster-deployment
Multi-node cluster assembly, fabric cabling, NCCL / RCCL tuning and validation.
Multi-node cluster-assemblage, fabric-bekabeling, NCCL / RCCL-tuning en validatie.
M-06
Performance BenchmarkingPrestatie-benchmarking
MLPerf, HPL, STREAM and workload-specific benchmarks before and after changes.
MLPerf-, HPL-, STREAM- en workload-specifieke benchmarks voor en na wijzigingen.
M-07
Remote HandsRemote Hands
Physical intervention at the rack — cable swaps, card reseating, disk replacement.
Fysieke interventie bij het rack — kabelwissels, kaart-plaatsing, schijfvervanging.
M-08
Security PatchingBeveiligingspatches
Coordinated kernel, firmware and CVE patching with rollback plans and change windows.
Gecoördineerde kernel-, firmware- en CVE-patching met rollback-plannen en change-vensters.