Site Reliability Engineer
Core
Define and codify gold standards for day 2 operations of a mission-critical ML inference platform, building robust systems, automations, and observability tooling to ensure reliability at scale.
Role type
Senior Site Reliability Engineer (ML Infrastructure)
Builds
Multi-cloud Kubernetes infrastructure, observability tooling, automated mitigations, and incident response systems for AI model serving.
Domain
Cloud Infrastructure / Machine Learning Operations
Deliverable
production ML models | infrastructure
Required skills
Kubernetes (multi-cloud), observability tooling (metrics, logging, dashboards, alerting), infrastructure-as-code, GitOps workflows, incident response, runbook authoring, post-mortem analysis, system design, trade-off analysis
Preferred skills
VictoriaMetrics, Prometheus, Loki, ELK, Grafana, Terraform, Helm, Flux CD, ArgoCD, incident.io, AI-assisted tooling development
Technologies
Kubernetes, EKS, GKE, VictoriaMetrics, Prometheus, Loki, ELK, Grafana, Terraform, Helm, Flux CD, ArgoCD, incident.io
Responsibilities
Own reliability of multi-cloud Kubernetes infrastructure including incident response and remediation; Build and maintain observability infrastructure as code; Author and improve runbooks for recurring failure patterns; Convert high-frequency failure patterns into automated mitigations; Diagnose and resolve runtime issues related to latency, memory, GPU utilization, and concurrency; Define and instrument SLOs and SLIs across workloads
Seniority
Senior, hands-on IC