Lead Site Reliability Engineer
Core
Define reliability standards, establish Service Level Objectives (SLOs), and translate complex telemetry into actionable insights for senior leadership to guide infrastructure decisions.
Role type
Lead Site Reliability Engineer (Strategy & Standards)
Builds
Reliability frameworks, SLO policies, and reporting tooling for critical user journeys
Domain
Gaming / Distributed Systems / Cloud Infrastructure
Deliverable
production ML models | product features | dashboards & analysis | infrastructure
Required skills
SLO/SLI definition, error budget management, observability platform expertise, distributed systems failure analysis, cross-functional influence, technical reporting
Preferred skills
Experience with Datadog, AWS, Kubernetes, on-premise systems
Technologies
Datadog, Amazon Web Services, Kubernetes
Responsibilities
Lead SLO development process, partner on SLO implementation for critical user journeys, refine reliability objectives, connect infrastructure targets to application experiences, build reliability reporting tooling, mentor teams on reliability practices
Seniority
Senior, hands-on IC with strategic influence