Global IT Site Reliability Engineer Senior Manager
Core
Runs and improves reliability engineering systems, automation, and observability to reduce operational toil and embed reliability into delivery workflows across the organization.
Role type
Senior Manager, Site Reliability Engineering (IC with mentorship)
Builds
Reusable engineering patterns, automation pipelines, observability tooling, and governance frameworks for cloud infrastructure.
Domain
Enterprise IT, Cloud Infrastructure, Site Reliability Engineering
Deliverable
production ML models | product features | dashboards & analysis | infrastructure
Required skills
Cloud platform expertise (AWS/Azure), Infrastructure-as-Code (Terraform), CI/CD pipeline design, Observability platform management (Splunk/Datadog), Python scripting, Incident response leadership, Stakeholder communication, Zero Trust security implementation, Identity and access management (Entra ID/Vault), Network architecture design, SLO/SLI definition and governance.
Preferred skills
Multi-cloud/federated environment experience, Container orchestration (Kubernetes), Cloud certifications, Policy-as-code tooling (OPA/Sentinel), AIOps, Event-driven automation platforms (ServiceNow/PagerDuty), Cloud FinOps, Alibaba Cloud architecture.
Technologies
Terraform, Python, AWS, Azure, GCP, Alibaba Cloud, Splunk, Datadog, Entra ID, HashiCorp Vault, Docker, Kubernetes, OPA, Sentinel, ServiceNow, PagerDuty
Responsibilities
Run and improve reliability engineering systems including automation and observability; Design and implement solutions to eliminate operational toil; Lead incident response and drive systemic remediation; Mentor less senior engineers; Drive cross-team collaboration to embed reliability and governance; Communicate engineering status and risks to senior stakeholders.
Seniority
Senior Manager, hands-on IC with mentorship