Senior Manager, Site Reliability & Operational Resilience
Core
Lead enterprise Site Reliability & Operational Resilience capabilities to detect, respond to, recover from, and learn from technology disruptions.
Role type
Senior Manager, Site Reliability & Operational Resilience
Builds
Enterprise observability platform, Major Incident Command function, Disaster Recovery Orchestration, and reliability standards.
Domain
Healthcare technology / Enterprise IT Operations
Deliverable
production ML models | product features | dashboards & analysis | infrastructure
Required skills
Site Reliability Engineering, people leadership, observability strategy, major incident command, disaster recovery orchestration, distributed systems architecture, automation engineering, cross-functional influence, metrics definition, post-incident analysis
Preferred skills
Global team management, follow-the-sun handoff design, resilience testing, technical debt remediation
Technologies
LogicMonitor, New Relic, Splunk, Datadog
Responsibilities
Define and execute multi-year SRE roadmap; coach and develop a global team of senior engineers; establish target-state observability architecture; lead Major Incident Command capability; build Disaster Recovery Orchestration; measure recovery readiness; close the loop on post-incident reviews; establish reliability standards; engineer out toil; influence enterprise technology decisions; create executive reporting on resilience metrics.
Seniority
Senior, hands-on IC with leadership