CareerPlanSign in

Senior Manager, Site Reliability & Operational Resilience

5 Locations💼 Full-time🗓 2026-08-13 → 2026-09-26

Core

Lead enterprise Site Reliability & Operational Resilience capabilities to detect, respond to, recover from, and learn from technology disruptions.

Role type

Senior Manager, Site Reliability & Operational Resilience

Builds

Enterprise observability platform, Major Incident Command function, Disaster Recovery Orchestration, and reliability standards.

Domain

Healthcare technology / Enterprise IT Operations

Deliverable

production ML models | product features | dashboards & analysis | infrastructure

Required skills

Site Reliability Engineering, people leadership, observability strategy, major incident command, disaster recovery orchestration, distributed systems architecture, automation engineering, cross-functional influence, metrics definition, post-incident analysis

Preferred skills

Global team management, follow-the-sun handoff design, resilience testing, technical debt remediation

Technologies

LogicMonitor, New Relic, Splunk, Datadog

Responsibilities

Define and execute multi-year SRE roadmap; coach and develop a global team of senior engineers; establish target-state observability architecture; lead Major Incident Command capability; build Disaster Recovery Orchestration; measure recovery readiness; close the loop on post-incident reviews; establish reliability standards; engineer out toil; influence enterprise technology decisions; create executive reporting on resilience metrics.

Seniority

Senior, hands-on IC with leadership

Sourced via workday · Listed on CareerPlan, which tracks 70,000+ jobs from 20+ sources.