Site Reliability Engineer - Disaster Recovery & Business Continuity
Core
Ensure CRA's critical business services are reliable, scalable, and performant across on-premises and cloud environments by blending software engineering and operations practices to reduce manual toil, improve observability, and strengthen incident response.
Role type
Site Reliability Engineer (Disaster Recovery & Business Continuity)
Builds
Resilient architectures, DR testing programs, and automated recovery workflows for enterprise infrastructure.
Domain
Consulting firm IT infrastructure (Microsoft ecosystem, hybrid cloud)
Deliverable
production ML models | product features | dashboards & analysis | research | client delivery | infrastructure | physical/clinical work
Required skills
Hands-on system engineering with Windows Server, VMware vSphere, VMware Site Recovery Manager (SRM), SAN technologies, and Rubrik ecosystem; SRE concepts (SLIs/SLOs, error budgets); observability tooling (logs, metrics, tracing); disaster recovery orchestration and testing; dependency mapping and recovery procedure validation.
Preferred skills
Experience building and operating a DR testing program; cross-functional collaboration with engineering, security, and operations teams.
Technologies
Windows Server, VMware vSphere, VMware Site Recovery Manager (SRM), Rubrik, Azure Site Recovery (ASR), SAN technologies
Responsibilities
Define and maintain service level indicators (SLIs) and service level objectives (SLOs) for availability, latency, and performance; implement and improve monitoring, logging, alerting, and dashboards; facilitate blameless post-incident reviews and drive remediation; design and launch a scalable DR testing program including tabletop and technical recovery exercises; contribute to reliability architecture and disaster recovery readiness for key services.
Seniority
Mid-to-Senior, hands-on IC