Lead Director, Site Reliability Engineering - Client Experience
Core
Building, leading, and scaling hands-on SRE teams to ensure end-to-end reliability of Adjudication and Client Experience platforms across On-Prem, Azure, and GCP.
Role type
Lead Director, Site Reliability Engineering
Builds
Tier-1 services for Adjudication and Client Experience platforms
Domain
Healthcare technology, multi-cloud infrastructure (Azure & GCP)
Deliverable
production ML models | infrastructure
Required skills
SRE practices (SLOs, SLIs, error budgets), distributed systems, microservices, cloud-native architectures, incident management, root cause analysis, observability, CI/CD, Kubernetes, automation, capacity planning
Preferred skills
Kubernetes platforms (AKS, GKE, OpenShift), AI-Ops, predictive reliability solutions, modern monitoring strategies, platform modernization
Technologies
Azure, GCP, Kubernetes (AKS, GKE), OpenShift
Responsibilities
Lead and grow hands-on SRE teams; Establish and enforce SRE best practices; Review and influence architecture and reliability designs; Drive cloud-native reliability patterns; Own incident management and post-mortems; Lead root cause analysis; Define and standardize monitoring and observability; Implement predictive operations and AI-Ops; Lead reliability engineering for multi-cloud environments; Ensure pre-season readiness and capacity planning; Drive consistency in CI/CD; Embed reliability into the SDLC; Reduce operational toil through automation; Lead modernization initiatives; Communicate platform health using data-driven metrics; Ensure systems meet security and compliance requirements
Seniority
Director, hands-on technical leadership