Staff Site Reliability Engineer (x/f/m)
Core
Technical leader driving platform reliability, scalability, and operational maturity for a cloud-native healthcare platform serving 520,000 professionals and 90 million patients.
Role type
Staff Site Reliability Engineer (Technical Lead)
Builds
Cloud-native platform supporting 170+ applications across infrastructure, observability, and incident management
Domain
Healthcare / Cloud Infrastructure / Platform Engineering
Deliverable
production ML models | infrastructure
Required skills
SRE/Platform Engineering leadership, Cloud platforms (AWS/GCP/Azure), Kubernetes orchestration, SLO/Error Budget management, Incident response leadership, Backend programming (Go/Python/Ruby), Cross-functional technical influence
Preferred skills
High-scale telemetry pipeline design, Regulated environment experience (Healthcare/Fintech), Reliability enablement tooling
Technologies
Kubernetes, Terraform, AWS, GCP, Prometheus, OpenTelemetry, Datadog, ArgoCD
Responsibilities
Lead cross-cutting reliability initiatives (automation, observability, incident management), Define and evolve SLOs/alerting standards, Mentor senior engineers, Partner with dev teams to embed reliability practices, Influence architectural decisions
Seniority
Staff, hands-on IC with strategic leadership