Senior Site Reliability Engineer
Core
Architect and operate highly available, resilient distributed systems at global scale, focusing on multi-region microservices, APIs, and authentication infrastructure.
Role type
Senior Site Reliability Engineer (IC with technical leadership)
Builds
Production-grade reliability solutions, disaster recovery strategies, observability platforms, and cloud infrastructure automation.
Domain
Cloud Infrastructure & Distributed Systems
Required skills
Kubernetes (EKS/GKE), Terraform, AWS/GCP, Python/Go, Observability (Datadog), FinOps, Incident Management, GitOps (Argo CD/Kargo), Service Meshes (Istio/Linkerd), Cloud Networking
Preferred skills
Chaos Engineering, Secrets Management (Vault), DevSecOps, IAM Platforms
Responsibilities
Architect and scale multi-region microservices and authentication infrastructure; Design and maintain disaster recovery and business continuity strategies; Establish and enforce SLI/SLO/error-budget frameworks; Lead observability strategy and major incident response; Architect and operate production Kubernetes environments; Design and maintain modular Terraform infrastructure; Build automation tooling and FinOps dashboards; Mentor engineers and drive technical standards. (via careerplan.io/jobs/c6d086d5-6b16-4c26-a9c6-3e712221a5ca-senior-site-reliability-engineer-at-jobgether)
Seniority
Senior, hands-on IC with technical leadership