Weekend Site Reliability Engineer
Core
Weekend Site Reliability Engineer responsible for on-call operations, incident response, and maintaining cloud infrastructure stability across multiple regions.
Role type
Senior IC Site Reliability Engineer
Builds
Cloud infrastructure, Kubernetes platform, and deployment pipelines for global expansion
Domain
Cloud Infrastructure / Site Reliability Engineering
Deliverable
production ML models | product features | dashboards & analysis | infrastructure
Required skills
Kubernetes, AWS, Terraform, Bash/Python/Golang, Observability stacks, Incident response, SLIs/SLOs, Networking (TCP/IP/HTTP), Linux troubleshooting
Preferred skills
Rust, Service mesh (Cilium), Real User Monitoring (RUM), JVM optimization, Cache management (Redis/Memcached)
Technologies
Kubernetes, EKS, ArgoCD, Helm, Terraform, AWS (EC2, Lambda, S3), Prometheus, Grafana, Loki, Tempo, OpenTelemetry, Jenkins, GitHub Actions, Cloudflare
Responsibilities
Own weekend on-call operations and triage production incidents, Design and manage alert pipelines to prevent alert fatigue, Define and maintain SLIs and SLOs, Improve Kubernetes platform stability and resource utilization, Liaise with external security agencies for audits, Mentor less experienced team members
Seniority
Senior, hands-on IC