CareerPlanSign in

Weekend Site Reliability Engineer

Global - Remote🌐 Remote💼 Full-time🗓 2026-07-29 → 2026-09-26

Core

Weekend Site Reliability Engineer responsible for on-call operations, incident response, and maintaining cloud infrastructure stability across multiple regions.

Role type

Senior IC Site Reliability Engineer

Builds

Cloud infrastructure, Kubernetes platform, and deployment pipelines for global expansion

Domain

Cloud Infrastructure / Site Reliability Engineering

Deliverable

production ML models | product features | dashboards & analysis | infrastructure

Required skills

Kubernetes, AWS, Terraform, Bash/Python/Golang, Observability stacks, Incident response, SLIs/SLOs, Networking (TCP/IP/HTTP), Linux troubleshooting

Preferred skills

Rust, Service mesh (Cilium), Real User Monitoring (RUM), JVM optimization, Cache management (Redis/Memcached)

Technologies

Kubernetes, EKS, ArgoCD, Helm, Terraform, AWS (EC2, Lambda, S3), Prometheus, Grafana, Loki, Tempo, OpenTelemetry, Jenkins, GitHub Actions, Cloudflare

Responsibilities

Own weekend on-call operations and triage production incidents, Design and manage alert pipelines to prevent alert fatigue, Define and maintain SLIs and SLOs, Improve Kubernetes platform stability and resource utilization, Liaise with external security agencies for audits, Mentor less experienced team members

Seniority

Senior, hands-on IC

Sourced via greenhouse · Listed on CareerPlan, which tracks 70,000+ jobs from 20+ sources.