Site Reliability Engineer
Core
Ensure reliability, efficiency, and security of data and AI platforms powering global retail operations.
Role type
Senior Site Reliability Engineer
Builds
Automation, CI/CD pipelines, and resilient infrastructure for data/AI workloads
Domain
Retail, Data & AI Platform Engineering
Deliverable
infrastructure
Required skills
Site Reliability Engineering, DevOps, Platform/Infrastructure Engineering, GCP services (GKE, Cloud Run, BigQuery, Pub/Sub, GCS), Infrastructure-as-Code (Terraform, Helm), Observability tooling, SLO/SLI concepts, Data security fundamentals, Scripting (Python, Bash, or Go)
Preferred skills
Container orchestration (Kubernetes), CI/CD and GitOps workflows, Data platforms (batch/streaming), Multi-cloud concepts (GCP/Azure), Retail/e-commerce experience, Google SRE principles, AI/ML platform operations, FinOps
Technologies
Google Cloud Platform, GKE, Cloud Run, BigQuery, Pub/Sub, GCS, Terraform, Helm, Cloud Monitoring, Datadog, Prometheus, Grafana, ArgoCD, GitHub Actions, Azure
Responsibilities
Monitor production systems and triage issues, participate in on-call rotations and incident response, conduct blameless post-mortems, build automation to reduce toil, maintain SLO dashboards, operate GCP workloads using IaC
Seniority
Senior, hands-on IC