Staff Engineer, Site Reliability
Core
Staff SRE owning AWS infrastructure, CI/CD systems, and reliability practices for a platform supporting 9M+ users across e-commerce, health, and media.
Role type
Staff Site Reliability Engineer (Infrastructure & Platform)
Builds
AWS infrastructure (EKS, RDS, networking), CI/CD pipelines, and developer tooling for the entire engineering org.
Domain
E-commerce, Health, Media, SaaS
Deliverable
production ML models | infrastructure
Required skills
Terraform (IaC ownership), AWS (EKS, RDS, networking, CDNs), Kubernetes (production debugging), CI/CD design, observability (Datadog, Sentry), incident management
Preferred skills
AI tooling integration, cross-functional platform strategy
Technologies
Ruby on Rails, AWS, Sidekiq, MySQL, Redis, Terraform, EKS, CircleCI, GitHub Actions, Datadog, Sentry, PagerDuty, Cronitor
Responsibilities
Manage and evolve AWS environment using Terraform; own speed and reliability of CI systems; unblock developers across environments; establish monitoring and alerting standards; lead incident response and post-mortems; contribute to long-term platform architecture.
Seniority
Staff, cross-team visibility & strategy