Senior Site Reliability Engineer
Core
Lead incident response efforts and ensure system reliability, scalability, and performance for warehousing IT operations.
Role type
Senior SRE Lead (Incident Response Team)
Builds
Robust monitoring tools, automated incident response systems, and resilient system architectures for warehousing customers.
Domain
Warehousing IT Operations / Cloud Infrastructure
Deliverable
production ML models | product features | dashboards & analysis | infrastructure
Required skills
Linux/Unix administration, Cloud platforms (AWS/Azure/GCP), Infrastructure-as-Code (Terraform), Programming (Python/C#), Networking protocols, Containerization (Docker/Kubernetes), SQL, Monitoring tools (Prometheus/Grafana), Incident response methodologies, Security best practices
Preferred skills
Warehousing Management Systems (RTCIS/PrIME) experience, SAP familiarity
Technologies
AWS, Azure, GCP, Terraform, Python, C#, Docker, Kubernetes, Prometheus, Grafana, RTCIS, PrIME, SAP
Responsibilities
Lead swift resolution of critical incidents and conduct root cause analysis; Design and implement resilient system architectures; Manage SLOs and SLIs; Mentor SRE team members and foster technical excellence; Collaborate with customers to ensure system reliability; Oversee reporting on system performance and incident metrics.
Seniority
Senior, hands-on IC with leadership responsibilities