Site Reliability Engineer
Core
Lead technical response during critical service incidents, build early-warning visibility, and drive engineering improvements to minimize disruption across warehouses, offices, and GSC environments.
Role type
Senior IC Site Reliability Engineer (Service Excellence)
Builds
Dashboards, alert thresholds, recovery indicators, automation-driven remediation steps, and standard response workflows.
Domain
Logistics / Supply Chain Operations / Cloud Infrastructure
Deliverable
production ML models | product features | dashboards & analysis | infrastructure
Required skills
Incident response, root-cause analysis, observability platforms, monitoring systems, automation scripting, distributed systems, cloud platforms, network operations, enterprise applications, continuity planning.
Preferred skills
Multi-region operational environments, proactive engineering practices, stakeholder communication.
Technologies
Observability platforms, monitoring data, scripts, operational workflows.
Responsibilities
Lead technical response during critical service incidents, build early-warning and real-time visibility using observability platforms, develop dashboards and alert thresholds, conduct structured root-cause analysis, implement automation-driven remediation steps, maintain and prioritise a continuity backlog, create runbooks and playbooks, provide continuity insights to leadership.
Seniority
Mid-Senior, hands-on IC