CareerPlanGet AI match score →

Site Reliability Engineer

Malaysia, Selangor, Petaling Jaya, 47400💼 Full-time🗓 2026-06-16 → 2026-07-30

Core

Lead technical response during critical service incidents, build early-warning visibility, and drive engineering improvements to minimize disruption across warehouses, offices, and GSC environments.

Role type

Senior IC Site Reliability Engineer (Service Excellence)

Builds

Dashboards, alert thresholds, recovery indicators, automation-driven remediation steps, and standard response workflows.

Domain

Logistics / Supply Chain Operations / Cloud Infrastructure

Deliverable

production ML models | product features | dashboards & analysis | infrastructure

Required skills

Incident response, root-cause analysis, observability platforms, monitoring systems, automation scripting, distributed systems, cloud platforms, network operations, enterprise applications, continuity planning.

Preferred skills

Multi-region operational environments, proactive engineering practices, stakeholder communication.

Technologies

Observability platforms, monitoring data, scripts, operational workflows.

Responsibilities

Lead technical response during critical service incidents, build early-warning and real-time visibility using observability platforms, develop dashboards and alert thresholds, conduct structured root-cause analysis, implement automation-driven remediation steps, maintain and prioritise a continuity backlog, create runbooks and playbooks, provide continuity insights to leadership.

Seniority

Mid-Senior, hands-on IC

Sourced via workday · Listed on CareerPlan, which tracks 70,000+ jobs from 20+ sources.
Apply on Workday ↗