Engineer III, Systems Reliability Engineering
Core
Lead operational excellence, reliability, observability, automation, and AI-enabled operations for the global Planning and Allocation ecosystem.
Role type
Senior IC Site Reliability Engineer (SRE)
Builds
Scalable SRE operating model for business-critical planning and allocation platforms
Domain
Retail supply chain, planning, allocation, forecasting, ERP
Deliverable
production ML models
Required skills
Incident response, root cause analysis, service restoration, observability, monitoring, logging, SLOs, SLIs, DevSecOps, automation, AI-assisted operations, Infrastructure as Code, CI/CD, Azure services, API management, scripting
Preferred skills
Coaching and team building, hiring and onboarding, self-healing workflows, continuous improvement
Technologies
Azure, SAP, SAS, middleware
Responsibilities
Lead incident response and service restoration; Build and coach the India-based SRE team; Establish observability and reliability measurements; Drive DevSecOps and AI-assisted operations; Partner with engineering and business teams to manage releases and risks