Incident Management Reliability Engineer
Core
Lead end-to-end management of Major Incidents (P1/P2) and drive reliability engineering initiatives to safeguard critical IT services for a global biopharmaceutical company.
Role type
Senior Incident Management Reliability Engineer
Builds
Resilient IT infrastructure and incident response processes for global biopharmaceutical operations
Domain
Biopharmaceutical / IT Operations / Reliability Engineering
Required skills
Incident management, Reliability engineering, Networking, Infrastructure as code, Cloud technologies, Virtualization, Containerization, Automation, Databases, Middleware
Preferred skills
AIOps, SLO/SLI/SLA definition, Capacity planning, Change management, Failure mode analysis, Scripting
Technologies
AWS, Azure, GCP, AIOps tools
Responsibilities
Partner as command centre lead during critical outages, Drive post-incident reviews and root cause elimination, Implement proactive monitoring and automated recovery mechanisms, Define and track SLOs/SLIs/SLAs, Automate operational tasks using scripts and runbooks, Facilitate cross-functional troubleshooting for complex technical issues
Seniority
Senior, hands-on IC