Site Reliability Engineer
Core
Ensure high availability and reliability of digital IT products by implementing continuous improvement, automating incident response, and optimizing IT architecture.
Role type
Managerial Site Reliability Engineer
Builds
Resilient and reliable IT infrastructure for P&G digital products
Domain
IT Operations / Cloud Infrastructure
Deliverable
production ML models | infrastructure
Required skills
System administration (Linux/Unix), Cloud platforms (Azure/GCP/AWS), Infrastructure-as-code (Terraform), Programming (Python/C#), Scripting, Networking protocols, Containerization (Docker/Kubernetes), SQL, Incident response methodologies, Observability tools (Prometheus/Grafana)
Preferred skills
ServiceNow, ITIL, Root cause analysis
Technologies
Prometheus, Grafana, Terraform, Azure, GCP, AWS, Docker, Kubernetes, ServiceNow, Python, C#
Responsibilities
Implement and lead comprehensive monitoring solutions for real-time system insights; Refine monitoring strategies and develop automation scripts; Establish and maintain SLIs and SLOs; Collect and share data from observability tools to drive continuous improvement; Collaborate with Software, Product, and Infrastructure teams; Engage with customers to understand needs regarding Observability tools.
Seniority
Managerial, Entry Level