Site Reliability Engineer - Identity & Access Management
Core
Maintain, monitor, support, and upgrade Identity & Access Management (IAM) systems and processes for digital products, ensuring high availability and reliability.
Role type
Site Reliability Engineer (IAM)
Builds
IAM platforms and services for digital products
Domain
Identity & Access Management, Cloud Infrastructure, IT Operations
Deliverable
production ML models | product features | dashboards & analysis | infrastructure
Required skills
Python, Bash, PowerShell, SQL, Linux/Unix administration, AWS/Azure/GCP, Prometheus, Grafana, ITIL Service Management, Incident Response, Root Cause Analysis, SLO/SLI/SLA management, Agile/Scrum, DevOps
Preferred skills
IAM security concepts (RBAC, ACL), Ping Authentication/Ping Federate/Ping Radius, Centrify, Ansible, Terraform, Infrastructure as Code, Chaos Engineering, TDD
Technologies
Python, Bash, PowerShell, SQL, Linux, Unix, AWS, Azure, GCP, Prometheus, Grafana, SNOW, Ansible, Terraform, Ping ID, Ping Federate, Ping Radius, Centrify
Responsibilities
Monitor system alerts and respond to incidents to meet SLAs/SLOs; perform Root Cause Analysis and create Postmortems; automate repetitive tasks and maintain monitoring/logging systems; provide expert guidance to Product, Platform, and Software Engineering teams; administer platform infrastructure and oversee change management; drive observability implementations and knowledge sharing.
Seniority
Experienced Professional