Site Reliability Engineer
Core
Maintain availability, performance, and reliability of critical SaaS applications on Azure across multi-cloud, multi-region environments.
Role type
Senior Site Reliability Engineer (Azure)
Builds
Production SaaS applications on Azure (AKS, App Service, Redis, SQL, Service Bus)
Domain
Cloud Infrastructure / SaaS / Identity Security
Deliverable
production ML models | product features | dashboards & analysis | infrastructure
Required skills
Azure administration, Kubernetes (AKS), cloud networking, incident response, automation scripting, monitoring and logging, disaster recovery
Preferred skills
AWS Cloud Platform, CI/CD tools (Azure DevOps), infrastructure-as-code (Terraform, ARM templates), SaaS regional tenant architectures
Technologies
Azure, AKS, App Service, Redis, SQL, Service Bus, Datadog, Azure Monitor, ELK stack, PowerShell, Python
Responsibilities
Own availability and performance of production SaaS applications; Lead troubleshooting and resolution of cloud infrastructure and application issues; Participate in on-call rotation and drive incident response; Drive improvements to disaster recovery, failover, and incident management processes; Build and maintain automation scripts and monitoring tools; Author post-incident reviews (RCAs) and drive preventive action items; Partner with senior engineers to implement reliability and observability best practices
Seniority
Senior, hands-on IC