Lead Site Reliability Engineer
Core
Lead SRE responsible for operating and improving Azure-based SaaS platform reliability, scalability, and operational excellence for client environments.
Role type
Lead Site Reliability Engineer (IC with mentorship)
Builds
Azure-based SaaS platform, Kubernetes/container platforms, CI/CD pipelines, monitoring and automation systems
Domain
FinTech, Cloud Infrastructure, SaaS
Deliverable
production ML models | infrastructure
Required skills
Kubernetes, CI/CD, cloud infrastructure management, SLI/SLO/SLA definition, incident response, root cause analysis, cost optimization (FinOps), capacity planning, automation development, AI-driven engineering tooling
Preferred skills
AI-assisted anomaly detection, automated remediation, AI-supported incident triage
Technologies
Azure, Kubernetes, CI/CD tools, AI/ML tooling
Responsibilities
Build and operate cloud infrastructure and container platforms; define and manage error budgets; lead cost optimization initiatives; design reliability and scalability strategies; manage incident response and root cause analysis; develop monitoring and automation systems; mentor junior SREs; participate in on-call rotations
Seniority
Senior, hands-on IC with mentorship responsibilities