Lead Principal Site Reliability Engineer
Core
Define and shape SRE strategy for large-scale, distributed, business-critical platforms, ensuring reliability, scalability, and resilience.
Role type
Lead Principal Site Reliability Engineer (Strategy & Hands-on IC)
Builds
Highly available production systems, automation tools, observability strategies, and self-healing capabilities for enterprise-scale cloud services.
Domain
Cloud Infrastructure & Distributed Systems
Required skills
Distributed systems architecture, Cloud platform expertise (OCI/AWS/Azure/GCP), Container orchestration (Kubernetes/Docker), Infrastructure as Code (Terraform/Ansible), Observability (metrics/logs/traces), Programming/Scripting (Python/Go/Java/Bash), CI/CD pipelines, Incident management, Capacity planning, Resilience testing.
Preferred skills
Service-level objective definition, Chaos engineering, Multi-region/hybrid-cloud architecture, Security compliance frameworks, Cloud cost optimization, Open-source contributions.
Technologies
Ansible, Azure, Bash, Cloud, Docker, Incident Management Support, Java, JavaScript, Kubernetes, Oracle, Puppet, Python, Security, Terraform, Web, DevOps
Responsibilities
Define SRE strategy and reliability standards; Mentor SREs and engineering teams; Lead technical reviews and incident response; Design observability and automation strategies; Conduct capacity planning and resilience testing; Partner with security and compliance teams.
Seniority
Principal, Strategy & Mentorship