CareerPlanSign in

Lead Principal Site Reliability Engineer

USA💼 Full-time💰 $96,300–$96,300🗓 2026-09-15 → 2026-10-02

Core

Define and shape SRE strategy for large-scale, distributed, business-critical platforms, ensuring reliability, scalability, and resilience.

Role type

Lead Principal Site Reliability Engineer (Strategy & Hands-on IC)

Builds

Highly available production systems, automation tools, observability strategies, and self-healing capabilities for enterprise-scale cloud services.

Domain

Cloud Infrastructure & Distributed Systems

Required skills

Distributed systems architecture, Cloud platform expertise (OCI/AWS/Azure/GCP), Container orchestration (Kubernetes/Docker), Infrastructure as Code (Terraform/Ansible), Observability (metrics/logs/traces), Programming/Scripting (Python/Go/Java/Bash), CI/CD pipelines, Incident management, Capacity planning, Resilience testing.

Preferred skills

Service-level objective definition, Chaos engineering, Multi-region/hybrid-cloud architecture, Security compliance frameworks, Cloud cost optimization, Open-source contributions.

Technologies

Ansible, Azure, Bash, Cloud, Docker, Incident Management Support, Java, JavaScript, Kubernetes, Oracle, Puppet, Python, Security, Terraform, Web, DevOps

Responsibilities

Define SRE strategy and reliability standards; Mentor SREs and engineering teams; Lead technical reviews and incident response; Design observability and automation strategies; Conduct capacity planning and resilience testing; Partner with security and compliance teams.

Seniority

Principal, Strategy & Mentorship

Sourced via devitjobs · Listed on CareerPlan, which tracks 928,000+ jobs from 20+ sources.