Site Reliability Engineering Lead
Core
Lead a team of Site Reliability Engineers to ensure the reliability, scalability, security, and operational excellence of mission-critical insurance technology platforms.
Role type
Senior IC Site Reliability Engineering Lead (People Management)
Builds
Cloud-native services, observability platforms, and automation frameworks for insurance risk solutions.
Domain
Insurance technology, Cloud Engineering, Site Reliability Engineering
Deliverable
production ML models | product features | infrastructure
Required skills
Site Reliability Engineering, Cloud Engineering, DevOps, Kubernetes, Infrastructure as Code, Observability, CI/CD, Scripting/Programming
Preferred skills
FinOps, Chaos Engineering, Secret Management, Regulated Environment Compliance
Technologies
Azure, AWS, Kubernetes, Terraform, Ansible, Grafana, Prometheus, OpenTelemetry, Splunk, Dynatrace, Datadog, Docker, Jenkins, GitLab, GitHub, Python, Go, PowerShell, Bash, C#
Responsibilities
Lead and mentor a team of Site Reliability Engineers; Define and drive SRE strategy, standards, and operational frameworks; Partner with product teams to improve application reliability and scalability; Establish and maintain SLOs, SLIs, and error budgets; Lead major incident management and post-incident reviews; Drive cloud modernization and application migrations; Champion automation and Infrastructure as Code practices; Develop and implement observability strategies; Collaborate with security teams on compliance; Lead architecture reviews for cloud-native designs; Drive capacity planning and cost management.
Seniority
Senior, hands-on IC with people management