SRE Engineer II
Core
Build, deploy, scale, and operate highly reliable distributed systems across multiple geographic regions to ensure high availability and performance.
Role type
Senior Site Reliability Engineer (SRE)
Builds
Kubernetes-based infrastructure for large-scale applications
Domain
Cybersecurity / Cloud Infrastructure
Deliverable
infrastructure
Required skills
Kubernetes, Terraform, AWS (EKS, VPC, S3, ECR, IAM), Helm charts, Bash scripting, CI/CD pipelines, distributed systems, containerization, microservices, observability, incident response, root cause analysis
Preferred skills
Golang, Python, Grafana, Prometheus, Loki, multi-region deployments
Technologies
Kubernetes, Terraform, AWS, Helm, Grafana, Prometheus, Loki, Bash
Responsibilities
Deploy and manage distributed platforms across multiple regions; Design and maintain Kubernetes-based infrastructure; Build and manage Helm charts; Monitor system health and resolve issues; Improve system reliability through automation; Handle large-scale deployments; Collaborate on CI/CD and production readiness; Implement observability and alerting; Troubleshoot production issues and perform root cause analysis; Write and maintain run books.
Seniority
Mid-Senior, hands-on IC