Site Reliability Engineer
Core
Design, optimize, and operate reliable CI/CD pipelines and Kubernetes production clusters to ensure platform reliability, scalability, and performance for cloud-native infrastructure.
Role type
Senior Site Reliability Engineer (Cloud-Native)
Builds
Resilient cloud-native services and automated operational workflows for data security and AI data management platforms.
Domain
Cybersecurity / Data Privacy / Cloud Infrastructure
Deliverable
production ML models | infrastructure
Required skills
Kubernetes (EKS), AWS, GCP, Terraform, CI/CD pipelines, Python, Bash, Groovy, Observability (Datadog), Incident Management, Capacity Planning, Root Cause Analysis
Preferred skills
REST API automation and testing methodologies
Technologies
Amazon EKS, AWS, GCP, Terraform, Datadog, Jenkins, GitLab CI, GitHub Actions, MongoDB
Responsibilities
Design and optimize CI/CD pipelines for deployment safety and automation; Operate and improve Kubernetes production clusters; Build and maintain Infrastructure as Code solutions; Research new technologies and provide technical direction; Identify operational gaps and drive automation initiatives; Partner with engineering teams to define reliability practices; Own SRE practices including incident response and SLO-driven monitoring.
Seniority
Senior, hands-on IC