Site Reliability Engineer
Core
Build reliable, scalable, and high-performing products by improving system reliability, operational efficiency, and cost effectiveness through automation, monitoring, and data-driven insights.
Role type
Senior Site Reliability Engineer (Cloud/DevOps)
Builds
Infrastructure as code solutions, CI/CD pipelines, monitoring solutions, and automated incident detection/resolution systems.
Domain
Cloud infrastructure (AWS) and data platform operations
Deliverable
production ML models | product features | infrastructure
Required skills
AWS workload management, ECS/EKS cluster administration, Infrastructure-as-Code (Terraform), CI/CD pipeline design, root cause analysis, cost optimization, vulnerability management, high availability architecture, disaster recovery planning
Preferred skills
Data-driven performance tuning, intelligent alarming configuration, cross-functional collaboration with data teams, policy development
Technologies
AWS, ECS, EKS, Terraform, Jenkins
Responsibilities
Design and implement IaC solutions and CI/CD pipelines; implement monitoring and intelligent alarming for incident detection; manage infrastructure and application vulnerabilities; troubleshoot production and non-production environments; optimize platform performance and costs; develop and adhere to operational policies.
Seniority
Senior, hands-on IC