Senior Site Reliability Engineer (AWS)
Core
Design, build, and operate highly reliable, scalable, and secure platforms supporting business-critical applications across hybrid (on-prem and cloud) environments.
Role type
Senior Site Reliability Engineer (AWS)
Builds
High-availability, fault-tolerant architectures; self-healing automation; end-to-end observability; CI/CD pipelines; secure cloud platforms on AWS.
Domain
Cloud Infrastructure & Platform Engineering
Deliverable
production ML models | product features | infrastructure
Required skills
Python, Java, Linux/Unix, AWS, Terraform, Infrastructure as Code, Networking, Distributed Systems, SLO/SLI definition, Root Cause Analysis, Capacity Planning, FinOps
Preferred skills
Kubernetes/EKS at scale, Chaos Engineering, Financial services domain experience, Legacy system refactoring
Technologies
AWS (EKS, EC2, RDS/Aurora, Lambda, API Gateway, CloudFront, WAF, ALB/NLB, CloudWatch, X-Ray, IAM, Secrets Manager), Terraform, Chef
Responsibilities
Design and implement high-availability, fault-tolerant architectures across on-prem and cloud platforms; Lead multi-region DR planning, implementation, and testing; Build and maintain infrastructure using Terraform and configuration management tools; Design and implement end-to-end observability (metrics, logs, traces, synthetic monitoring); Engineer and operate platforms on AWS including EKS, EC2, RDS/Aurora, Lambda, API Gateway; Identify and resolve performance bottlenecks through testing and analysis; Design and support CI/CD pipelines enabling safe, repeatable deployments.
Seniority
Senior, hands-on IC