Site Reliability Engineer - AWS, Kubernetes
Core
Design, develop, and implement deployment and reliability solutions for mission-critical systems using automated CI/CD pipelines and cloud infrastructure.
Role type
Senior Site Reliability Engineer (SRE)
Builds
End-to-end operations, availability, reliability, and scalability for complex, mission-critical systems
Domain
Financial services, cloud infrastructure, and data management platforms
Required skills
Site reliability engineering (SRE) principles, incident response, capacity planning, SLI/SLO definition, Python, Ansible, Terraform, observability (Grafana, Dynatrace, Prometheus, Datadog, Splunk), Kubernetes, ECS, Docker, CI/CD (Jenkins, GitLab), network troubleshooting, infrastructure as code
Preferred skills
Experience with data management or migration platforms, enterprise AI capabilities for incident triage and pattern identification, Java, Linux, Windows
Technologies
AI, Ansible, CI/CD, Cloud, Datadog, Docker, Dynatrace, GitLab, Grafana, Jenkins, Kubernetes, Network, Prometheus, Python, Splunk, Terraform, Java, Linux, Windows
Responsibilities
Guide teammates in adopting SRE best practices and building consensus; partner with software engineers to design and implement reliability solutions; use enterprise AI for incident triage and post-incident review; implement infrastructure, configuration, and network as code; resolve complex issues and proactively address risks using SLOs; identify patterns in operational signals to reduce toil; improve application availability and scalability; evaluate new technologies to solve business problems
Seniority
Senior, hands-on IC