CareerPlanSign in

Site Reliability Engineer - AWS, Kubernetes

USA💼 Full-time💰 $61,000–$61,000🗓 2026-09-09 → 2026-10-02

Core

Design, develop, and implement deployment and reliability solutions for mission-critical systems using automated CI/CD pipelines and cloud infrastructure.

Role type

Senior Site Reliability Engineer (SRE)

Builds

End-to-end operations, availability, reliability, and scalability for complex, mission-critical systems

Domain

Financial services, cloud infrastructure, and data management platforms

Required skills

Site reliability engineering (SRE) principles, incident response, capacity planning, SLI/SLO definition, Python, Ansible, Terraform, observability (Grafana, Dynatrace, Prometheus, Datadog, Splunk), Kubernetes, ECS, Docker, CI/CD (Jenkins, GitLab), network troubleshooting, infrastructure as code

Preferred skills

Experience with data management or migration platforms, enterprise AI capabilities for incident triage and pattern identification, Java, Linux, Windows

Technologies

AI, Ansible, CI/CD, Cloud, Datadog, Docker, Dynatrace, GitLab, Grafana, Jenkins, Kubernetes, Network, Prometheus, Python, Splunk, Terraform, Java, Linux, Windows

Responsibilities

Guide teammates in adopting SRE best practices and building consensus; partner with software engineers to design and implement reliability solutions; use enterprise AI for incident triage and post-incident review; implement infrastructure, configuration, and network as code; resolve complex issues and proactively address risks using SLOs; identify patterns in operational signals to reduce toil; improve application availability and scalability; evaluate new technologies to solve business problems

Seniority

Senior, hands-on IC

Sourced via devitjobs · Listed on CareerPlan, which tracks 937,000+ jobs from 20+ sources.