CareerPlanSign in

Site Reliability Engineer (req-307)

Tysons, Virginia, United States💼 Full-time💰 $100,000–$100,000🗓 2026-09-22 → 2026-09-26

Core

Manage, monitor, and optimize Kubernetes clusters and cloud infrastructure to ensure reliability and scalability for clients' digital transformation and AI solutions.

Role type

Site Reliability Engineer (SRE)

Builds

Scalable, data-driven AI solutions and microservices on Kubernetes

Domain

Cloud Infrastructure & Kubernetes

Deliverable

production ML models | infrastructure

Required skills

Kubernetes, Cloud Infrastructure, Infrastructure as Code (IaC), Containerization, Monitoring & Incident Response, Automation, Security & Compliance

Preferred skills

Deep learning, natural language processing, computer vision, reinforcement learning

Technologies

Kubernetes, Docker, Terraform, CloudFormation, AWS, Azure, GCP, Jenkins, Linux, Ansible, Helm, PostgreSQL, NFS, HDFS, Ceph, Amazon S3, Apache Mesos, Yarn, Python, Java, C/C++, Ruby, JavaScript

Responsibilities

Monitor and manage Kubernetes clusters for stability and scalability; Deploy and scale applications using Helm charts and manage services; Design and maintain Docker-based microservices architecture; Configure and manage cloud infrastructure resources using IaC; Set up monitoring solutions and manage incident response; Build automation tools for infrastructure scaling and maintenance; Ensure systems follow security and compliance best practices.

Seniority

Mid-level, hands-on IC

Sourced via workable · Listed on CareerPlan, which tracks 70,000+ jobs from 20+ sources.