CareerPlanSign in

Site Reliability Engineer (SRE) - AI Platform & Cloud

Alpharetta, Georgia, United States of America💼 Full-time🗓 2026-04-21 → 2026-09-26

Core

Operate, monitor, and maintain infrastructure supporting GenAI applications (training, inference, feature store, data ingestion, model serving) in a regulated financial environment.

Role type

Director-level Site Reliability Engineer (SRE)

Builds

AI/ML platform infrastructure including GPU clusters, Kubernetes orchestration, and data pipelines

Domain

Financial Services / Artificial Intelligence / Cloud Infrastructure

Deliverable

production ML models

Required skills

Kubernetes, Infrastructure-as-Code (Terraform/Helm), Python/Go/Java, GPU cluster management, Observability (Prometheus/Grafana), Capacity planning, Incident response, Automation scripting

Preferred skills

Generative AI development, ModelOps/ML Ops, Chaos engineering, High-performance computing (HPC), Distributed GPU scheduling

Technologies

Kubernetes, AWS/Azure/Google Cloud, Docker, Terraform, Helm, Prometheus, Grafana, Kafka, Spark, Slurm

Responsibilities

Operate and maintain infrastructure for GenAI workloads; Design automation to reduce manual toil; Develop and maintain Infrastructure-as-Code; Establish and monitor SLOs/SLIs/SLAs; Lead incident response and root cause analysis; Perform capacity planning and scaling strategies; Optimize cost vs. performance tradeoffs; Harden systems for security and compliance; Collaborate on safe deployment and rollback of new systems; Define disaster recovery strategies; Maintain operational documentation; Participate in 24/7 on-call rotations; Evaluate and integrate new tools for platform reliability

Seniority

Director, hands-on IC with strategic oversight

Sourced via workday · Listed on CareerPlan, which tracks 70,000+ jobs from 20+ sources.