Site Reliability Engineer (SRE) - AI Platform & Cloud
Core
Operate, monitor, and maintain infrastructure supporting GenAI applications (training, inference, feature store, data ingestion, model serving) in a regulated financial environment.
Role type
Director-level Site Reliability Engineer (SRE)
Builds
AI/ML platform infrastructure including GPU clusters, Kubernetes orchestration, and data pipelines
Domain
Financial Services / Artificial Intelligence / Cloud Infrastructure
Deliverable
production ML models
Required skills
Kubernetes, Infrastructure-as-Code (Terraform/Helm), Python/Go/Java, GPU cluster management, Observability (Prometheus/Grafana), Capacity planning, Incident response, Automation scripting
Preferred skills
Generative AI development, ModelOps/ML Ops, Chaos engineering, High-performance computing (HPC), Distributed GPU scheduling
Technologies
Kubernetes, AWS/Azure/Google Cloud, Docker, Terraform, Helm, Prometheus, Grafana, Kafka, Spark, Slurm
Responsibilities
Operate and maintain infrastructure for GenAI workloads; Design automation to reduce manual toil; Develop and maintain Infrastructure-as-Code; Establish and monitor SLOs/SLIs/SLAs; Lead incident response and root cause analysis; Perform capacity planning and scaling strategies; Optimize cost vs. performance tradeoffs; Harden systems for security and compliance; Collaborate on safe deployment and rollback of new systems; Define disaster recovery strategies; Maintain operational documentation; Participate in 24/7 on-call rotations; Evaluate and integrate new tools for platform reliability
Seniority
Director, hands-on IC with strategic oversight