Senior/Staff Site Reliability Engineer - Data Center
Core
Designing, building, and operating on-prem/cloud environments and data centers to support a rapidly growing Machine Learning team.
Role type
Staff Site Reliability Engineer (Data Center)
Builds
Highly-secure on-premises environments, hybrid cloud infrastructure, and resilient data center operations.
Domain
Healthcare AI / Data Center Infrastructure / Hybrid Cloud
Deliverable
infrastructure
Required skills
Datacenter network design, physical hardware administration, virtualization/containerization, storage optimization, automation scripting, observability tooling, incident response
Preferred skills
NIST/ISO security standards, rapid scaling challenges
Technologies
iDRAC, IPMI, Nvidia UFM, Juniper Systems, EKS-Anywhere, ClusterAPI, KVM, Quobyte, S3, FSx, EFS, Ansible, RedFish, Datadog, Grafana, Prometheus
Responsibilities
Implement SRE best practices for monitoring and automation; integrate on-prem datacenter with cloud infrastructure; perform root-cause analysis and design reviews; participate in on-call rotations and incident response.
Seniority
Staff, hands-on IC with strategic impact