CareerPlanSign in

Site Reliability Engineer

Memphis, TN💼 Full-time🗓 2026-09-02 → 2026-09-26

Core

Design campus monitoring architecture, lead cross-discipline incident response, and build reliability guardrails for compute, network, storage, power, and cooling systems.

Role type

Senior Site Reliability Engineer (Campus Reliability)

Builds

Campus-wide observability, incident response playbooks, and reliability guardrails for data center infrastructure

Domain

Data center operations / High-performance computing infrastructure

Deliverable

production ML models | infrastructure

Required skills

Incident command and technical leadership, Fleet-scale monitoring and observability design, Playbook and runbook creation, Error budget and SLO definition, Cross-functional collaboration, Scripting (Python, Bash), Systems programming (C, C++, Java, Go, Rust)

Preferred skills

AI/ML or supercomputing infrastructure experience, Data center hardware and plant signals familiarity, Game days and dependency mapping

Technologies

Python, Bash, C, C++, Java, Go, Rust

Responsibilities

Own monitoring architecture and signal quality, Provide SEV command support, Run blameless postmortems, Lead cross-functional reliability projects, Build and maintain playbooks, Define error budgets and availability objectives

Seniority

Senior, hands-on IC

Sourced via greenhouse · Listed on CareerPlan, which tracks 70,000+ jobs from 20+ sources.