Site Reliability Engineer
Core
Design campus monitoring architecture, lead cross-discipline incident response, and build reliability guardrails for compute, network, storage, power, and cooling systems.
Role type
Senior Site Reliability Engineer (Campus Reliability)
Builds
Campus-wide observability, incident response playbooks, and reliability guardrails for data center infrastructure
Domain
Data center operations / High-performance computing infrastructure
Deliverable
production ML models | infrastructure
Required skills
Incident command and technical leadership, Fleet-scale monitoring and observability design, Playbook and runbook creation, Error budget and SLO definition, Cross-functional collaboration, Scripting (Python, Bash), Systems programming (C, C++, Java, Go, Rust)
Preferred skills
AI/ML or supercomputing infrastructure experience, Data center hardware and plant signals familiarity, Game days and dependency mapping
Technologies
Python, Bash, C, C++, Java, Go, Rust
Responsibilities
Own monitoring architecture and signal quality, Provide SEV command support, Run blameless postmortems, Lead cross-functional reliability projects, Build and maintain playbooks, Define error budgets and availability objectives
Seniority
Senior, hands-on IC