Staff Site Reliability Engineer (SRE)
Core
Founding Site Reliability Engineer establishing governance, automation, and standards for autonomous vehicle software reliability.
Role type
Staff SRE (0-1 program builder)
Builds
Shared reliability tooling, automation, service catalogs, SLOs, and error budget frameworks for autonomous driving systems.
Domain
Autonomous vehicles / Robotics / High-consequence production systems
Deliverable
production ML models | infrastructure
Required skills
SRE practices, distributed systems engineering, Go/Python/Java/C++, Linux, Kubernetes, cloud infrastructure, CI/CD, observability, SLI/SLO definition, error budget management, incident command/response, toil reduction, consensus building.
Preferred skills
Autonomous vehicle/robotics experience, hybrid cloud/on-prem environments, data/ML platforms, policy-as-code, game days/failure injection.
Technologies
Kubernetes, Linux, Go, Python, Java, C++, Cloud Infrastructure, CI/CD, Observability tools
Responsibilities
Co-found SRE practice and define reliability standards; Build shared reliability tooling and automation; Drive incident excellence and post-incident practices; Partner with service owners to define SLIs/SLOs; Convert manual operational work into reusable software.
Seniority
Staff, hands-on IC with program ownership