Staff Site Reliability Engineer, Ads
Core
Define technical leadership for reliability initiatives across Reddit's advertising ecosystem, including ad serving, auctions, targeting, and billing.
Role type
Staff Site Reliability Engineer (Ads Infrastructure)
Builds
Platforms, tooling, and automation to improve reliability and developer productivity at scale for revenue-generating ad systems.
Domain
Internet / Advertising Technology / Distributed Systems
Deliverable
production ML models | product features | infrastructure
Required skills
Site Reliability Engineering, large-scale distributed systems, cloud-native architectures, high-availability system design, Go, observability (metrics, logging, tracing), SLOs, incident management, performance optimization, technical leadership, cross-functional collaboration.
Preferred skills
Advertising technology platforms, real-time auctions, budget pacing, campaign delivery, measurement, attribution, billing systems, high-QPS low-latency services, Kubernetes, Kafka, ClickHouse, Spark, Flink, BigQuery, machine learning inference, recommendation systems.
Responsibilities
Lead reliability initiatives across multiple Ads domains; partner with engineering leadership to develop reliability roadmaps; design and build platforms and automation; drive architecture reviews; participate in on-call rotations and lead incident investigations; identify systemic reliability risks; establish reliability metrics for user journeys; mentor engineers; influence roadmap planning.
Seniority
Staff, hands-on IC with strategic leadership
