Site Reliability Engineer (Multiple Positions)
Core
Ensure highest availability of large-scale, fault-tolerant systems and improve reliability, scalability, and release cycles of infrastructure services.
Role type
Site Reliability Engineer (IC)
Builds
Global infrastructure services for short-form mobile video platform
Domain
Consumer social media / Distributed systems
Deliverable
production ML models | infrastructure
Required skills
System monitoring, incident response, automation, performance tuning, log analysis, runbook creation, SLA management, deployment coordination
Preferred skills
None stated
Technologies
None stated
Responsibilities
Measure and monitor availability, latency, and overall service health; Build tools, automations, and visualizations to improve reliability; Share on-call responsibility and troubleshoot problems across services; Establish design best practices for engineers and non-technical team members
Seniority
Mid-level, hands-on IC