Site Reliability Engineer
Core
Driving reliability initiatives and promoting reliability practices across the organization for a full-stack cloud communication platform.
Role type
Site Reliability Engineer (SRE)
Builds
Internal tooling, automation scripts, dashboards, and incident management processes
Domain
Cloud communication platforms, distributed systems, incident management
Deliverable
production ML models | product features | dashboards & analysis | infrastructure
Required skills
Backend or full-stack engineering, scripting/programming (Java, Go, Python, Bash/PowerShell), system design, distributed systems, SQL/NoSQL, monitoring/logging/alerting, Linux fundamentals
Preferred skills
Client use case understanding, post-incident review leadership, SLO/SLI definition, risk analysis
Technologies
Java, Go, Python, Bash, PowerShell, SQL, NoSQL
Responsibilities
Aligning incident management processes, streamlining workflows and automating processes, creating actionable incident reports, supporting onboarding and education on reliability practices, helping teams set meaningful reliability targets, reducing operational toil through automation, troubleshooting platform-wide issues, participating in incident reviews
Seniority
Mid-level (3+ years experience)