Service Reliability Engineer
Core
Ensure the reliability, scalability, and performance of critical global systems connecting artists and fans.
Role type
Service Reliability Engineer (SRE)
Builds
Critical services, monitoring/observability systems, automation scripts, CI/CD pipelines
Domain
Music industry, cloud infrastructure, distributed systems
Deliverable
production ML models | product features | dashboards & analysis | infrastructure
Required skills
Linux/Windows systems administration, Python/Go/Java programming, AWS/GCP/Azure cloud platforms, Docker/Kubernetes, Terraform/Ansible, Prometheus/Grafana/Datadog/Splunk/Dynatrace, incident management, root cause analysis, SLO/error budget design
Preferred skills
ITIL governance, ServiceNow, chaos engineering, resilience testing, advanced capacity planning
Technologies
AWS, GCP, Azure, Docker, Kubernetes, Terraform, Ansible, Prometheus, Grafana, Datadog, Splunk, Dynatrace, Python, Go, Java, ServiceNow
Responsibilities
Design and maintain availability, scalability, and performance of critical services; develop monitoring, alerting, and observability systems; automate operational tasks including infrastructure provisioning and deployments; support and optimize CI/CD pipelines; participate in on-call rotation for production incidents; lead post-incident reviews and root cause analyses; partner with engineering teams to embed SRE best practices
Seniority
Mid-to-Senior, hands-on IC