Service Reliability Engineer
Core
Ensure reliability, scalability, and performance of critical global systems powering music services for artists and fans.
Role type
Senior Site Reliability Engineer (SRE)
Builds
Critical services, monitoring/observability systems, automation scripts, CI/CD pipelines
Domain
Music industry, cloud infrastructure, distributed systems
Required skills
Linux/Windows systems administration, Python/Go/Java programming, AWS/GCP/Azure cloud platforms, networking, Docker/Kubernetes, Terraform/Ansible, Prometheus/Grafana/Datadog/Splunk/Dynatrace, incident management, root cause analysis, SLO/error budget design
Preferred skills
Bachelor's degree in IT, ITIL governance, ServiceNow, chaos engineering, resilience testing, advanced capacity planning
Technologies
AWS, GCP, Azure, Python, Go, Java, Linux, Windows, Docker, Kubernetes, Terraform, Ansible, CloudWatch, Dynatrace, Prometheus, Grafana, Datadog, Splunk, ServiceNow
Responsibilities
Design and maintain availability and scalability of critical services; develop monitoring and alerting systems; automate operational tasks and infrastructure provisioning; troubleshoot production incidents and lead post-incident reviews; partner with engineering teams to embed SRE best practices
Seniority
Senior, hands-on IC