Site Reliability Engineer
Core
Design, build, and maintain observability, monitoring, and alerting capabilities for consumer and client-facing digital platforms to ensure service reliability and reduce operational toil.
Role type
Senior Site Reliability Engineer (SRE)
Builds
Production digital platforms, monitoring dashboards, and automated remediation pipelines
Domain
Cloud-native infrastructure, distributed systems, and enterprise IT operations
Deliverable
production ML models | product features | dashboards & analysis | infrastructure
Required skills
Observability platforms (Dynatrace, AWS CloudWatch, Datadog, Grafana, Amplitude), Cloud-native architectures (AWS), Incident response (SLOs, SLIs, SLAs), Scripting (Python, Bash, PowerShell), Distributed systems troubleshooting, CI/CD tools (GitHub Actions, Jenkins, Azure DevOps), Infrastructure-as-code (Terraform, AWS CloudFormation, Ansible), Version control (GitHub, GitLab, Bitbucket)
Preferred skills
Service re-platforming guidance, Architectural decision-making based on reliability data
Technologies
AWS, Dynatrace, Datadog, Grafana, Amplitude, Python, Bash, PowerShell, Terraform, Ansible, GitHub Actions, Jenkins, Azure DevOps
Responsibilities
Design and maintain observability and monitoring capabilities; Develop dashboards for reliability metrics; Diagnose and troubleshoot distributed systems issues; Implement automation for health checks and remediation; Manage CI/CD pipeline reliability; Conduct root-cause analysis; Collaborate with Run teams on production support processes
Seniority
Senior, hands-on IC