Site Reliability Expert
Core
Define and implement observability strategy, standards, and governance models for complex cloud-native environments to improve platform reliability and performance.
Role type
Senior Site Reliability Expert (Observability)
Builds
Production observability solutions, monitoring, alerting, and visualization platforms
Domain
Cloud-native infrastructure, distributed microservices, observability
Deliverable
production ML models | product features | dashboards & analysis
Required skills
Site Reliability Engineering (SRE), observability strategy, Service Level Indicators (SLI), Service Level Objectives (SLO), Error Budgets, symptom-based alerting, Application Performance Monitoring (APM), Real User Monitoring (RUM), distributed tracing, OpenTelemetry, microservices architecture, infrastructure as code, CI/CD pipelines
Preferred skills
Java Spring Boot, e-commerce platforms, enterprise-wide observability standards, consulting experience
Technologies
Dynatrace, Datadog, New Relic, AppDynamics, AWS, Kubernetes, Terraform, Bash, Python, GitLab CI
Responsibilities
Define observability strategy and governance standards; design and maintain monitoring/alerting solutions; implement SRE best practices (SLI/SLO/Error Budgets); collaborate with product teams to improve system reliability; analyze and resolve complex incidents in distributed architectures; mentor teams on observability practices; lead technical projects and manage priorities.
Seniority
Senior, hands-on IC with leadership responsibilities
