CareerPlanGet AI match score →

Senior Site Reliability Engineer - Observability

2 Locations💼 Full-time🗓 2026-05-18 → 2026-07-31

Core

Operations owner of on-premises observability platforms (ELK Stack, Grafana) ensuring reliability, scalability, and evolution of tools for engineering visibility.

Role type

Senior Site Reliability Engineer (Observability)

Builds

On-premises ELK Stack, Grafana dashboards, alerting patterns, and automation tooling for platform modernization.

Domain

On-premises infrastructure, Observability, Platform Engineering

Deliverable

production ML models | product features | dashboards & analysis | infrastructure

Required skills

Elasticsearch cluster operations, Logstash pipeline development, Kibana, Grafana dashboard design, SLO management, Python for automation, Linux systems administration, Infrastructure as Code (Terraform, Helm, Ansible), capacity planning, incident management

Preferred skills

Prometheus, New Relic administration, OpenTelemetry, log shipping agents (Beats, Fluentd, Fluent Bit), cloud-based observability strategies

Technologies

Elasticsearch, Logstash, Kibana, Grafana, New Relic, SolarWinds, Terraform, Helm, Ansible, Python, Linux

Responsibilities

Serve as primary escalation point for production support involving ELK Stack and Grafana; Own platform health, capacity planning, and performance tuning for on-premises observability infrastructure; Monitor and maintain SLOs for observability platforms; Design and build tooling/automation to reduce toil; Lead platform modernization initiatives; Develop and maintain infrastructure-as-code for platform components

Seniority

Senior, hands-on IC

Sourced via workday · Listed on CareerPlan, which tracks 70,000+ jobs from 20+ sources.
Apply on Workday ↗