Senior Site Reliability Engineer - Observability
Core
Operations owner of on-premises observability platforms (ELK Stack, Grafana) ensuring reliability, scalability, and evolution of tools for engineering visibility.
Role type
Senior Site Reliability Engineer (Observability)
Builds
On-premises ELK Stack, Grafana dashboards, alerting patterns, and automation tooling for platform modernization.
Domain
On-premises infrastructure, Observability, Platform Engineering
Deliverable
production ML models | product features | dashboards & analysis | infrastructure
Required skills
Elasticsearch cluster operations, Logstash pipeline development, Kibana, Grafana dashboard design, SLO management, Python for automation, Linux systems administration, Infrastructure as Code (Terraform, Helm, Ansible), capacity planning, incident management
Preferred skills
Prometheus, New Relic administration, OpenTelemetry, log shipping agents (Beats, Fluentd, Fluent Bit), cloud-based observability strategies
Technologies
Elasticsearch, Logstash, Kibana, Grafana, New Relic, SolarWinds, Terraform, Helm, Ansible, Python, Linux
Responsibilities
Serve as primary escalation point for production support involving ELK Stack and Grafana; Own platform health, capacity planning, and performance tuning for on-premises observability infrastructure; Monitor and maintain SLOs for observability platforms; Design and build tooling/automation to reduce toil; Lead platform modernization initiatives; Develop and maintain infrastructure-as-code for platform components
Seniority
Senior, hands-on IC