Site Reliability Engineer
Core
Build and improve LSEG's internal observability platform to provide telemetry, dashboards, alerts, and service health insights for engineering teams.
Role type
Senior Site Reliability Engineer (Platform Engineering)
Builds
Internal observability platform (telemetry, dashboards, alerts, service health views)
Domain
Financial services infrastructure / Observability
Deliverable
production ML models | product features | dashboards & analysis | infrastructure
Required skills
production platform support, observability data analysis (metrics/logs/traces), incident response, automation, infrastructure-as-code, cloud/container/Linux/networking, operational documentation
Preferred skills
OpenTelemetry, Grafana, ClickHouse, Cribl, Datadog, BigPanda, Redis, Flink, GitOps workflows, SLO/SLI definition, telemetry pipeline management, regulated financial services environment experience
Technologies
OpenTelemetry, Grafana, ClickHouse, Cribl, Datadog, BigPanda, Redis, Flink, Git, CI/CD
Responsibilities
Monitor platform health and diagnose issues, contribute to service readiness via dashboards and SLOs, support incident response and root cause analysis, improve automation and GitOps workflows, maintain documentation and self-service tooling
Seniority
Senior, hands-on IC