Site Reliability Engineer
Core
Building and operating an internal observability platform (telemetry, dashboards, alerts, service health) to improve operational reliability for engineering teams.
Role type
Senior Associate Site Reliability Engineer (Platform Engineering)
Builds
Internal observability platform, automation workflows, and self-service tooling
Domain
Financial services infrastructure / Observability
Deliverable
production ML models | product features | dashboards & analysis | infrastructure
Required skills
Production platform support, observability data analysis (metrics/logs/traces), incident response, automation, infrastructure-as-code, cloud/container/Linux/distributed systems, operational documentation
Preferred skills
OpenTelemetry, Grafana, ClickHouse, Cribl, Datadog, BigPanda, Redis, Flink, GitOps, CI/CD, SLO/SLI definition, telemetry pipeline management, regulated financial services experience
Technologies
OpenTelemetry, Grafana, ClickHouse, Cribl, Datadog, BigPanda, Redis, Flink, Git, CI/CD pipelines
Responsibilities
Monitor platform health and diagnose issues, support incident response and root cause analysis, improve automation and GitOps workflows, maintain documentation and onboarding guides, provide enablement on telemetry standards and SLO practices
Seniority
Senior Associate, hands-on IC