Senior Site Reliability Engineer - AVP
Core
Own and evolve the Observability platform ecosystem for a bank, driving OpenTelemetry standardization and automation to enhance reliability and scalability.
Role type
Senior Site Reliability Engineer (Observability Platform Owner)
Builds
Enterprise observability tool stack, telemetry pipelines, and incident management frameworks
Domain
Financial Services / Observability Engineering
Deliverable
production ML models | infrastructure
Required skills
OpenTelemetry (OTel) implementation, distributed systems architecture, Kubernetes/OpenShift administration, GCP, incident management, SLO/SLI tracking, error budget governance, automation scripting (Python/Shell/Bash), Unix server administration
Preferred skills
ITRS Geneos, New Relic, Netcool, Grafana, KDB, Terraform, Ansible, Oracle/MSSQL databases
Technologies
OpenTelemetry, Kubernetes, Openshift, Google Cloud Platform, ITRS Geneos, New Relic, Netcool, Grafana, KDB, Terraform, Ansible, Python, Shell, Bash
Responsibilities
Own availability and resilience of the Observability tool stack, drive telemetry standardization using OpenTelemetry, manage incident response and root cause analysis, implement automation and self-healing mechanisms, conduct reliability reviews and maintain error budgets
Seniority
Senior, hands-on IC