Senior Site Reliability Engineer - Observability
Core
Design and implement observability solutions (logging, metrics, distributed tracing, APM) for critical Payments, Treasury, and Digital Banking platforms to ensure end-to-end visibility of customer and payment journeys.
Role type
Senior Site Reliability Engineer (Observability)
Builds
Production observability pipelines, dashboards, alerting systems, and service health visibility for banking core platforms.
Domain
Financial Services / Cloud Observability
Deliverable
production ML models | product features | dashboards & analysis
Required skills
Elastic Stack (Elasticsearch, Kibana), AWS CloudWatch, Splunk Enterprise/Observability, OpenTelemetry, distributed tracing, APM, SRE principles (SLIs, SLOs, error budgets), incident management, root cause analysis
Preferred skills
AI-enabled operations, improving MTTD and MTTR
Technologies
Elasticsearch, Kibana, AWS CloudWatch, Splunk, OpenTelemetry
Responsibilities
Embed observability into architecture and engineering design; manage 24x7 production support and on-call roster for critical payment systems; execute incident response and service restoration; engineer dashboards and alerting rules.
Seniority
Senior, hands-on IC