Reliability Engineer 3 (Observability Specialist)
Core
Own and drive the enterprise Observability Strategy, defining SLIs/SLOs, architecting scalable telemetry solutions, and establishing governance frameworks to improve service reliability and customer experience.
Role type
Senior Reliability Engineer (Observability Specialist)
Builds
Enterprise observability platforms, service health reporting, and reliability standards for multi-system products
Domain
Financial Services / Observability Engineering
Deliverable
production ML models | product features | dashboards & analysis
Required skills
Observability Engineering, SRE, Reliability Engineering, SLIs/SLOs/Error Budgets, APM/RUM/Synthetics, Distributed Systems, Kubernetes, Incident Analysis/RCA
Preferred skills
Expertise in Observability Engineering, Stakeholder Management, Technical Leadership, Cloud Platforms
Technologies
Datadog, Dynatrace, Splunk, Grafana, Prometheus, New Relic, Elastic, OpenTelemetry
Responsibilities
Define and govern enterprise-wide SLIs, SLOs, Error Budgets, and Reliability Standards; Architect scalable observability solutions leveraging telemetry, distributed tracing, and APM; Lead design of executive and operational service health reporting; Provide senior technical leadership and mentorship for observability engineering practices
Seniority
Senior, hands-on IC with strategic influence