Senior Engineer, Reliability
Core
Ensure reliability, availability, and performance of enterprise observability platforms and supporting applications through proactive monitoring, incident response, and platform maintenance.
Role type
Senior Site Reliability Engineer (Observability & Platform Stability)
Builds
Enterprise observability platforms, production support environments, and CI/CD pipelines
Domain
Financial Services / Enterprise Observability & Platform Engineering
Deliverable
production ML models | product features | dashboards & analysis | infrastructure
Required skills
SRE, platform engineering, production support, enterprise application operations, AWS, Dynatrace, ELK, ServiceNow, SolarWinds, incident triage, root cause analysis, change management, release management, runbook documentation
Preferred skills
Financial services experience, CI/CD pipeline implementation, observability platform support, global delivery team collaboration
Technologies
AWS, Dynatrace, ELK, ServiceNow, SolarWinds
Responsibilities
Partner with Product Owners and engineering teams for operational and release support; Troubleshoot application and platform issues to restore services; Conduct health checks and performance assessments to identify operational risks; Execute platform changes through established SDLC and release management processes; Maintain runbooks, support documentation, and incident playbooks; Collaborate with Platform Engineering and DevOps teams to mature CI/CD practices
Seniority
Senior, hands-on IC