Senior Site Reliability Engineer
Core
Designing, implementing, and maturing reliability engineering capabilities for platform services through automation, observability, and operational excellence.
Role type
Senior Site Reliability Engineer (SRE)
Builds
Production-ready platform services with high reliability, resiliency, and operational visibility
Domain
Financial services / Cloud infrastructure / Site Reliability Engineering
Deliverable
production ML models | product features | dashboards & analysis | infrastructure
Required skills
SRE principles (SLIs, SLOs, error budgets), observability design (metrics, logs, traces), automation strategy, IaC, incident management, capacity planning, CI/CD patterns
Preferred skills
AIOps platforms, predictive monitoring, event correlation, GenAI platform health monitoring, financial services domain experience
Technologies
Terraform, Ansible, synthetic monitoring, service health analytics, cloud platforms
Responsibilities
Design observability solutions and dashboards for production metrics; Develop software solutions to automate toil and improve efficiency; Partner with Dev/Infra teams to define error budgets and SLOs; Identify capacity bottlenecks and reduce manual support effort; Engage in incident triage and root cause analysis for complex issues; Champion SRE, observability, and AIOps practices; Lead intelligent operations initiatives like automated remediation and predictive monitoring; Define SLI/SLO standards and alerting policies; Develop reusable IaC modules and automation frameworks.
Seniority
Senior, hands-on IC