Software Engineering Manager-Site Reliability
Core
Lead a team of Site Reliability Engineers to ensure the reliability, scalability, and operational excellence of mission-critical platforms powering digital experiences.
Role type
Senior IC manager (Site Reliability Engineering)
Builds
Stable, reliable, and secure distributed systems and platforms
Domain
Financial services / Site Reliability Engineering / Cloud Infrastructure
Deliverable
production ML models | product features | dashboards & analysis | infrastructure
Required skills
Site Reliability Engineering, Production Support, DevOps, incident management, problem management, change management, monitoring tools, cloud/infrastructure platforms, automation, Linux/Windows, OCP, databases (Oracle, SQL, MongoDB, Cassandra), Elasticsearch, Redis, MQ, Kafka
Preferred skills
Leading teams in high-availability environments, improving system reliability and observability, reducing operational toil
Technologies
Dynatrace, BigPanda, Logscale, OCP, Linux, Windows, Oracle, SQL, MongoDB, Cassandra, Elasticsearch, Redis, MQ, Kafka
Responsibilities
Manage and develop SRE teams; provide after-hours operational leadership and on-call support; lead incident management and remediation for major incidents; drive problem management and root cause resolution; oversee change management and release execution; advance monitoring, alerting, and observability; champion resiliency, stability, and availability; enable scalability and performance optimization; lead global 24x7 operations; drive automation and operational efficiency; ensure governance, risk, and compliance
Seniority
Senior, hands-on IC with management responsibilities