Software Engineering Manager-Site Reliability Center-Twilight
Core
Lead a Site Reliability Engineering (SRE) team to ensure the reliability, scalability, and operational excellence of mission-critical platforms powering digital experiences.
Role type
Senior IC Site Reliability Engineering Manager
Builds
Stable, reliable, and secure distributed systems and platforms
Domain
Banking/Finance + Site Reliability Engineering/DevOps
Deliverable
production ML models | product features | dashboards & analysis | infrastructure
Required skills
Site Reliability Engineering, incident management, root cause analysis, change management, automation, observability, team leadership, production support, capacity planning
Preferred skills
OCP, MongoDB, Cassandra, Elasticsearch, Redis, MQ, Kafka
Technologies
Linux, Windows, Oracle, SQL, Dynatrace, BigPanda, Logscale
Responsibilities
Manage and develop SRE teams; lead incident response and post-incident analysis; drive root cause resolution and systemic improvements; oversee change management and release execution; advance monitoring, alerting, and observability frameworks; champion resiliency, disaster recovery, and performance optimization; lead 24x7 production support models; drive automation to reduce operational toil; ensure governance, risk, and compliance adherence.
Seniority
Senior, hands-on IC with management responsibilities