Lead Engineer, Site Reliability Engineering
Core
Lead SRE for Mastercard's Payments Network, ensuring runtime availability, scalability, and resilience of core payment systems supporting national infrastructure.
Role type
Senior IC Site Reliability Engineer (Payments Network)
Builds
High-availability payment infrastructure, observability dashboards, and automated self-healing capabilities for critical core systems.
Domain
Financial Services / Payments Network Infrastructure
Deliverable
production ML models | infrastructure
Required skills
Infrastructure troubleshooting, observability (Splunk, Dynatrace, Prometheus, Grafana, ELK/EFK, OpenTelemetry), packet-level debugging (tcpdump, Wireshark), automation (Chef, Ansible, Terraform), capacity forecasting, incident management, SLI/SLO definition, vendor POC testing.
Preferred skills
Experience with network telemetry tools (SolarWinds, NetScout), AI technologies for proactive issue detection, disaster recovery planning.
Technologies
Splunk, Dynatrace, SolarWinds, NetScout, tcpdump, Wireshark, Chef, Ansible, Terraform, Prometheus, Grafana, ELK/EFK, OpenTelemetry, JSON, YAML
Responsibilities
Lead continuous assessments of application infrastructure health and performance; champion observability by designing unified monitoring strategies; lead incident reviews and root cause analysis; develop testing and validation plans for environment builds and disaster recovery; evaluate vendor upgrade roadmaps and conduct POC testing; lead training initiatives on networking aspects of the platform.
Seniority
Senior, hands-on IC with on-call responsibilities