Site Reliability Engineer II
Core
Monitor and maintain performance, availability, and stability of enterprise-level applications and IT infrastructure.
Role type
Site Reliability Engineer (Monitoring & Incident Management)
Builds
Production monitoring dashboards, alerting systems, and incident response workflows for enterprise applications.
Domain
Fintech / Enterprise IT Infrastructure
Deliverable
production ML models | product features | dashboards & analysis | infrastructure
Required skills
Linux/Unix fundamentals, monitoring tools administration, incident management, ITIL principles, network monitoring, database monitoring, storage monitoring, scripting, logical analysis
Preferred skills
Advanced alert creation and fine-tuning, 24/7 shift adaptability
Technologies
Datadog, ELK, Grafana, Prometheus
Responsibilities
Administer monitoring tools, perform scheduled job monitoring, manage incidents, facilitate outage communication, monitor servers/networks/databases/storage, troubleshoot infrastructure issues, maintain monitoring dashboards, prepare status reports, implement escalation procedures
Seniority
Mid-level, hands-on IC
