Senior Site Reliability Engineer
Core
Ensure high availability and reliability of a global financial analysis platform serving 100M+ users by managing production incidents, observability, and service health.
Role type
Senior Site Reliability Engineer (SRE)
Builds
Production environment delivery, new service commissioning, and operational automation for a global financial platform.
Domain
Fintech / Distributed Systems / Observability
Deliverable
production ML models | product features | dashboards & analysis | infrastructure
Required skills
Production incident investigation, Root cause analysis (RCA), Monitoring and observability, SLI/SLO definition, Distributed systems knowledge, Automation scripting, Runbook creation, Capacity planning
Preferred skills
Kubernetes administration (CKA/CKAD), Prometheus/Grafana/OpenTelemetry, Google Four Golden Signals, AI-assisted diagnostics, Incident management processes
Technologies
Kubernetes, Prometheus, Grafana, OpenTelemetry, Distributed tracing systems
Responsibilities
Investigate and resolve production incidents, Perform root cause analysis and postmortem reviews, Develop and improve monitoring and alerting systems, Define and maintain SLI/SLOs and service health objectives, Automate operational workflows and diagnostics, Create and maintain runbooks and operational documentation, Analyze service performance and capacity risks, Train duty engineers on tools and best practices
Seniority
Senior, hands-on IC
