Site Reliability Engineer (SRE)
Core
Ensure availability, stability, and performance of production services through automation, observability, and security integration.
Role type
Mid-level Site Reliability Engineer (SRE) / DevSecOps
Builds
Production infrastructure, CI/CD pipelines, and resilient cloud architectures
Domain
Financial technology, Cloud infrastructure, DevSecOps
Deliverable
production ML models | product features | dashboards & analysis | infrastructure
Required skills
Cloud platform management (AWS, GCP, Azure), Container orchestration (Docker, Kubernetes), Infrastructure as Code (Terraform), CI/CD pipeline management, Linux administration, Scripting (Bash, Python, Go), Incident management and root cause analysis, Monitoring and observability tools (Datadog, Grafana, Prometheus, New Relic)
Preferred skills
OpenTelemetry, CloudFormation, Disaster recovery strategies (DRP), High availability design
Technologies
AWS, GCP, Azure, Docker, Kubernetes, Terraform, GitHub Actions, GitLab CI, Jenkins, Datadog, Grafana, Prometheus, New Relic, Bash, Python, Go
Responsibilities
Operate, automate, and maintain production infrastructure; Implement and maintain monitoring and observability solutions; Manage production incidents and execute root cause analysis; Maintain CI/CD pipelines and implement Infrastructure as Code; Collaborate with development teams to integrate reliability and security practices
Seniority
Mid-level, hands-on IC