Senior Engineer - Site Reliability Engineering
Core
Build and run reliable, secure, and performant cloud services for customers, defining reliability metrics and automating delivery pipelines.
Role type
Senior Site Reliability Engineer (SRE)
Builds
Cloud services, delivery pipelines, and operational infrastructure
Domain
Financial markets infrastructure and data
Deliverable
production ML models | product features | dashboards & analysis | infrastructure
Required skills
SRE/DevOps/Platform Engineering experience, Infrastructure as Code (Terraform), AWS services (Lambda, SQS, API Gateway, DocumentDB, RDS/MySQL, CloudWatch), Kubernetes (EKS), Linux/Windows environments, Scripting (Python/JavaScript), Observability tools (Datadog)
Preferred skills
Advanced Kubernetes operations (upgrades, capacity planning, networking, security), Software engineering in Python/JavaScript beyond scripting, Observability practices at scale (metric design, alert tuning)
Technologies
Terraform, GitLab CI/CD, AWS, EKS, Datadog, CloudWatch, Python, JavaScript
Responsibilities
Define and monitor Service Level Indicators (SLIs) and Service Level Objectives (SLOs), Design and extend observability, Lead incident response and root-cause analysis, Partner with Product and Engineering to balance reliability and delivery, Create operational documentation and runbooks, Coach and mentor engineers on reliability practices
Seniority
Senior, hands-on IC with mentorship responsibilities