Senior Site Reliability Engineer Engineer (SRE) (Remote)
Core
Architecting and operating a high-load, mission-critical Kubernetes-based platform in a multi-cloud environment (GCP/AWS) to ensure 24/7 reliability and scalability for a financial B2B solution.
Role type
Senior Site Reliability Engineer (SRE)
Builds
Kubernetes ecosystem (GKE), PaaS strategy, observability stack, and disaster recovery systems for a multi-cloud financial platform.
Domain
Fintech / Cloud Infrastructure
Deliverable
production ML models | infrastructure
Required skills
Kubernetes (GKE), Terraform, GitOps (ArgoCD), CI/CD (GitLab), Observability (Prometheus, VictoriaMetrics, OpenTelemetry), System Design, Incident Management, Disaster Recovery
Preferred skills
Kafka, RabbitMQ, Redis, PostgreSQL, Vault, AI-driven operations
Technologies
GCP, AWS, GKE, ArgoCD, GitLab CI, Terraform, Prometheus, Grafana, VictoriaMetrics, OpenTelemetry, Cloud Logging, Vault, PostgreSQL, Kafka, Redis, RabbitMQ
Responsibilities
Design and operate Kubernetes ecosystem with high availability; Own and evolve PaaS strategy using GitOps and CI/CD; Define and implement observability strategy; Lead infrastructure automation using Terraform; Manage SLOs, SLAs, and incident frameworks; Design and execute disaster recovery drills.
Seniority
Senior, hands-on IC
