Senior Engineer
Core
Design and implement resilience strategies, operationalize chaos engineering, and improve observability-driven validation for a multi-cloud SaaS platform.
Role type
Senior SRE / Reliability and Resiliency Engineer
Builds
Reltio's cloud-native Context Intelligence Platform (SaaS)
Domain
Enterprise Data Management / Multi-cloud Infrastructure
Deliverable
production ML models | infrastructure
Required skills
distributed systems, microservices, Kubernetes (EKS/AKS/GKE), Java, Spring Boot, chaos engineering, CI/CD, SLO/SLI management, observability tools (Grafana, Prometheus, LogDNA)
Preferred skills
multi-region architecture, service mesh, performance testing, security tools (Snyk)
Technologies
AWS, Azure, GCP, Jenkins, Chaos Mesh, Gremlin, Harness, Kafka, Redis, PostgreSQL
Responsibilities
Design and implement resilience strategies across multi-cloud environments; Support chaos engineering initiatives and integrate experiments into CI/CD pipelines; Validate RTO, RPO, SLO, and recovery objectives using metrics; Improve resilience across databases, caching, messaging, and auth services; Use telemetry to identify improvement areas and ensure production readiness before releases
Seniority
Senior, hands-on IC