CareerPlanSign in

Senior Site Reliability Engineer

Tbilisi, GE💼 Full-time🗓 2026-08-10 → 2026-09-11

Core

Ensure high availability and reliability of a global financial analysis platform serving 100M+ users by managing production incidents, observability, and service health.

Role type

Senior Site Reliability Engineer (SRE)

Builds

Production environment delivery, new service commissioning, and operational automation for a global financial platform.

Domain

Fintech / Distributed Systems / Observability

Deliverable

production ML models | product features | dashboards & analysis | infrastructure

Required skills

Production incident investigation, Root cause analysis (RCA), Monitoring and observability, SLI/SLO definition, Distributed systems knowledge, Automation scripting, Runbook creation, Capacity planning

Preferred skills

Kubernetes administration (CKA/CKAD), Prometheus/Grafana/OpenTelemetry, Google Four Golden Signals, AI-assisted diagnostics, Incident management processes

Technologies

Kubernetes, Prometheus, Grafana, OpenTelemetry, Distributed tracing systems

Responsibilities

Investigate and resolve production incidents, Perform root cause analysis and postmortem reviews, Develop and improve monitoring and alerting systems, Define and maintain SLI/SLOs and service health objectives, Automate operational workflows and diagnostics, Create and maintain runbooks and operational documentation, Analyze service performance and capacity risks, Train duty engineers on tools and best practices

Seniority

Senior, hands-on IC

Sourced via teamtailor · Listed on CareerPlan, which tracks 70,000+ jobs from 20+ sources.