Site Reliability Engineer
Core
Ensure the availability, performance, and scalability of production systems for a pan-European tech bank's payments and banking infrastructure.
Role type
Site Reliability Engineer (SRE)
Builds
Scalable monitoring, alerting, observability systems, and automated tooling for incident response and system reliability.
Domain
Fintech / Payments / Banking Infrastructure
Deliverable
production ML models | infrastructure
Required skills
Linux systems administration, scripting (Python, Bash, Go), cloud platforms (Azure), container orchestration (Kubernetes, Docker), infrastructure as code (Terraform, Ansible), observability stacks (Datadog, Prometheus, Grafana, ELK), CI/CD pipelines, incident management tooling (PagerDuty, incident.io), postmortem analysis, SLI/SLO definition.
Preferred skills
Practical experience applying AI to operations (agentic and managed AI tooling for automation, diagnostics, or incident triage).
Technologies
Azure, Kubernetes, Docker, Terraform, Ansible, Datadog, Prometheus, Grafana, ELK, PagerDuty, incident.io, Python, Bash, Go
Responsibilities
Ensure reliability and uptime of critical production services; design scalable monitoring and observability systems; develop automation tools to eliminate manual work; lead postmortems and root cause analysis; maintain runbooks and on-call documentation; define and track SLIs and SLOs; identify and fix system weaknesses and bottlenecks.
Seniority
Mid-level (3+ years experience), hands-on IC