Middle Site Reliability Engineer
Core
Ensure stability, scalability, and predictable performance of banking services in production by bridging software development, infrastructure, and reliability engineering.
Role type
Middle Site Reliability Engineer (SRE)
Builds
Production banking infrastructure, CI/CD pipelines, and observability systems for 2.5M+ clients
Domain
Banking / Cloud Infrastructure
Deliverable
production ML models | product features | dashboards & analysis | infrastructure
Required skills
Kubernetes, Linux, Python, Terraform, CI/CD pipelines, Observability (monitoring, logging, metrics), Incident management, Root Cause Analysis, Capacity planning, Disaster recovery, GitOps
Preferred skills
AIOps, LLM-powered tool integration, AI agent architectures, Anomaly detection, Alert correlation
Technologies
Kubernetes, Docker, AWS, Terraform, GitHub Actions, Jenkins, Prometheus, Grafana, Alertmanager, OpenSearch, Elasticsearch, Argo CD, Python
Responsibilities
Maintain and evolve production infrastructure; Automate routine operations; Set up monitoring and alerting systems; Analyze incidents and conduct RCA; Participate in capacity planning and DR processes; Implement GitOps and Kubernetes management; Integrate AI/ML tools for diagnostics and automation
Seniority
Middle, hands-on IC