Site Reliability Engineer (SRE), Cloud Operations
Core
Build intelligent, autonomous infrastructure operations for a bank's private and public cloud platforms, focusing on self-healing automation, reducing operational toil, and ensuring high availability.
Role type
Senior Site Reliability Engineer (Cloud Operations)
Builds
Self-healing automation systems, CI/CD pipelines, and reliable operational practices for enterprise-scale cloud infrastructure.
Domain
Banking / Cloud Infrastructure & Automation
Deliverable
production ML models | infrastructure
Required skills
Kubernetes/OpenShift administration, Ansible, Terraform, Python scripting, monitoring and observability (Prometheus, Grafana, ELK), incident management, capacity planning, security and compliance fundamentals, AI/ML concepts for operations (anomaly detection, predictive capacity planning)
Preferred skills
Public cloud platforms (AWS, Azure, GCP) in hybrid/multi-cloud environments, GPU/compute infrastructure for ML inference workloads
Technologies
Kubernetes, OpenShift, Ansible, Terraform, Python, Prometheus, Grafana, ELK, ServiceNow, Dynatrace, PagerDuty, Confluent Kafka
Responsibilities
Support scalable and secure architectures across private and public cloud platforms; write code and scripts to automate infrastructure workflows; extend self-healing automation capabilities; participate in design reviews for platform features; collaborate on data standards and pipelines; drive automation, CI/CD, and Infrastructure as Code practices; minimize reliability failures via proactive alerting; participate in on-call rotation for incident management and troubleshooting.
Seniority
Senior, hands-on IC