CareerPlanSign in

Site Reliability Engineer (SRE), Cloud Operations

TORONTO, Ontario, Canada💼 Full-time🗓 2026-07-31 → 2026-09-26

Core

Build intelligent, autonomous infrastructure operations for a bank's private and public cloud platforms, focusing on self-healing automation, reducing operational toil, and ensuring high availability.

Role type

Senior Site Reliability Engineer (Cloud Operations)

Builds

Self-healing automation systems, CI/CD pipelines, and reliable operational practices for enterprise-scale cloud infrastructure.

Domain

Banking / Cloud Infrastructure & Automation

Deliverable

production ML models | infrastructure

Required skills

Kubernetes/OpenShift administration, Ansible, Terraform, Python scripting, monitoring and observability (Prometheus, Grafana, ELK), incident management, capacity planning, security and compliance fundamentals, AI/ML concepts for operations (anomaly detection, predictive capacity planning)

Preferred skills

Public cloud platforms (AWS, Azure, GCP) in hybrid/multi-cloud environments, GPU/compute infrastructure for ML inference workloads

Technologies

Kubernetes, OpenShift, Ansible, Terraform, Python, Prometheus, Grafana, ELK, ServiceNow, Dynatrace, PagerDuty, Confluent Kafka

Responsibilities

Support scalable and secure architectures across private and public cloud platforms; write code and scripts to automate infrastructure workflows; extend self-healing automation capabilities; participate in design reviews for platform features; collaborate on data standards and pipelines; drive automation, CI/CD, and Infrastructure as Code practices; minimize reliability failures via proactive alerting; participate in on-call rotation for incident management and troubleshooting.

Seniority

Senior, hands-on IC

Sourced via workday · Listed on CareerPlan, which tracks 70,000+ jobs from 20+ sources.