CareerPlanSign in

Site Reliability Engineer

Montreal, Quebec, Canada🌐 Remote💼 Full-time🗓 2026-05-04 → 2026-09-25

Core

Maintain, optimize, and ensure reliability and performance of mission-critical SaaS cloud infrastructure across AWS and Kubernetes with a focus on automation, observability, and incident command.

Role type

Senior Site Reliability Engineer (SRE)

Builds

Cloud infrastructure, self-healing systems, and observability tooling for healthcare supply chain SaaS

Domain

Cloud Infrastructure / SaaS / Healthcare Supply Chain

Deliverable

production ML models | product features | dashboards & analysis | infrastructure

Required skills

AWS (multi-account, VPC, EC2, EKS), Kubernetes, Infrastructure as Code (Terraform, Ansible), CI/CD pipelines, Python/Bash scripting, Incident Management, Observability (Datadog), System Design, Capacity Planning

Preferred skills

GitLab CI/CD, Java/.NET development environments, AI-assisted engineering tools (Amazon Kiro)

Technologies

AWS, Kubernetes, Terraform, Ansible, GitLab, Jenkins, Datadog, Amazon Kiro

Responsibilities

Collaborate with engineering teams on system design, capacity planning, and launch reviews; Monitor availability, latency, and system health; Develop monitoring, alerting, dashboards, and SLOs/SLIs; Build automation, internal tooling, and IaC frameworks; Lead incident response and drive blameless postmortems; Create and maintain technical documentation and SRE best practices

Seniority

Senior, hands-on IC

Sourced via workable · Listed on CareerPlan, which tracks 70,000+ jobs from 20+ sources.