CareerPlanSign in

Senior SRE/AIOps Engineer

TORONTO, Ontario, Canada💼 Full-time🗓 2026-07-23 → 2026-09-26

Core

Design, implement, and maintain SRE and AIOps capabilities to ensure system reliability, proactive monitoring, and automation of self-healing operations for multi-platform HR data pipelines and SaaS applications.

Role type

Senior SRE/AIOps Engineer

Builds

Automated self-healing systems, observability dashboards, and resilient data pipelines

Domain

Financial services / IT Operations / Data Engineering

Deliverable

production ML models | product features | dashboards & analysis | infrastructure

Required skills

Incident management lifecycle, SLI/SLO definition, AIOps implementation, log analysis, automation scripting, containerized platform administration, disaster recovery planning, security compliance

Preferred skills

AI/ML concepts for observability, CI/CD tools, Snowflake/MongoDB troubleshooting, OpenTelemetry, Kafka

Technologies

Moogsoft, Dynatrace, PagerDuty, Catchpoint, ELK stack, Ansible, Python, Bash, OpenShift, Snowflake, Microsoft Entra ID, SQL Server, PostgreSQL

Responsibilities

Define and operationalize SLIs, SLOs, and error budgets; Lead problem management and eliminate recurring issues; Implement and optimize AIOps capabilities using platforms such as Moogsoft; Design and implement automation-first solutions using Ansible and scripting; Provide L2/L3 support for data pipelines and integration workflows; Lead and coordinate Disaster Recovery (DR) planning and execution

Seniority

Senior, hands-on IC

Sourced via workday · Listed on CareerPlan, which tracks 70,000+ jobs from 20+ sources.