Senior SRE/AIOps Engineer
Core
Design, implement, and maintain SRE and AIOps capabilities to ensure system reliability, proactive monitoring, and automation of self-healing operations for multi-platform HR data pipelines and SaaS applications.
Role type
Senior SRE/AIOps Engineer
Builds
Automated self-healing systems, observability dashboards, and resilient data pipelines
Domain
Financial services / IT Operations / Data Engineering
Deliverable
production ML models | product features | dashboards & analysis | infrastructure
Required skills
Incident management lifecycle, SLI/SLO definition, AIOps implementation, log analysis, automation scripting, containerized platform administration, disaster recovery planning, security compliance
Preferred skills
AI/ML concepts for observability, CI/CD tools, Snowflake/MongoDB troubleshooting, OpenTelemetry, Kafka
Technologies
Moogsoft, Dynatrace, PagerDuty, Catchpoint, ELK stack, Ansible, Python, Bash, OpenShift, Snowflake, Microsoft Entra ID, SQL Server, PostgreSQL
Responsibilities
Define and operationalize SLIs, SLOs, and error budgets; Lead problem management and eliminate recurring issues; Implement and optimize AIOps capabilities using platforms such as Moogsoft; Design and implement automation-first solutions using Ansible and scripting; Provide L2/L3 support for data pipelines and integration workflows; Lead and coordinate Disaster Recovery (DR) planning and execution
Seniority
Senior, hands-on IC