principal Engineer-Site Reliability Engineering and AIOps
Core
Define enterprise technical direction for Site Reliability Engineering and AIOps, establishing reliability strategy, reference architectures, and engineering standards across a large application portfolio.
Role type
Principal Engineer (SRE and AIOps)
Builds
Reliability strategy, reference architectures, observability platforms, and automation-first operations capabilities.
Domain
Enterprise Technology, Site Reliability Engineering, AIOps, Cloud Infrastructure
Deliverable
production ML models | infrastructure
Required skills
System design, distributed systems, Linux/Unix/Windows administration, cloud solutions architecture, full-stack observability, automation toolsets, advanced analytics/AI/ML for operations, incident leadership, technical thought leadership
Preferred skills
None explicitly stated as preferred over required in this context
Technologies
Ansible, Grafana, Elastic, Splunk, Prometheus, Java, C#, Python
Responsibilities
Set and evangelize SRE and AIOps technical strategy; act as principal-level technical advisor and mentor; own reliability and observability architecture across hybrid/multi-cloud; design and implement AIOps and automation platforms; define reliability measurement systems (SLIs/SLOs); provide technical leadership during major incidents; partner with leaders to embed reliability into delivery; lead cross-organization reliability transformations.
Seniority
Principal, hands-on IC with strategy & mentorship