Staff Site Reliability Engineer
Core
Ensures reliability, availability, and performance of large-scale SaaS cloud platforms through automation, observability, and incident management.
Role type
Senior Site Reliability Engineer (SRE)
Builds
Altium Cloud Platforms (SaaS)
Domain
Cloud Infrastructure / SaaS / Electronics Design Software
Deliverable
production ML models | product features | infrastructure
Required skills
SRE/DevOps, .NET development, microservice architecture, high availability (HA) design, observability (logging, monitoring, APM), Kubernetes, AWS, Infrastructure as Code (IaC), CI/CD tooling, relational databases
Preferred skills
Service-Oriented Organization (SOO) principles, capacity planning, system design consulting
Technologies
NewRelic, ELK, Grafana, PagerDuty, OTEL, Kubernetes, AWS, Jenkins, GitLab, GitHub, ArgoCD, Terraform, Ansible, MySQL, PostgreSQL
Responsibilities
Pioneer improvements in observability and proactive issue detection; Develop and implement reliability frameworks and patterns; Contribute to incident response and management; Partner with engineering teams to enhance product stability and manageability; Drive automation initiatives and streamline deployment processes; Participate in system design consulting and infrastructure upgrades.
Seniority
Senior, hands-on IC