Staff Engineer, Site Reliability
Core
Principal technical leader driving infrastructure evolution, observability strategy, and cross-team SLO/SLI frameworks for a global learning platform.
Role type
Staff Site Reliability Engineer (SRE)
Builds
Advanced observability function, self-service tooling, and resilient distributed systems for a global SaaS platform.
Domain
SaaS / EdTech / Cloud Infrastructure
Deliverable
production ML models | infrastructure
Required skills
Cloud engineering (AWS), Kubernetes, Docker, Microservices architecture, SLO/SLI design, Infrastructure as Code (Terraform/CloudFormation), CI/CD automation, Distributed systems design, Observability stack management, AI tool utilization
Preferred skills
Database scaling expertise, AWS/PaaS certifications
Technologies
AWS, Kubernetes, Docker, Terraform, CloudFormation, Jenkins, GitLab, Ansible, Puppet
Responsibilities
Design and implement observability tech stacks; Architect SLO/SLI frameworks; Build self-service monitoring and alerting tools; Optimize infrastructure for performance, cost, and maintainability; Mentor junior talent; Participate in on-call rotation
Seniority
Staff, hands-on IC with strategic leadership