Senior Site Reliability Engineer
Core
Architect high-performing platforms and ensure reliability for an AI-powered learning platform serving millions of users globally.
Role type
Senior Site Reliability Engineer (IC)
Builds
Scalable, resilient cloud infrastructure and observability tools for a SaaS learning platform
Domain
SaaS / EdTech / Cloud Infrastructure
Deliverable
production ML models | infrastructure
Required skills
Distributed systems, Cloud architecture (AWS), Container orchestration, Infrastructure as Code, Incident management, Observability, Automation scripting
Preferred skills
Self-healing infrastructure patterns, Zero-downtime deployment pipelines, Multi-tenant SaaS scaling
Technologies
AWS, Kubernetes, Terraform, Python, Go, Prometheus, Grafana
Responsibilities
Define reliability objectives (SLIs/SLOs) and build long-term reliability roadmaps; Lead cross-service incident responses during critical outages; Drive adoption of reliability patterns and deployment safety capabilities; Build and refine advanced observability tools; Influence product design to balance feature velocity with reliability; Mentor senior engineers and assist in recruiting top-tier talent
Seniority
Senior, hands-on IC with mentorship responsibilities