Senior Site Reliability Engineer, IaaS
Core
Designing and automating cloud infrastructure foundations and Kubernetes platform capabilities to support large-scale workload migration and production operations.
Role type
Senior Site Reliability Engineer (IaaS/Platform Engineering)
Builds
Unified cloud and Kubernetes platform, Cloud Baseline capabilities, automated lifecycle operations, and self-service infrastructure modules.
Domain
Cloud Infrastructure (AWS/GCP), Kubernetes, Platform Engineering, FinOps
Deliverable
production ML models | product features | dashboards & analysis | research | client delivery | infrastructure | physical/clinical work
Required skills
AWS or GCP production expertise, Kubernetes operations, Infrastructure-as-Code (Terraform), Python or Go, Linux administration, networking, distributed systems, capacity planning, cost optimization, automation scripting, mentorship
Preferred skills
Multi-cloud experience, GitOps (Argo CD), Policy-as-code (OPA/Kyverno), Helm, cloud migration experience, FinOps practices
Technologies
AWS, GCP, Kubernetes, Terraform, Python, Go, Linux, Argo CD, Helm, OPA, Kyverno
Responsibilities
Lead design of Cloud Baseline capabilities (identity, networking, security, cost visibility); Design and automate cloud infrastructure for production Kubernetes clusters; Lead complex initiatives like cluster lifecycle automation and drift reduction; Build automated guardrails for security and compliance; Improve platform efficiency via capacity planning and rightsizing; Mentor engineers and raise team design quality; Participate in on-call rotation for production issues.
Seniority
Senior, hands-on IC with mentorship responsibilities