Manager, Site Reliability Engineer - Data Platforms
Core
Design, build, automate, and operate secure, resilient, scalable AWS platforms for EDSE applications and data platforms while leading an SRE pod.
Role type
Manager, Site Reliability Engineer (Data Platforms)
Builds
AWS cloud platforms, reusable IaC modules, automation tooling, and observability solutions
Domain
Biotechnology / Cloud Infrastructure
Deliverable
production ML models | infrastructure
Required skills
AWS architecture, Infrastructure as Code (Terraform/CDK), Python/Go/Java, Kubernetes (EKS), SRE practices (SLOs/SLIs), incident response, container orchestration, CI/CD, observability stack, Linux, distributed systems
Preferred skills
None explicitly stated
Technologies
AWS (EKS, Sagemaker, Bedrock, VPC, PrivateLink, S3, EC2, KMS, CloudWatch, CloudTrail, Secrets Manager, Lambda, RDS), Terraform, CloudFormation, AWS CDK, Python, Go, Java, TypeScript, Bash, Docker, Kubernetes, OpenTelemetry, Prometheus, Grafana, Splunk, Datadog
Responsibilities
Design secure, highly available AWS architectures; establish SRE practices and operational readiness; build automation for provisioning and deployment; lead on-call rotation and incident response; mentor engineers and drive team delivery
Seniority
Manager, hands-on IC