Site Reliability Engineer
Core
Design, optimize, and secure cloud infrastructure for a healthcare data collaboration platform, ensuring scalable, automated, and resilient environments for workload migration and multi-cloud integration.
Role type
Senior Site Reliability Engineer (IC)
Builds
Scalable, secure, automated cloud infrastructure across AWS and Azure
Domain
Healthcare technology / Cloud Infrastructure
Deliverable
production ML models | infrastructure
Required skills
Cloud infrastructure design, Infrastructure as Code (Terraform, Ansible), CI/CD pipeline development, SLO/SLI definition and management, incident response and postmortems, security compliance (SOC2, HITRUST, NIST), systems programming (Python, Go), multi-cloud networking and IAM
Preferred skills
Multi-cloud governance (AWS Organizations, Azure Policy), FinOps and cost optimization, disaster recovery and multi-region architecture, on-call health improvement, AI tool integration
Technologies
AWS (EC2, VPC, IAM, CloudWatch), Azure (VMs, VNets, Log Analytics), Kubernetes, Datadog, Terraform, Ansible, GitHub Actions
Responsibilities
Lead reliability improvements and incident response for assigned services; architect scalable cloud environments and drive workload migrations; build and maintain IaC and CI/CD tooling; define and monitor SLOs/SLIs; mentor junior engineers and foster cross-functional collaboration; implement security and compliance frameworks across hybrid/multi-cloud setups
Seniority
Senior, hands-on IC