Site Reliability Engineer
Core
Maintain, optimize, and ensure reliability and performance of mission-critical SaaS cloud infrastructure across AWS and Kubernetes with a focus on automation, observability, and incident command.
Role type
Senior Site Reliability Engineer (SRE)
Builds
Cloud infrastructure, self-healing systems, and observability tooling for healthcare supply chain SaaS
Domain
Cloud Infrastructure / SaaS / Healthcare Supply Chain
Deliverable
production ML models | product features | dashboards & analysis | infrastructure
Required skills
AWS (multi-account, VPC, EC2, EKS), Kubernetes, Infrastructure as Code (Terraform, Ansible), CI/CD pipelines, Python/Bash scripting, Incident Management, Observability (Datadog), System Design, Capacity Planning
Preferred skills
GitLab CI/CD, Java/.NET development environments, AI-assisted engineering tools (Amazon Kiro)
Technologies
AWS, Kubernetes, Terraform, Ansible, GitLab, Jenkins, Datadog, Amazon Kiro
Responsibilities
Collaborate with engineering teams on system design, capacity planning, and launch reviews; Monitor availability, latency, and system health; Develop monitoring, alerting, dashboards, and SLOs/SLIs; Build automation, internal tooling, and IaC frameworks; Lead incident response and drive blameless postmortems; Create and maintain technical documentation and SRE best practices
Seniority
Senior, hands-on IC