Site Reliability Engineer II
Core
Design and implement reliability solutions for data ingestion, processing, and delivery pipelines to ensure data licensing services are resilient, observable, and continuously improving.
Role type
Site Reliability Engineer II (Data Infrastructure)
Builds
Data licensing platforms, ingestion/processing/delivery pipelines, monitoring dashboards, and automation for deployment and incident response.
Domain
Healthcare payments / Data Infrastructure / Cloud Systems
Deliverable
production ML models | product features | dashboards & analysis | infrastructure
Required skills
Cloud platforms (AWS, GCP, Azure), Kubernetes, Infrastructure-as-Code (Terraform, CloudFormation), Observability tools (Prometheus, Grafana, Splunk), CI/CD pipelines, Python, Distributed systems, ETL pipelines
Preferred skills
Data licensing, Data governance, Data compliance frameworks, Apache Airflow, Kafka, Spark, Regulatory requirements for data usage
Technologies
AWS, GCP, Azure, Kubernetes, Terraform, CloudFormation, Prometheus, Grafana, Splunk, Python, Powershell, Apache Airflow, Kafka, Spark
Responsibilities
Design and implement reliability solutions for data pipelines; Define and maintain SLIs/SLOs and manage error budgets; Build automation for deployment, monitoring, and incident response; Enhance system observability through metrics, logging, and tracing; Participate in on-call rotations and lead incident response efforts; Partner with software and data engineers to embed reliability into system design.
Seniority
Mid-level, hands-on IC