Data Engineer (we have office locations in Cambridge, Leeds and London)
Core
Designing, building, and optimizing large-scale data pipelines and processing systems for clinical and genomic data to enable high-quality, trustworthy data products for researchers and clinicians.
Role type
Senior Data Engineer (Healthcare/Genomics)
Builds
Scalable data infrastructure, ETL/ELT pipelines, and data services in AWS.
Domain
Healthcare, Genomics, Life Sciences
Deliverable
production ML models | infrastructure
Required skills
AWS cloud engineering, Python, ETL/ELT pipeline design, data modeling, CI/CD, infrastructure-as-code, data governance, data quality/observability, secure data transfer tools (Aspera, Globus), data orchestration (Prefect), data visualization (Tableau), metadata management, de-identification.
Preferred skills
Genomic/bioinformatics data experience, machine learning pipeline productionization, healthcare data standards (OMOP, FHIR, SNOMED, ICD-10).
Responsibilities
Designing and building data pipelines and processing systems; working with clinical and genomic data at scale; using tools for orchestration, visualization, and secure data transfer; supporting robust data models and infrastructure; enabling data quality, observability, testing, and automation; collaborating with product, QA, and engineering teams; contributing to ML and visualization capabilities.
Seniority
Senior, hands-on IC