Senior Data Engineer, Bioinformatics, Cheminformatics, Materials
Core
Build ETL pipelines and data models to transform raw lab instrument outputs into validated, analysis-ready datasets for AI researchers and experimentalists.
Role type
Senior Data Engineer (Bioinformatics/Cheminformatics/Materials)
Builds
ETL pipelines, data models, validation checks, schema-evolution gates, and reusable analysis functions for scientific data.
Domain
Life sciences, chemistry, and materials science data engineering.
Deliverable
production ML models | product features
Required skills
Python (typed, production-quality), SQL (Postgres), ETL pipeline design, data modeling, statistics, pandas, NumPy, workflow orchestration (Flyte, Airflow, Prefect, Dagster, Nextflow), AI coding tools.
Preferred skills
Columnar/lakehouse stacks (Parquet, Iceberg, DuckDB, Polars, Ibis), event-driven pipelines (NATS, Kafka), lab instrument data formats (LIMS, ELN), life sciences assays (sequencing, imaging, flow cytometry), materials/chemistry methods (XRD, XRF, SEM, TGA, DSC), curve fitting, peak detection, unit/dimensional analysis.
Responsibilities
Design pipelines to turn raw lab output into analysis-ready scientific data; model heterogeneous data from bio, chemistry, and materials instruments; build validation checks and data quality workflows; develop reusable analysis functions; improve automation and observability across data flows; build canonical datasets.
Seniority
Senior, hands-on IC