Principal Engineer - Data Engineering
Core
Build and maintain ML-ready scientific data pipelines for experimental measurement data from precision product development instruments.
Role type
Junior Principal Data Engineer (Scientific Data)
Builds
Versioned feature engineering pipelines, data quality frameworks, training data registries, and synthetic data ingestion infrastructure.
Domain
AI/ML infrastructure, scientific data engineering, precision product development
Deliverable
production ML models
Required skills
Python, SQL, Batch pipeline architecture, Pipeline orchestration (Airflow, Prefect, AWS Glue), Data quality principles, Data versioning & lineage, ML data lifecycle awareness
Preferred skills
Feature stores (Feast, Tecton), Synthetic data generation (VAE, GAN), Data Build Tool (DBT), Data Load Tool (DLT), Annotation platform integration, Data lakehouse (Iceberg, Dremio)
Responsibilities
Build reliable feature engineering pipelines transforming raw sensor/operational data; Design and operate data quality checks for AI training datasets; Implement data versioning and lineage tracking for model reproducibility; Contribute to real-time sensor data ingestion pipelines; Build infrastructure for synthetic data generation workstreams.
Seniority
Junior (0-1 years experience)