Data Engineer
Core
Building production-grade data pipelines, tooling, and systems to ingest, process, validate, and deliver high-quality training data for AI model development.
Role type
Data Engineer / AI Engineer
Builds
Production data pipelines, tooling, and internal data products for model training
Domain
Artificial Intelligence / Machine Learning
Deliverable
production ML models
Required skills
software engineering fundamentals, statistics, neural networks, data quality analysis, Python, large-scale data systems
Preferred skills
production data pipelines for ML workloads, columnar storage formats (Parquet), Kubernetes, predictive modeling, very large-scale datasets (TB-PB), scaling ladder design studies
Technologies
Python, Parquet, Kubernetes
Responsibilities
Analyze data performance and impact on model training; investigate anomalous model behavior to identify data issues; design and build data cleaning, transformation, and quality-control steps; research and develop frontier methods for improving data quality; apply statistical techniques to make data-driven decisions; partner across teams to define data acquisition opportunities; build and maintain production-grade data pipelines; develop metrics and monitoring systems for data quality; fuse data from multiple sources into reliable datasets; create shared datasets and tooling for other teams.
Seniority
Entry-level to Mid-level, hands-on IC