Synthetic Data Engineer (AI Data/Training)
Core
Design and implement domain-specific synthetic data generation pipelines to ensure high-quality data management for training loops.
Role type
Synthetic Data Engineer (AI Data/Training)
Builds
Synthetic datasets for SFT and DPO training loops
Domain
Artificial Intelligence / Machine Learning
Deliverable
production ML models
Required skills
large-scale data pipeline construction, self-instruct prompting, constitutional prompting, automated quality scoring, de-duplication, dataset distillation, bias mitigation
Preferred skills
Airflow, Spark, Ray
Technologies
Airflow, Spark, Ray
Responsibilities
Design domain-specific synthetic data generation (SDG) pipelines via self-instruct and constitutional prompting; Implement automated quality scoring and de-duplication systems; Manage data pipelines that feed directly into SFT and DPO training loops.
Sourced via adzuna · Listed on CareerPlan, which tracks 70,000+ jobs from 20+ sources.