Member of Technical Staff - Data Quality Engineer (Pre-training)
Core
Ensure pre-training data quality, reliability, and downstream impact for open LLMs by defining standards, building QA pipelines, and providing feedback to vendors and research teams.
Role type
Member of Technical Staff - Data Quality Engineer (Pre-training)
Builds
Reusable automated QA pipelines and measurable quality signals for LLM pre-training campaigns
Domain
Artificial Intelligence / Large Language Model Pre-training
Deliverable
production ML models
Required skills
Python, building data pipelines, designing automated QA methods, statistical methods, LLM-as-a-Judge, debugging scalable code, understanding LLM training and evaluation
Preferred skills
Experience with large datasets, working autonomously, translating quality concerns into concrete signals
Technologies
Python, LLMs, automated evaluation systems
Responsibilities
Own upstream data quality for LLM pre-training across languages and modalities; Partner with research teams to translate requirements into measurable quality signals; Design, validate, and scale automated QA methods; Build reusable QA pipelines; Monitor and report on data quality over time
Seniority
Individual Contributor, hands-on engineering