Member of Technical Staff, Pre-Training Data
Core
Building and optimizing data pipelines, curation methods, and data mixtures to train frontier language models for developers and enterprises.
Role type
Machine Learning Engineer (Pre-Training Data)
Builds
Data pipelines and pre-training data mixtures for large-scale language models
Domain
Artificial Intelligence / Natural Language Processing
Deliverable
production ML models
Required skills
Python, data pipeline development, data ablation, data mixing, data curation, large-scale dataset handling, data quality assessment
Preferred skills
curriculum learning, data attribution, Apache Spark, Apache Beam, Pandas, multilingual corpora processing
Technologies
Python, Apache Spark, Apache Beam, Pandas
Responsibilities
Conduct data ablations to assess data quality; Develop robust data modeling techniques for training efficiency; Research and implement innovative data curation methods; Collaborate with cross-functional teams on data pipelines
Seniority
Mid-level, hands-on IC