Member of Technical Staff - Mid-training
Core
Scaling synthetic coding data and optimizing mid-training data mixtures to boost RL ceilings for large AI models.
Role type
Mid-training ML engineer (large model scaling)
Builds
Large-scale AI training data pipelines and mid-training checkpoints
Domain
Artificial Intelligence / Large Language Models
Deliverable
production ML models
Required skills
ML and large model scaling, ML experiment design, AI training data curation (text, image, audio, video), large-scale data processing frameworks
Preferred skills
Docker verification, synthetic data generation, long-context data recipe engineering, robust evaluation design
Technologies
Spark, Ray, Docker
Responsibilities
Scale synthetic coding data to trillions of tokens with large-scale docker verification, Distill flagship model intelligence into flash models via synthetic data generation, Optimize mid-training data mixtures to boost RL ceilings, Engineer long-context data recipes, Develop robust and diverse evaluation for mid-training checkpoints
Seniority
Mid-level, hands-on IC