CareerPlanGet AI match score →

Member of Technical Staff, Pre-Training Data

Toronto🌐 Remote💼 Full-time🗓 2025-06-25 → 2026-08-01

Core

Building and optimizing data pipelines, curation methods, and data mixtures to train frontier language models for developers and enterprises.

Role type

Machine Learning Engineer (Pre-Training Data)

Builds

Data pipelines and pre-training data mixtures for large-scale language models

Domain

Artificial Intelligence / Natural Language Processing

Deliverable

production ML models

Required skills

Python, data pipeline development, data ablation, data mixing, data curation, large-scale dataset handling, data quality assessment

Preferred skills

curriculum learning, data attribution, Apache Spark, Apache Beam, Pandas, multilingual corpora processing

Technologies

Python, Apache Spark, Apache Beam, Pandas

Responsibilities

Conduct data ablations to assess data quality; Develop robust data modeling techniques for training efficiency; Research and implement innovative data curation methods; Collaborate with cross-functional teams on data pipelines

Seniority

Mid-level, hands-on IC

Sourced via ashby · Listed on CareerPlan, which tracks 70,000+ jobs from 20+ sources.
Apply on Ashby ↗