CareerPlanSign in

Member of Technical Staff - Multilingual Data

San Francisco, CA💼 Full-time🗓 2026-09-11 → 2026-09-26

Core

Design and operate large-scale multilingual data pipelines, define quality bars for corpora, and run experiments to improve multilingual data efficiency for large language models.

Role type

Senior IC machine-learning engineer (multilingual data)

Builds

Multilingual data pipelines, evaluation sets, and diagnostics for model behavior

Domain

AI / Machine Learning / Multilingual NLP

Deliverable

production ML models

Required skills

software engineering fundamentals, building large-scale data pipelines, distributed environments, multilingual NLP, data quality assessment, scientific experimentation, trade-off navigation

Preferred skills

graduate degree in CS/ML, published work in multilingual NLP, annotation vendor management, tokenizer design

Technologies

distributed environments, data pipelines, evaluation sets

Responsibilities

Design and operate large-scale multilingual data pipelines; Define and enforce quality bars for multilingual corpora; Design and run scientific experiments to advance understanding of scaling large language models; Build evaluation sets and diagnostics to expose model behavior degradation; Collaborate with pre-training, mid-training, and post-training teams

Seniority

Senior, hands-on IC

Sourced via ashby · Listed on CareerPlan, which tracks 70,000+ jobs from 20+ sources.