CareerPlanSign in

Data Infrastructure Engineer, Pre-training

San Francisco, CA💼 Full-time💰 $500,000–$500,000🗓 2026-09-04 → 2026-09-25

Core

Design and implement high-throughput, fault-tolerant distributed data processing infrastructure for training large language models.

Role type

Staff-level Data Infrastructure Engineer (Pre-training)

Builds

End-to-end data pipelines transforming web-scale corpora into training-ready datasets for LLMs

Domain

Artificial Intelligence / Large Language Model Training Infrastructure

Deliverable

production ML models

Required skills

Distributed systems engineering, Apache Spark, Python, Rust, Data quality assurance, Scalability design, Fault tolerance

Preferred skills

Experience with language model training infrastructure, System reliability optimization, Ambiguous requirement navigation, Independent problem ownership

Technologies

Apache Spark, Python, Rust

Responsibilities

Design and implement data processing infrastructure for LLM training; Develop core processing primitives (tokenization, deduplication, chunking); Build robust data quality assurance and validation systems; Collaborate with research teams on novel data architectures; Operate end-to-end data pipelines for web-scale corpora

Seniority

Staff, hands-on IC with strategic impact

Sourced via greenhouse · Listed on CareerPlan, which tracks 70,000+ jobs from 20+ sources.