Senior Software Engineer, Frontier AI Organization
Core
Design and implement large-scale data pre-processing pipelines to transform raw data into high-quality training datasets for next-generation AI/ML models.
Role type
Senior Software Development Engineer (Data Infrastructure)
Builds
Scalable data infrastructure and pre-processing systems for AI training data
Domain
Artificial Intelligence / Machine Learning / Distributed Systems
Deliverable
production ML models
Required skills
Distributed systems design, Data engineering, Pipeline optimization, Data quality frameworks, System architecture, Mentorship
Preferred skills
Full software development lifecycle, Code reviews, Source control management, Testing, Operations
Technologies
None explicitly stated
Responsibilities
Design scalable data pre-processing pipelines for petabyte-scale datasets, Develop data quality frameworks (deduplication, filtering, toxicity detection), Optimize pipeline performance for throughput and latency, Define data transformation logic (tokenization, normalization), Collaborate with scientists to translate data requirements, Own end-to-end system design and deployment, Drive technical decisions and mentor junior engineers
Seniority
Senior, hands-on IC with leadership responsibilities