Machine Learning Engineer
Core
Developing machine learning models and data processing pipelines to curate, filter, and prepare large-scale text datasets for training frontier AI models and LLMs.
Role type
Senior Machine Learning Engineer (Data Curation & Pipeline Engineering)
Builds
Scalable data pipelines, dataset curation tools, and ML solutions for NLP and LLM training
Domain
AI Infrastructure / Large Language Models / Web Data Curation
Deliverable
production ML models | product features
Required skills
Python, large-scale text dataset processing, NLP pipelines, data distillation, statistical analysis, hypothesis testing, regression analysis, probability theory, dataset filtering, corpus curation, OCR integration, scalable pipeline design
Preferred skills
Experience with high-output teams, text deduplication, data preparation for LLM training
Technologies
Python, OCR, NLP frameworks, distributed data processing systems
Responsibilities
Designing and implementing pipelines for processing and analyzing large datasets, developing techniques for dataset curation to improve AI training data quality, utilizing OCR technology to convert documents into searchable data, ensuring data quality and integrity throughout all processes, continuously researching and implementing best practices in data science and machine learning
Seniority
Senior, hands-on IC