Senior Applied Research Scientist, Data Curation
Core
Developing and deploying deep learning models and data pipelines for petabyte-scale data curation, document extraction, and deduplication to train foundation models (Nemotron).
Role type
Senior Applied Research Scientist (Data Curation & Multimodal AI)
Builds
Data curation pipelines, document extraction tools, and validation scripts for foundation model training.
Domain
AI / Machine Learning / Data Engineering / Document AI
Deliverable
production ML models
Required skills
Deep learning model development, multimodal data processing, document layout analysis, OCR, table/figure/formula extraction, distributed data frameworks (Ray, Spark, Dask), Python programming, PyTorch, semantic deduplication, fuzzy deduplication, petabyte-scale data handling, research methodology design, technical writing.
Preferred skills
Kaggle Grandmaster status, information retrieval expertise, mentoring experience.
Technologies
PyTorch, Ray, Spark, Dask, NVIDIA Inference Microservices (NIMs), HTML parsing.
Responsibilities
Develop efficient models and pipelines for multi-modal data extraction; build petabyte-scale extraction and deduplication pipelines; optimize curation methodologies for GPU clusters; craft datasets, metrics, and validation scripts; help scale pipelines to production via NIMs; write papers, blog posts, and documentation.
Seniority
Senior, hands-on IC with research output