Member of Technical Staff, Data Research Engineer - MAI Superintelligence Team
Core
Create high-quality datasets for training and evaluation, run data ablation experiments, and build scalable pipelines for multimodal data ingestion and processing.
Role type
Data Research Engineer
Builds
Scalable data pipelines for multimodal ingestion, pre-processing, filtering, and annotation
Domain
AI research, multimodal data, responsible AI
Deliverable
production ML models
Required skills
Python, Pandas, NumPy, statistics, exploratory data analysis, data analysis, data engineering, data processing frameworks (Spark, Ray, Apache Beam), large-scale unstructured/semi-structured dataset handling
Preferred skills
dataset auditing, visualization, versioning, lightweight tool development
Technologies
Spark, Ray, Apache Beam
Responsibilities
Create high-quality datasets for training and evaluation; run experiments on new datasets (data ablations) to assess their impact; develop and maintain scalable data pipelines for multimodal ingestion, pre-processing, filtering, and annotation; analyse real-world multimodal datasets to assess quality, diversity, relevance, and identify areas for improvement; build lightweight tools and workflows for dataset auditing, visualization, and versioning; collaborate with Safety, Ethics, and Governance teams to ensure datasets meet standards for quality, privacy, and responsible AI practices
Seniority
Individual Contributor