Data Scientist, Data Quality & Provenance Team
Core
Define measurable, statistically rigorous concepts of data quality and build automated reports to determine when data-quality, annotation, and evaluation signals can be trusted for embodied AI systems.
Role type
Senior IC data scientist (statistics & data quality)
Builds
Automated reports, registered metrics, and reusable quality artefacts for data curation and model evaluation pipelines.
Domain
Autonomous driving / Embodied AI / Data Quality
Deliverable
production ML models
Required skills
Classical statistics (inference, experimental design), Python, SQL, rater/annotator modelling, inter-rater agreement, label uncertainty analysis, probabilistic/Bayesian modelling, data quality metrics (coverage, provenance)
Preferred skills
Production platform integrations, safety-critical data experience, Dawid–Skene-style models, psychometrics
Technologies
Python, SQL, Dawid–Skene models (via careerplan.io/jobs/4cf45aa3-fccf-4d28-aaaa-0fb0732b8de1-data-scientist-data-quality-provenance-team-at-wayve)
Responsibilities
Define measurable concepts of data quality including coverage, label quality, uncertainty, and provenance; Apply statistical-inference methods to multi-rater annotation and black-box model evaluation; Partner with annotation and autonomy teams to translate quality questions into defensible metrics; Build automated reports communicating confidence and limitations; Analyse large annotation datasets to identify quality issues; Iterate on metrics based on team feedback.
Seniority
Senior, hands-on IC
