Data Curation Intern
Core
Building high-quality multilingual datasets for training AI/ML models, specifically focusing on Indian languages and text-to-speech preparation.
Role type
Data Curation Intern
Builds
High-quality text and speech datasets for AI/ML model training pipelines
Domain
AI/ML, Natural Language Processing, Indian Languages
Deliverable
production ML models
Required skills
Python (pandas, regex, NLP libraries), data cleaning (deduplication, normalization), metadata tagging, data format handling (CSV, JSONL, Parquet), attention to detail
Preferred skills
NLP datasets exposure, Indian languages beyond English, data versioning tools, speech model training basics
Technologies
Python, pandas, spaCy, NLTK, Sangraha, Common Crawl, IndicCorp, Hugging Face
Responsibilities
Audit and profile open-source datasets for quality and coverage; Design and implement data cleaning pipelines; Create metadata tagging schemas; Build validation checklists and quality scorecards; Curate text passages for read-speech recording; Define metadata standards for audio datasets
Seniority
Intern