CareerPlanGet AI match score →

Data Curation Intern

Bangalore Office💼 Internship🗓 2026-05-11 → 2026-07-31

Core

Building high-quality multilingual datasets for training AI/ML models, specifically focusing on Indian languages and text-to-speech preparation.

Role type

Data Curation Intern

Builds

High-quality text and speech datasets for AI/ML model training pipelines

Domain

AI/ML, Natural Language Processing, Indian Languages

Deliverable

production ML models

Required skills

Python (pandas, regex, NLP libraries), data cleaning (deduplication, normalization), metadata tagging, data format handling (CSV, JSONL, Parquet), attention to detail

Preferred skills

NLP datasets exposure, Indian languages beyond English, data versioning tools, speech model training basics

Technologies

Python, pandas, spaCy, NLTK, Sangraha, Common Crawl, IndicCorp, Hugging Face

Responsibilities

Audit and profile open-source datasets for quality and coverage; Design and implement data cleaning pipelines; Create metadata tagging schemas; Build validation checklists and quality scorecards; Curate text passages for read-speech recording; Define metadata standards for audio datasets

Seniority

Intern

Sourced via greenhouse · Listed on CareerPlan, which tracks 70,000+ jobs from 20+ sources.
Apply on Greenhouse ↗