多模态大模型数据工程师-智能创作(北京/上海/深圳)
Core
Build data production pipelines and manage billion-scale multimodal datasets for post-training large vision-language models (Seedance, Seedream, Seed VLM) to enhance model performance.
Role type
Senior Multimodal Data Engineer (Post-Training)
Builds
Data pipelines for multimodal large model post-training
Domain
AI / Large Language Models / Multimodal Data
Deliverable
production ML models
Required skills
Python, Golang, Java, Spark, Flink, Hadoop, Ray, data cleaning, feature extraction, data augmentation, data modeling, data architecture
Preferred skills
Multimedia data platform architecture, image/video processing
Responsibilities
Design and optimize data processing pipelines for multimodal models; Manage data lineage and quality for billion-scale datasets; Collaborate with algorithms on data solutions for model post-training; Build data flywheels to scale high-quality training datasets.