CareerPlanSign in

多模态大模型数据工程师-智能创作(北京/上海/深圳)

北京💼 Full-time🗓 2026-09-28

Core

Build data production pipelines and manage billion-scale multimodal datasets for post-training large vision-language models (Seedance, Seedream, Seed VLM) to enhance model performance.

Role type

Senior Multimodal Data Engineer (Post-Training)

Builds

Data pipelines for multimodal large model post-training

Domain

AI / Large Language Models / Multimodal Data

Deliverable

production ML models

Required skills

Python, Golang, Java, Spark, Flink, Hadoop, Ray, data cleaning, feature extraction, data augmentation, data modeling, data architecture

Preferred skills

Multimedia data platform architecture, image/video processing

Responsibilities

Design and optimize data processing pipelines for multimodal models; Manage data lineage and quality for billion-scale datasets; Collaborate with algorithms on data solutions for model post-training; Build data flywheels to scale high-quality training datasets.

Sourced via bytedance · Listed on CareerPlan, which tracks 845,000+ jobs from 20+ sources.