多模态基础模型算法工程师-抖音内容理解
Core
Developing and iterating multimodal foundation models to provide underlying model capabilities for Douyin, Toutiao, Xigua Video, and Jianying businesses.
Role type
Senior IC multimodal foundation model algorithm engineer
Builds
Industry-leading multimodal foundation models for video and image-text understanding
Domain
Internet / Multimodal AI
Deliverable
production ML models
Required skills
multimodal model training, pretraining and midtraining, model architecture optimization, training objective design, world knowledge injection, large-scale training efficiency, SFT, RL, instruction following, hallucination mitigation, data cleaning and synthesis, evaluation system design
Preferred skills
latest foundation model research, knowledge reinforcement, model alignment
Technologies
Pretrain, Midtrain, SFT, RL, OPD, large-scale distributed training
Responsibilities
Build pretraining and midtraining systems for multimodal models; Develop post-training systems including SFT, RL, and OPD; Establish data and evaluation systems covering data cleaning, labeling, and quality monitoring; Track and implement cutting-edge foundation model technologies.