高级/资深多模态大模型算法工程师-Commercial AI
Core
Iterating multi-modal foundation models (LLM, VLM, Omni) for ByteDance's commercial scenarios (advertising, e-commerce, lifestyle services) by optimizing pre-training, SFT, RL, and inference to enhance generalization across general and domain-specific datasets.
Role type
Senior IC multi-modal large model algorithm engineer
Builds
Multi-modal foundation models for commercial ad, e-commerce, and lifestyle services
Domain
AI / Large Language Models / Multi-modal Learning
Deliverable
production ML models
Required skills
Deep learning theory, Transformer architectures, multi-modal encoder alignment (ViT, AuT, CLIP), LLM/VLM/Omni training paradigms, data construction for large models, Pre-train/Post-train algorithms
Preferred skills
Continual pre-training, SFT/RL experience, distributed training frameworks (Swift, VeOmni, VeRL, Easy-R1, Megatron, DeepSpeed), large-scale distributed training
Technologies
ViT, AuT, CLIP, PPO, GRPO, OPD, Agentic RL
Responsibilities
Optimize model performance on general and domain-specific evaluation sets; Analyze large-scale multi-modal data to inform training strategies; Research long-term key problems including unified understanding-generation-editing models, audio/video/music understanding, and reward models.