多模态算法工程师-抖音AI分身
Core
Design and implement multimodal AI solutions for Douyin to create new interactive content formats (video editing, avatar generation, agent-driven scripts) for creators and recommendation systems.
Role type
Senior Multimodal Algorithm Engineer (Generative AI)
Builds
AI-driven video content, interactive avatars, and automated content generation pipelines for Douyin's live streaming and short video ecosystem.
Domain
Social Media / Generative AI / Multimodal Learning
Deliverable
production ML models
Required skills
Multimodal Large Language Models (MLLM), Video-Language Models (VLM), Diffusion models, Reinforcement Learning (RL), Supervised Fine-Tuning (SFT), Agent planning, Data engineering, Model evaluation
Preferred skills
Experience in short video/live streaming algorithms, Publications in top-tier conferences (CVPR, ICML, NeurIPS, etc.), Auto-Prompt, RAG
Technologies
PyTorch, TensorFlow, Hugging Face, LangChain, Vector Databases
Responsibilities
Optimize model performance for business goals (GMV, interaction efficiency); Design agent-based video scripting and real-time interaction; Build training infrastructure and data pipelines; Implement post-training optimization for domain adaptation.
Seniority
Senior, hands-on IC