CareerPlanSign in

多模态算法工程师-抖音AI分身

北京💼 Full-time🗓 2026-09-28

Core

Design and implement multimodal AI solutions for Douyin to create new interactive content formats (video editing, avatar generation, agent-driven scripts) for creators and recommendation systems.

Role type

Senior Multimodal Algorithm Engineer (Generative AI)

Builds

AI-driven video content, interactive avatars, and automated content generation pipelines for Douyin's live streaming and short video ecosystem.

Domain

Social Media / Generative AI / Multimodal Learning

Deliverable

production ML models

Required skills

Multimodal Large Language Models (MLLM), Video-Language Models (VLM), Diffusion models, Reinforcement Learning (RL), Supervised Fine-Tuning (SFT), Agent planning, Data engineering, Model evaluation

Preferred skills

Experience in short video/live streaming algorithms, Publications in top-tier conferences (CVPR, ICML, NeurIPS, etc.), Auto-Prompt, RAG

Technologies

PyTorch, TensorFlow, Hugging Face, LangChain, Vector Databases

Responsibilities

Optimize model performance for business goals (GMV, interaction efficiency); Design agent-based video scripting and real-time interaction; Build training infrastructure and data pipelines; Implement post-training optimization for domain adaptation.

Seniority

Senior, hands-on IC

Sourced via bytedance · Listed on CareerPlan, which tracks 855,000+ jobs from 20+ sources.