混元视频感知与理解算法研究员(北京/上海)(深圳)
Core
Researching and developing video perception and understanding capabilities for multimodal large language models (VLMs), focusing on dynamic visual world comprehension.
Role type
Senior Research Scientist (Video Perception & Understanding)
Builds
Multimodal large language models (VLMs) with advanced video understanding
Domain
Artificial Intelligence / Computer Vision / Multimodal Large Models
Deliverable
production ML models
Required skills
Deep learning, Transformer architectures, LLMs, VLMs, video understanding, temporal reasoning, spatial reasoning, causal reasoning, reinforcement learning, SFT, automated data production pipelines
Preferred skills
Experience with complex video tasks, long-context understanding, multi-step reasoning
Technologies
Transformers, LLMs, VLMs
Responsibilities
Lead video capability construction including data, training methods, and evaluation systems; Focus on core video understanding capabilities like motion, events, and spatial relationships; Explore complex video reasoning including temporal, spatial, and causal inference; Build systematic video evaluation frameworks and data flywheels; Drive full-stack video R&D from pre-training to post-training alignment.
Seniority
Senior, hands-on IC
