CareerPlanSign in

混元视频感知与理解算法研究员(北京/上海)(深圳)

Beijing, China💼 Full-time🗓 2026-09-28

Core

Researching and developing video perception and understanding capabilities for multimodal large language models (VLMs), focusing on dynamic visual world comprehension.

Role type

Senior Research Scientist (Video Perception & Understanding)

Builds

Multimodal large language models (VLMs) with advanced video understanding

Domain

Artificial Intelligence / Computer Vision / Multimodal Large Models

Deliverable

production ML models

Required skills

Deep learning, Transformer architectures, LLMs, VLMs, video understanding, temporal reasoning, spatial reasoning, causal reasoning, reinforcement learning, SFT, automated data production pipelines

Preferred skills

Experience with complex video tasks, long-context understanding, multi-step reasoning

Technologies

Transformers, LLMs, VLMs

Responsibilities

Lead video capability construction including data, training methods, and evaluation systems; Focus on core video understanding capabilities like motion, events, and spatial relationships; Explore complex video reasoning including temporal, spatial, and causal inference; Build systematic video evaluation frameworks and data flywheels; Drive full-stack video R&D from pre-training to post-training alignment.

Seniority

Senior, hands-on IC

Sourced via tencent · Listed on CareerPlan, which tracks 845,000+ jobs from 20+ sources.