多模态交互算法专家-PICO
Core
Research and optimize large-scale multimodal foundation models integrating physiological signals (e.g., eye tracking) to enhance data synthesis, scalable oversight, reasoning, and planning capabilities for XR and virtual worlds.
Role type
Senior Multimodal Interaction Algorithm Expert (AI/ML Research)
Builds
Multimodal Agents, VLA models, world models, and XR/virtual world interaction systems
Domain
Artificial Intelligence, Multimodal Large Models, Extended Reality (XR)
Deliverable
production ML models
Required skills
Multimodal Large Models (VLM), Large Language Models (LLM), Reinforcement Learning (RL), Multi-Agent algorithms, Model fine-tuning and alignment, Data synthesis
Preferred skills
Visual Language Models (VLA), World models, GUI/XR interaction modeling, Human-computer interaction algorithms (eye/gesture tracking), Training frameworks (VeRL, Trl, EasyR1)
Technologies
VLM, LLM, RL, VLA, VeRL, Trl, EasyR1
Responsibilities
Explore and optimize multimodal foundation models with physiological signal integration; Develop advanced capabilities in multimodal RAG, Memory, Visual CoT, and Agents; Model human-computer interaction actions and environments using pre-training and synthetic simulation.
Seniority
Senior, hands-on IC