Senior AI Engineer (Driving VLM/VLA)
Core
Developing the next-generation Driving Foundation Model using millions of real autonomous driving data to enable vehicles to understand, judge, and act in complex road environments via Vision-Language-Model (VLM) and Vision-Language-Action (VLA) technologies.
Role type
Senior IC multimodal AI engineer (autonomous driving)
Builds
Driving foundation models, multimodal reasoning systems, and scene understanding capabilities for autonomous driving
Domain
Autonomous driving, multimodal AI, computer vision, robotics
Deliverable
production ML models
Required skills
Computer Vision, Machine Learning, Robotics, Autonomous Driving, Multimodal AI, PyTorch, VLM, VLA, world models, trajectory prediction, imitation learning, Transformer models, diffusion models, autoregressive models, representation learning, large-scale data training, experimental design
Preferred skills
Autonomous driving or robotics foundation model development, VLM/LLM fine-tuning and instruction tuning, VLA and behavior cloning, action-conditioned video generation, 4D scene modeling, BEV and occupancy networks, distributed training, closed-loop simulation integration
Technologies
PyTorch, VLM, VLA, Transformer, diffusion, autoregressive models, BEV, occupancy networks
Responsibilities
Design and develop Vision-Language-Action based driving foundation models; train and evaluate models on multimodal sequential data (camera/video, map, trajectory, action, language); develop driving scene understanding, temporal reasoning, and agent interaction modeling; build VLM-based applications like scene captioning and visual question answering; construct large-scale multimodal datasets and design evaluation benchmarks; collaborate with Simulation, Data, and ML Platform teams to integrate models into the autonomous driving system
Seniority
Senior, hands-on IC