CareerPlanSign in

具身智能VLA模型数据算法工程师-AI数据与安全

北京💼 Full-time🗓 2026-09-28

Core

Develop end-to-end R&D for pre-training data of Embodied AI VLA (Vision-Language-Action) models, focusing on data synthesis, automated labeling, and quality optimization to support 'perception-understanding-execution' integration for humanoid robots and smart terminals.

Role type

Senior IC data algorithm engineer (VLA model pre-training)

Builds

High-quality pre-training datasets, automated labeling pipelines, and data synthesis algorithms for VLA models

Domain

Embodied AI, Robotics, Multimodal AI

Deliverable

production ML models

Required skills

VLA model architecture and pre-training mechanisms, multimodal data alignment, Python, PyTorch/TensorFlow, data synthesis algorithms, automated labeling algorithms, data quality analysis and anomaly detection, physical simulation platforms

Preferred skills

Sim-to-Real transfer, domain randomization, first-person video automatic labeling, 3D pose trajectory extraction, reinforcement learning, imitation learning, robot motion control

Technologies

PyTorch, TensorFlow, OpenCV, numpy, h5py, simulation engines, AIGC models

Responsibilities

Design and implement automated labeling algorithms for action trajectories, 3D poses, and object interactions; Build data quality analysis systems with multi-dimensional evaluation metrics and noise filtering; Design and implement data synthesis algorithms using simulation engines and AIGC to generate diverse visual-language-action pairs; Optimize training strategies and analyze data quality impact on model performance; Collaborate with model R&D and hardware teams to deliver high-quality datasets for product deployment.

Sourced via bytedance · Listed on CareerPlan, which tracks 845,000+ jobs from 20+ sources.