Senior Research Engineer, Foundation Model Training Infrastructure
Core
Designing and maintaining large-scale distributed training systems for multi-modal foundation models supporting humanoid robot learning and physics simulation.
Role type
Senior/Principal IC infrastructure engineer (foundation model training)
Builds
Scalable training pipelines, data loaders, and monitoring tools for Project GR00T and multimodal foundation models
Domain
Robotics, Embodied AI, Large-scale MLOps
Deliverable
production ML models
Required skills
Distributed training system design, GPU cluster optimization, CUDA programming, Kubernetes orchestration, Python, C++, HPC environments, SLURM
Preferred skills
Tech lead experience, LLM training infrastructure, open-source AI framework contributions, top-tier AI conference publications
Technologies
PyTorch, JAX, TensorFlow, CUDA, Kubernetes, SLURM
Responsibilities
Design large-scale distributed training systems, optimize GPU/cluster utilization, implement scalable data loaders, develop monitoring/debugging tools, integrate model architectures into pipelines
Seniority
Senior/Principal, hands-on IC with potential for team coordination