Research Scientist / Engineer – Training Infrastructure
Core
Build distributed systems to train Luma's large-scale multimodal models across thousands of GPUs, enabling researchers to focus on innovation.
Role type
Senior IC distributed systems engineer (training infrastructure)
Builds
Distributed training systems, parallelization frameworks, and monitoring tooling for foundation models
Domain
AI/ML infrastructure, high-performance computing, distributed systems
Deliverable
production ML models
Required skills
Distributed PyTorch training, CUDA programming, advanced parallelism (FSDP, Tensor Parallel, Pipeline Parallel, Expert Parallel), GPU cluster management, NCCL/MPI communication libraries, training stability optimization, resource utilization optimization
Preferred skills
Linux systems administration, scripting, containerization, orchestration, cloud infrastructure management, experience managing 100+ GPU clusters
Technologies
PyTorch, CUDA, NCCL, MPI, Linux
Responsibilities
Design and implement efficient distributed training systems; Research and implement advanced parallelization strategies; Build monitoring, visualization, and debugging tools; Optimize training stability, convergence, and resource utilization
Seniority
Senior, hands-on IC
