CareerPlanSign in

Research Scientist / Engineer – Training Infrastructure

Redwood City, CA💼 Full-time🗓 2026-07-24 → 2026-09-26

Core

Build distributed systems to train Luma's large-scale multimodal models across thousands of GPUs, enabling researchers to focus on innovation.

Role type

Senior IC distributed systems engineer (training infrastructure)

Builds

Distributed training systems, parallelization frameworks, and monitoring tooling for foundation models

Domain

AI/ML infrastructure, high-performance computing, distributed systems

Deliverable

production ML models

Required skills

Distributed PyTorch training, CUDA programming, advanced parallelism (FSDP, Tensor Parallel, Pipeline Parallel, Expert Parallel), GPU cluster management, NCCL/MPI communication libraries, training stability optimization, resource utilization optimization

Preferred skills

Linux systems administration, scripting, containerization, orchestration, cloud infrastructure management, experience managing 100+ GPU clusters

Technologies

PyTorch, CUDA, NCCL, MPI, Linux

Responsibilities

Design and implement efficient distributed training systems; Research and implement advanced parallelization strategies; Build monitoring, visualization, and debugging tools; Optimize training stability, convergence, and resource utilization

Seniority

Senior, hands-on IC

Sourced via ashby · Listed on CareerPlan, which tracks 70,000+ jobs from 20+ sources.