Senior AI Training Infrastructure Engineer
Core
Build and scale distributed training infrastructure for large AI models across GPU clusters to improve reliability, efficiency, and resource utilization.
Role type
Senior IC infrastructure engineer (AI training systems)
Builds
Distributed training systems, automation tools, and production ML pipelines for large AI models
Domain
AI infrastructure, distributed systems, GPU computing
Deliverable
infrastructure
Required skills
distributed training systems, large-scale ML infrastructure, multi-node GPU training, production ML pipeline integration, complex distributed systems programming, system reliability engineering
Preferred skills
PyTorch Distributed, DeepSpeed, Megatron-LM, Ray, supervised fine-tuning, reinforcement learning from human feedback, GPU optimization, Kubernetes, containerized AI workloads
Responsibilities
Design systems for training reliability, fault tolerance, checkpointing, and recovery; diagnose issues affecting training throughput and cost efficiency; build automation and developer tools; establish best practices for operational processes and platform reliability
Seniority
Senior, hands-on IC