CareerPlanSign in

Senior AI Training Infrastructure Engineer

USA💼 Full-time🗓 2026-10-03 → 2026-10-04

Core

Build and scale distributed training infrastructure for large AI models across GPU clusters to improve reliability, efficiency, and resource utilization.

Role type

Senior IC infrastructure engineer (AI training systems)

Builds

Distributed training systems, automation tools, and production ML pipelines for large AI models

Domain

AI infrastructure, distributed systems, GPU computing

Deliverable

infrastructure

Required skills

distributed training systems, large-scale ML infrastructure, multi-node GPU training, production ML pipeline integration, complex distributed systems programming, system reliability engineering

Preferred skills

PyTorch Distributed, DeepSpeed, Megatron-LM, Ray, supervised fine-tuning, reinforcement learning from human feedback, GPU optimization, Kubernetes, containerized AI workloads

Responsibilities

Design systems for training reliability, fault tolerance, checkpointing, and recovery; diagnose issues affecting training throughput and cost efficiency; build automation and developer tools; establish best practices for operational processes and platform reliability

Seniority

Senior, hands-on IC

Sourced via codingjobboard · Listed on CareerPlan, which tracks 992,000+ jobs from 20+ sources.