CareerPlanSign in

Sr. Software Engineer- AI/ML, AWS Neuron Distributed Training

Cupertino, California, United States💼 Full-time🗓 2026-09-22 → 2026-09-25

Core

Architect and implement business-critical features for distributed training on AWS Trainium, optimizing throughput and convergence for frontier-scale models.

Role type

Senior IC machine-learning engineer (distributed training & HPC)

Builds

High-performance distributed training infrastructure for PyTorch and JAX on AWS Trainium

Domain

Cloud infrastructure + Machine Learning + High-Performance Computing

Deliverable

production ML models

Required skills

Distributed training optimization, PyTorch, JAX, compiler/runtime tuning, parallelism strategies (data/tensor/pipeline/expert/context), reduced-precision formats, performance profiling, system architecture design, mentorship

Preferred skills

Computer architecture, upstream open-source contributions

Technologies

AWS Trainium, PyTorch, JAX, Neuron compiler, Neuron runtime

Responsibilities

Optimize distributed training performance (throughput, FLOPs utilization, time to convergence), bring up novel model architectures, own parallelism strategies, profile workloads to identify bottlenecks, translate performance gaps into architecture requirements

Seniority

Senior, hands-on IC with mentorship responsibilities

Sourced via amazon · Listed on CareerPlan, which tracks 70,000+ jobs from 20+ sources.