Sr. Software Engineer- AI/ML, AWS Neuron Distributed Training
Core
Architect and implement business-critical features for distributed training on AWS Trainium, optimizing throughput and convergence for frontier-scale models.
Role type
Senior IC machine-learning engineer (distributed training & HPC)
Builds
High-performance distributed training infrastructure for PyTorch and JAX on AWS Trainium
Domain
Cloud infrastructure + Machine Learning + High-Performance Computing
Deliverable
production ML models
Required skills
Distributed training optimization, PyTorch, JAX, compiler/runtime tuning, parallelism strategies (data/tensor/pipeline/expert/context), reduced-precision formats, performance profiling, system architecture design, mentorship
Preferred skills
Computer architecture, upstream open-source contributions
Technologies
AWS Trainium, PyTorch, JAX, Neuron compiler, Neuron runtime
Responsibilities
Optimize distributed training performance (throughput, FLOPs utilization, time to convergence), bring up novel model architectures, own parallelism strategies, profile workloads to identify bottlenecks, translate performance gaps into architecture requirements
Seniority
Senior, hands-on IC with mentorship responsibilities