Software Engineer- AI/ML, Amazon Neuron Training
Core
Building distributed training infrastructure, parallelism techniques, and high-performance kernels for large-scale pretraining, post-training, and reinforcement learning workloads on AWS Trainium custom ML accelerators.
Role type
Senior IC software engineer (distributed training & HPC)
Builds
Distributed training stack, parallelism strategies, and performance optimization for frontier-scale AI models
Domain
Cloud computing, Machine Learning, High-Performance Computing, Custom Hardware Acceleration
Deliverable
production ML models
Required skills
Distributed training, Parallelism strategies (data/tensor/pipeline), Reduced-precision formats, Workload profiling, System design, LLM/transformer fundamentals
Preferred skills
LLM deployment on AI accelerators, Performance engineering, Open source contributions
Technologies
PyTorch, JAX, Trainium, Neuron SDK, C/C++, Python
Responsibilities
Implement and tune distributed training components for large-scale and RL workloads, Apply parallelism strategies and reduced-precision formats, Profile workloads to identify bottlenecks, Build and maintain internal tooling and benchmarks
Seniority
Senior, hands-on IC