30,729 open positions
Engineering Manager, GPU Reliability, Accelerators↗
GoogleSunnyvale, CA, US
$207k–$207k6d
Lead the GPU Reliability Systems Operations and Tooling software organization to ensure the reliability of Google's massive GPU supercomputer systems used for AI advancements.
Software Engineer- AI/ML, Amazon Neuron Training
AmazonCupertino, California, United States
$165k–$224k6d
Building distributed training infrastructure, parallelism techniques, and high-performance kernels for large-scale pretraining, post-training, and reinforcement learning workloads on AWS Trainium custom ML accelerators.
Sr. Software Engineer- AI/ML, AWS Neuron Distributed Training
AmazonCupertino, California, United States
6d
Architect and implement business-critical features for distributed training on AWS Trainium, optimizing throughput and convergence for frontier-scale models.
← Select a job to preview