Principal Technical Account Manager, AWS Enterprise Support, NAMER-Sp
Core
Principal AI/ML HPC Specialist guiding enterprise customers through ambitious machine learning transformation journeys, solving complex distributed training and inference challenges.
Role type
Principal, hands-on IC machine-learning engineer (HPC/AI)
Builds
Production-grade AI/ML training and inference solutions, distributed GPU/Trainium clusters, MLOps pipelines
Domain
Cloud computing, Artificial Intelligence, High-Performance Computing (HPC)
Deliverable
production ML models
Required skills
Distributed model training, GPU cluster architecture, NCCL communication tuning, Slurm job scheduling, Deep Learning frameworks (PyTorch, DeepSpeed), AWS Parallel Computing Service, SageMaker HyperPod, AWS Trainium/Neuron SDK, LLM development, MLOps pipelines, Cluster observability
Preferred skills
Physics-informed neural networks, Surrogate models, Simulation-ML hybrid architectures, Capacity planning for ML, Reference architecture design
Technologies
AWS ParallelCluster, P6/P6e, G7/G7e instances, Trn3 UltraServers, EFA SRD, PyTorch FSDP, DeepSpeed, Megatron-LM, Amazon FSx for Lustre, DLAMIs, AWS Step Functions, AWS Batch, Elastic Fabric Adapter, EC2 Capacity Blocks
Responsibilities
Lead technical deep-dives and performance optimization for enterprise AI/ML workloads; Design and implement production-grade AI/ML training and inference solutions; Support customers in implementing business-critical HPC capabilities; Partner with service teams to enhance model training throughput and drive operational efficiency; Develop and nurture technical partnerships with enterprise stakeholders.
Seniority
Principal, hands-on IC