Principal Technical Account Manager, ES - NAMER - US-Frontier AI
Core
Strategic partner guiding Frontier AI research customers in designing, building, and operating large-scale AI/ML training and inference solutions on AWS.
Role type
Principal Technical Account Manager (AI/ML Infrastructure)
Builds
Production-grade distributed training clusters, GPU/Trainium UltraClusters, and MLOps pipelines for frontier models.
Domain
Cloud Computing / Artificial Intelligence / High-Performance Computing (HPC)
Deliverable
production ML models | infrastructure
Required skills
Distributed training architecture, GPU cluster management, NCCL optimization, HPC-to-AI convergence, MLOps pipeline design, Cloud cost governance, Strategic solution design, Technical advocacy, Stakeholder management
Preferred skills
Experience with PyTorch FSDP/DeepSpeed/Megatron-LM, AWS ParallelCluster/HyperPod, Neuron SDK, Slurm job scheduling, LLM training (Llama/GPT-class)
Technologies
AWS Parallel Computing Service (PCS), AWS ParallelCluster, P6e/G7e instances, Trn3 UltraServers, EFA SRD, SageMaker HyperPod, Amazon FSx for Lustre, Deep Learning AMIs (DLAMIs), AWS Step Functions, AWS Batch, Elastic Fabric Adapter
Responsibilities
Lead technical deep-dives and performance optimization for enterprise AI/ML workloads; Architect and validate innovative solutions for multi-node GPU clusters; Partner with service teams to enhance model training throughput and operational efficiency; Develop technical partnerships with enterprise stakeholders; Provide strategic guidance on HPC-to-AI convergence patterns; Train field teams on distributed training patterns and cluster operations.
Seniority
Principal, strategic advisor & hands-on architecture