Senior Solution Architect, AI Compute Engineer - NVIS
Core
Deploy, manage, and maintain large-scale AI/HPC infrastructure in Linux environments for academic and commercial customers.
Role type
Senior IC AI/HPC Infrastructure Engineer
Builds
Large-scale AI/HPC systems and GPU clusters for data centers and research institutions
Domain
High-Performance Computing (HPC) and AI Infrastructure
Deliverable
production ML models | infrastructure
Required skills
Linux system administration, cluster management, network routing and tuning, scripting, distributed communication programming, container orchestration
Preferred skills
MPI programming, NCCL optimization, InfiniBand/Ethernet architecture, automation tools (Ansible, Salt, Puppet), Kubernetes
Technologies
Linux, SLURM, LSF, UGE, MPI (OpenMPI, MPICH), NCCL, InfiniBand, Ethernet, Ansible, Salt, Puppet, Kubernetes
Responsibilities
Deploy and maintain AI/HPC infrastructure; act as domain expert during customer planning and implementation; provide knowledge transfer and documentation; provide feedback to internal teams on bugs and improvements
Seniority
Senior, hands-on IC