HPC Systems Administrator
Core
Own and maintain on-premises high-performance computing (HPC) infrastructure supporting electromagnetics, computational fluid dynamics, and multi-physics simulation for a defence AI company.
Role type
HPC Systems Administrator
Builds
High-availability, performant compute environments for simulation engineers
Domain
Defence AI / High-Performance Computing / Simulation
Deliverable
infrastructure
Required skills
Linux system administration, workload scheduler management (Slurm, PBS Pro), parallel filesystems (Lustre, BeeGFS, GPFS), high-speed interconnects (InfiniBand, RoCE), scripting (Bash, Python), automation (Ansible), commercial simulation software management, licence server administration
Preferred skills
GPU computing (CUDA, NVIDIA toolchains, MPI), HPC containers (Apptainer, Enroot, Pyxis), identity management (Keycloak, FreeIPA, Active Directory, Kerberos), infrastructure-as-code (Terraform), Altair or Siemens simulation suites
Technologies
Slurm, PBS Pro, LSF, Lustre, BeeGFS, GPFS, InfiniBand, RoCE, Bash, Python, Ansible, Lmod, Spack, EasyBuild, FlexLM, CUDA, NVIDIA, MPI, Apptainer, Enroot, Pyxis, Keycloak, FreeIPA, Active Directory, Kerberos, Terraform
Responsibilities
Administer compute nodes, workload schedulers, parallel storage, high-speed interconnects, and licence servers; ensure high availability through monitoring, patching, and incident response; manage queues, fair-share policies, and quotas; automate operational workflows; collaborate with vendors on support and upgrades; maintain security posture and compliance; onboard users and maintain documentation