Linux/HPC System Administrator
Core
Manage and support onsite HPC resources, beamline systems, and services at a scientific user facility to ensure reliability and scalability for advanced computational workloads.
Role type
Senior Linux/HPC System Administrator
Builds
HPC clusters, Globus data transfer nodes, GPU nodes, monitoring systems, IBM Storage Scale appliances, and PBS Pro scheduler environments
Domain
Scientific research / High-Performance Computing / Data Acquisition
Deliverable
infrastructure
Required skills
Linux/Unix system administration, HPC cluster management, GPU node administration, IBM Storage Scale (GPFS) administration, InfiniBand networking, PBS Pro scheduler management, Grafana monitoring, problem-solving
Preferred skills
Scripting (Python, Bash), networking protocols, security practices, automation
Technologies
Linux, Globus, GPU, InfiniBand, IBM Storage Scale, PBS Pro, Grafana
Responsibilities
Configure and maintain GPU nodes for ML/AI workloads; Administer IBM Storage Scale appliances and InfiniBand networks; Provide advanced support for beamline computers and networking; Manage PBS Pro scheduler for job queuing and resource allocation; Maintain monitoring tools to track system health; Implement security best practices and ensure compliance
Seniority
Senior, hands-on IC