High-Performance Computing (HPC) Engineer
Core
Design, implement, and optimize High-Performance Computing (HPC) clusters for on-premises and cloud environments to support mission-critical technical analysis for national space assets.
Role type
Senior Site Reliability Engineer (HPC Infrastructure)
Builds
Classified and unclassified HPC clusters (10,000-core and 5,000-core), GPU computing environments, and automation solutions.
Domain
Aerospace / Defense / High-Performance Computing
Deliverable
Infrastructure
Required skills
Linux system administration, HPC cluster management, Slurm scheduler, Infrastructure-as-Code, GitOps, GPU computing (CUDA), automation scripting, security hardening
Preferred skills
Kubernetes integration, Lustre file systems, Prometheus/Grafana monitoring, cloud HPC services (AWS ParallelCluster), containerization
Technologies
Slurm, Clush, CUDA, Nsight, Ansible, GitOps, Prometheus, Grafana, Lustre, AWS ParallelCluster
Responsibilities
Manage on-premise classified and unclassified HPC clusters; optimize resource utilization and performance; develop automation solutions; implement GPU computing; monitor and tune system performance; harden Linux systems for security compliance.
Seniority
Senior, hands-on IC with leadership/mentorship responsibilities