Senior Lab Reliability Engineer
Core
Senior technical ownership of lab cluster reliability, automation strategy, and infrastructure for a pre-sales platform team.
Role type
Senior IC systems/reliability engineer (lab infrastructure)
Builds
Production-quality lab clusters, automation tooling, and infrastructure-as-code practices (via careerplan.io/jobs/43-001-9E-176-senior-lab-reliability-engineer)
Domain
Enterprise storage, virtualization, and lab infrastructure
Required skills
Linux systems administration, Python/Bash scripting, Docker/Kubernetes operations, Ansible/infrastructure-as-code, networking fundamentals, virtualization platforms (VMware/Proxmox), enterprise storage systems, troubleshooting complex issues, technical documentation
Preferred skills
VAST Data cluster experience, customer support/reliability engineering background, observability platforms (Grafana/Prometheus), network switch administration, HPC/ML training workloads