CareerPlanSign in

Senior System Architect, Infrastructure Reliability

US, CA, Santa Clara💼 Full-time💰 $184,000–$184,000🗓 2026-09-25 → 2026-09-26

Core

Architect and build an automated framework to ingest telemetry from CPU and GPU clusters, identify root causes of job failures in real-time, and distinguish between hardware faults, infrastructure instability, and software defects for EDA workloads.

Role type

Senior System Architect (Infrastructure Reliability)

Builds

Automated failure attribution frameworks and diagnostic pipelines for HPC/EDA clusters

Domain

High-Performance Computing (HPC) / EDA / Accelerated Computing

Deliverable

production ML models | infrastructure

Required skills

Distributed systems programming, C++, Python, CPU architecture (x86/ARM), Cluster resource management (Slurm/Kubernetes), Root cause analysis (RCA), Machine learning for classification, Linux kernel internals, GPU monitoring (DCGM/NVML)

Preferred skills

Low-level diagnostics (/dev/mcelog, dmesg), Checkpoint/restore technologies (CRIU), Non-intrusive monitoring, NUMA optimization

Technologies

C++, Python, Slurm, Kubernetes, Linux, DCGM, NVML, CUDA

Responsibilities

Architect scalable flight recorder systems for high-fidelity state capture; Build automated diagnostics correlating GPU XID errors, PCIe failures, and system events; Implement low-overhead distributed logging and tracing; Develop ML-based heuristics to classify failure types; Engineer resiliency signals for proactive job migration or checkpointing

Seniority

Senior, hands-on IC

Sourced via workday · Listed on CareerPlan, which tracks 70,000+ jobs from 20+ sources.