Principal Software Engineer, At-Scale Reliability and Fleet Intelligence — CSP Engagements
Core
Principal Software Engineer acting as technical focal point for fleet-scale reliability, working with CSP/hyperscale customers to ensure NVIDIA platforms achieve target MTBI in production.
Role type
Principal Software Engineer (Fleet Reliability & CSP Engagements)
Builds
Shared understanding of reliability architecture, fleet telemetry integration, predictive failure models, and burn-in/certification frameworks for NVIDIA GPU platforms.
Domain
Datacenter infrastructure, High-Performance Computing (HPC), GPU/Accelerator hardware reliability, Fleet Operations
Deliverable
production ML models | product features | dashboards & analysis
Required skills
Systems software at datacenter scale, Multi-NUMA architecture, Statistical failure analysis (Pareto, Weibull, survival analysis), Fleet-level telemetry & observability, Hardware failure mode classification, Burn-in & stress testing frameworks, Cross-functional leadership without direct authority
Preferred skills
Hyperscaler fleet reliability experience, NVIDIA GPU error taxonomy (Xid, NVLink, CPER), Predictive maintenance models, MTBI/MTBF standard definition
Technologies
Time-series databases, Anomaly detection systems, Health scoring algorithms, Telemetry pipelines, GPU firmware/driver stacks
Responsibilities
Drive reliability work streams with CSP engineering teams, Synthesize fleet reliability data to identify systemic failure patterns, Define consistent MTBI measurement methodology, Conduct fleet-scale failure pattern analysis, Drive fleet health monitoring integration architecture, Collaborate on burn-in reliability test environments and cluster certification criteria, Develop and validate predictive failure models using fleet telemetry
Seniority
Principal, hands-on IC with strategic cross-functional influence