Principal Reliability Scientist
Core
Leading reliability activities for complex, high-performance AI hardware systems using experimental data and advanced modelling to validate product reliability and optimize serviceability.
Role type
Principal Reliability Scientist (Hardware/Systems)
Builds
High-performance AI compute hardware (liquid-cooled architectures, silicon, boards, systems)
Domain
Semiconductor / AI Hardware / High-Performance Computing
Deliverable
production ML models | product features | infrastructure
Required skills
Reliability engineering, Physics-of-failure approaches, Reliability modelling, Experimental design, Statistical data analysis, Failure rate analysis (MTBF, MTTR, RAS, SER), Root cause investigation, Thermal/mechanical/fluid behaviour modelling
Preferred skills
Liquid cooling systems, Fluid dynamics, Soft error mechanisms, Reliability strategy development
Technologies
Liquid-cooled architectures, Silicon, Boards, Systems
Responsibilities
Define and refine reliability requirements across silicon, board and system levels; Apply advanced reliability methodologies to innovative systems including liquid-cooled architectures; Design and execute experiments to generate high-quality reliability data; Analyse experimental, field and manufacturing data to quantify reliability metrics; Use data-driven insights to inform product design trade-offs and spares provisioning strategies; Collaborate with design teams to influence architecture and component selection based on reliability; Support development of system-level reliability models incorporating thermal, mechanical and fluid behaviour; Lead complex root cause investigations into reliability issues; Contribute to the evolution of reliability tools, processes and best practices
Seniority
Principal, hands-on IC with strategic influence