Hardware Reliability Engineer, Infrastructure Reliability & Quality
Core
Proactively drive reliability risk identification, assessment, and mitigation for datacenter infrastructure and security equipment (e.g., Air Handling Units, Generators, Liquid Cooling, Chillers), including root cause analysis of critical failures and continuous improvement.
Role type
Senior Hardware Reliability Engineer (Infrastructure)
Builds
Datacenter infrastructure reliability models, risk analysis plans, and corrective/preventive actions for AWS global infrastructure.
Domain
Cloud Infrastructure / Datacenter Hardware / Reliability Engineering
Deliverable
production ML models | product features | dashboards & analysis | research | client delivery | infrastructure | physical/clinical work
Required skills
Physics-of-Failure approach, accelerated life testing, stress analysis, finite element analysis, statistical modeling, root cause analysis, vendor qualification, system reliability modeling
Preferred skills
Liquid cooling infrastructure expertise, supply chain partner management, lifecycle environmental stress analysis
Technologies
Reliability block diagrams, statistical modeling tools, data analytics platforms
Responsibilities
Drive root cause analysis of critical equipment failures; develop datacenter system-level reliability models; monitor product performance in the field; drive vendor auditing and quarterly reviews; execute risk identification plans for product design and deployment.
Seniority
Senior, hands-on IC with program management