Principal Site Reliability Engineer
Core
Designing, building, and operating large-scale production systems for NVIDIA's AI Platform Runtime with exceptional efficiency, resilience, and availability.
Role type
Principal Site Reliability Engineer (AI Platform)
Builds
Highly available, resilient, secure, and scalable distributed platforms powering next-generation AI-driven products and services.
Domain
High-Performance Computing, AI/ML Infrastructure, Cloud Systems
Deliverable
production ML models | infrastructure
Required skills
Distributed systems architecture, Linux, Kubernetes, public cloud platforms (AWS/Azure/GCP), Python/Go/TypeScript/JavaScript/Java, Infrastructure-as-Code (Terraform/Crossplane), Observability (OpenTelemetry), Reliability Engineering practices
Preferred skills
Large-scale AI/ML platform design, GPU infrastructure, AI agents/agentic workflows, Machine learning for anomaly detection and autonomous remediation
Responsibilities
Define long-term technical vision and roadmap for reliability; Architect distributed platforms; Lead design of AI agents and intelligent automation; Establish platform-wide reliability standards; Identify systemic risks and lead cross-functional improvement programs; Advance observability across complex environments; Provide technical leadership during critical incidents; Develop reference architectures and automation frameworks; Mentor senior engineers and technical leaders
Seniority
Principal, strategy & mentorship