CareerPlanSign in

Principal Site Reliability Engineer

US, CA, Santa Clara💼 Full-time💰 $248,000–$248,000🗓 2026-09-08 → 2026-09-26

Core

Designing, building, and operating large-scale production systems for NVIDIA's AI Platform Runtime with exceptional efficiency, resilience, and availability.

Role type

Principal Site Reliability Engineer (AI Platform)

Builds

Highly available, resilient, secure, and scalable distributed platforms powering next-generation AI-driven products and services.

Domain

High-Performance Computing, AI/ML Infrastructure, Cloud Systems

Deliverable

production ML models | infrastructure

Required skills

Distributed systems architecture, Linux, Kubernetes, public cloud platforms (AWS/Azure/GCP), Python/Go/TypeScript/JavaScript/Java, Infrastructure-as-Code (Terraform/Crossplane), Observability (OpenTelemetry), Reliability Engineering practices

Preferred skills

Large-scale AI/ML platform design, GPU infrastructure, AI agents/agentic workflows, Machine learning for anomaly detection and autonomous remediation

Responsibilities

Define long-term technical vision and roadmap for reliability; Architect distributed platforms; Lead design of AI agents and intelligent automation; Establish platform-wide reliability standards; Identify systemic risks and lead cross-functional improvement programs; Advance observability across complex environments; Provide technical leadership during critical incidents; Develop reference architectures and automation frameworks; Mentor senior engineers and technical leaders

Seniority

Principal, strategy & mentorship

Sourced via workday · Listed on CareerPlan, which tracks 70,000+ jobs from 20+ sources.