CareerPlanSign in

Senior Inference Engineer, GPU Kernel Optimization

US, CA, Santa Clara💼 Full-time💰 $184,000–$184,000🗓 2026-07-27 → 2026-10-07

Core

Building silicon-measured kernel benchmarking infrastructure, model-level performance projection tooling, and agentic optimization systems to accelerate NVIDIA's LLM inference stack.

Role type

Senior Inference Engineer (GPU Kernel Optimization) (via careerplan.io/jobs/893396599937-senior-inference-engineer-gpu-kernel-optimization-at-nvidia)

Builds

GPU kernel microbenchmarking infrastructure, end-to-end model performance analysis tools, and agentic kernel optimization systems

Domain

LLM Inference, GPU Architecture, Systems Programming

Deliverable

production ML models

Required skills

Python, C++, GPU profiling (CUPTI, NSYS, NCU), LLM inference frameworks (TRT-LLM, SGLang, vLLM), GPU kernel optimization (CUDA, CUTLASS, Triton), PTX/SASS analysis

Preferred skills

SASS/PTX-level kernel analysis, compiler middle-end optimization (LLVM, MLIR), agentic system development, open-source contributions (FlashInfer, Triton)

Responsibilities

Measure competing kernel implementations at real-silicon fidelity; connect performance evidence to model-level serving economics; apply AI-driven analysis to diagnose performance gaps and validate with silicon measurements

Seniority

Senior, hands-on IC