Senior Inference Engineer, GPU Kernel Optimization
Core
Building silicon-measured kernel benchmarking infrastructure, model-level performance projection tooling, and agentic optimization systems to accelerate NVIDIA's LLM inference stack.
Role type
Senior Inference Engineer (GPU Kernel Optimization) (via careerplan.io/jobs/893396599937-senior-inference-engineer-gpu-kernel-optimization-at-nvidia)
Builds
GPU kernel microbenchmarking infrastructure, end-to-end model performance analysis tools, and agentic kernel optimization systems
Domain
LLM Inference, GPU Architecture, Systems Programming
Deliverable
production ML models
Required skills
Python, C++, GPU profiling (CUPTI, NSYS, NCU), LLM inference frameworks (TRT-LLM, SGLang, vLLM), GPU kernel optimization (CUDA, CUTLASS, Triton), PTX/SASS analysis
Preferred skills
SASS/PTX-level kernel analysis, compiler middle-end optimization (LLVM, MLIR), agentic system development, open-source contributions (FlashInfer, Triton)
Responsibilities
Measure competing kernel implementations at real-silicon fidelity; connect performance evidence to model-level serving economics; apply AI-driven analysis to diagnose performance gaps and validate with silicon measurements
Seniority
Senior, hands-on IC
