CareerPlanGet AI match score →

Senior Software Engineer, Deep Learning Inference - TensorRT

US, CA, Santa Clara💼 Full-time💰 $152,000–$152,000🗓 2026-03-17 → 2026-08-01

Core

Building a state-of-the-art inference framework (TensorRT) to accelerate Deep Learning models, especially Large Language Models, on NVIDIA GPUs.

Role type

Senior Software Engineer (Deep Learning Inference)

Builds

TensorRT SDK components, graph parsers, optimizers, and tools for deploying trained deep learning models.

Domain

Deep Learning Inference, GPU Computing, System Software

Deliverable

production ML models

Required skills

C++ (C++11/C++14/C++17/C++20), Python, Machine Learning concepts, Computer Architecture, Data Structures, Algorithms

Preferred skills

CUDA/OpenCL kernel programming, System Software development, Performance benchmarking and profiling, Compiler development, Experience with PyTorch/TensorFlow/ONNX Runtime

Technologies

TensorRT, CUDA, OpenCL, PyTorch, TensorFlow, ONNX Runtime, C++, Python

Responsibilities

Develop robust inferencing software scalable to multiple platforms; Develop TensorRT SDK components; Follow academic AI developments to update TensorRT; Build graph parsers, optimizers, and deployment tools; Collaborate with deep learning experts, GPU architects, and DevOps engineers.

Seniority

Senior, hands-on IC

Sourced via workday · Listed on CareerPlan, which tracks 70,000+ jobs from 20+ sources.
Apply on Workday ↗