Senior Software Engineer, Deep Learning Inference - TensorRT
Core
Building a state-of-the-art inference framework (TensorRT) to accelerate Deep Learning models, especially Large Language Models, on NVIDIA GPUs.
Role type
Senior Software Engineer (Deep Learning Inference)
Builds
TensorRT SDK components, graph parsers, optimizers, and tools for deploying trained deep learning models.
Domain
Deep Learning Inference, GPU Computing, System Software
Deliverable
production ML models
Required skills
C++ (C++11/C++14/C++17/C++20), Python, Machine Learning concepts, Computer Architecture, Data Structures, Algorithms
Preferred skills
CUDA/OpenCL kernel programming, System Software development, Performance benchmarking and profiling, Compiler development, Experience with PyTorch/TensorFlow/ONNX Runtime
Technologies
TensorRT, CUDA, OpenCL, PyTorch, TensorFlow, ONNX Runtime, C++, Python
Responsibilities
Develop robust inferencing software scalable to multiple platforms; Develop TensorRT SDK components; Follow academic AI developments to update TensorRT; Build graph parsers, optimizers, and deployment tools; Collaborate with deep learning experts, GPU architects, and DevOps engineers.
Seniority
Senior, hands-on IC