CareerPlanSign in

混元大模型推理加速工程师(北京/深圳)

Shenzhen, China💼 Full-time🗓 2026-09-28

Core

Build high-throughput, low-latency inference systems for large language models by optimizing frameworks and performance.

Role type

Senior IC machine-learning inference engineer (LLM)

Builds

Production inference systems for large language models

Domain

Artificial Intelligence / Large Language Models / System Performance Optimization

Deliverable

production ML models

Required skills

C/C++, Python, GPU programming (CUDA, OpenCL), deep learning inference frameworks (TensorRT, FasterTransformer, vLLM), model operator optimization, CPU/GPU heterogeneous acceleration analysis, distributed inference

Preferred skills

Computer architecture background, server-side AI chip experience, large-scale model deployment experience

Technologies

CUDA, OpenCL, cuBLAS, cuDNN, CUTLASS, TensorRT, FasterTransformer, TensorRT-LLM, vLLM

Sourced via tencent · Listed on CareerPlan, which tracks 853,000+ jobs from 20+ sources.