混元大模型推理加速工程师(北京/深圳)
Core
Build high-throughput, low-latency inference systems for large language models by optimizing frameworks and performance.
Role type
Senior IC machine-learning inference engineer (LLM)
Builds
Production inference systems for large language models
Domain
Artificial Intelligence / Large Language Models / System Performance Optimization
Deliverable
production ML models
Required skills
C/C++, Python, GPU programming (CUDA, OpenCL), deep learning inference frameworks (TensorRT, FasterTransformer, vLLM), model operator optimization, CPU/GPU heterogeneous acceleration analysis, distributed inference
Preferred skills
Computer architecture background, server-side AI chip experience, large-scale model deployment experience
Technologies
CUDA, OpenCL, cuBLAS, cuDNN, CUTLASS, TensorRT, FasterTransformer, TensorRT-LLM, vLLM
Sourced via tencent · Listed on CareerPlan, which tracks 853,000+ jobs from 20+ sources.