混元大模型推理研发高级工程师(深圳/北京/上海/杭州)
Core
Design and optimize high-throughput, low-latency inference systems for large language models.
Role type
Senior IC large model inference engineer
Builds
Production inference systems for large language models
Domain
Artificial Intelligence / Large Language Models
Deliverable
production ML models
Required skills
C/C++, Python, GPU programming (CUDA, OpenCL), inference engines (TensorRT, vLLM, SGLang), deep learning operator optimization, CPU/GPU heterogeneous acceleration, distributed inference
Preferred skills
Computer architecture background, server-side AI chip experience, model training and inference debugging
Technologies
Cuda, OpenCL, cublas, cudnn, cutlass, TensorRT, FasterTransformer, TensorRT-LLM, vLLM, SGLang
Sourced via tencent · Listed on CareerPlan, which tracks 850,000+ jobs from 20+ sources.