异构加速框架工程师(深圳/北京/上海)
Core
Design and optimize GPU/AI chip performance for AI inference, including low-level tuning, framework architecture innovation, and high-performance operator development.
Role type
Senior IC machine-learning infrastructure engineer (GPU/AI chip optimization)
Builds
High-performance inference engines and optimized AI frameworks
Domain
AI Infrastructure / High-Performance Computing
Deliverable
production ML models
Required skills
C/C++, Python, CUDA, Triton, Ascend C, Cublas, Cutlass, CK, Torch-Compile, parallel computing, memory optimization, communication optimization
Preferred skills
MOE architecture, dynamic computation graph compilation, KV Cache optimization, dynamic batching, Attention operator customization, search/ad/recommendation system acceleration, open-source contributions, top-tier conference publications