AI infra异构计算研发工程师
Core
Design and build high-performance computing clusters and AI acceleration platforms for large model training and inference.
Role type
Senior IC AI infrastructure engineer (heterogeneous computing)
Builds
Cluster compute scheduling, network management, fault recovery, and AI acceleration platforms
Domain
Cloud computing + AI infrastructure
Deliverable
production ML models
Required skills
C++, Python, Linux development, TensorRT, Triton, PyTorch, TensorFlow, distributed computing, GPU virtualization, RDMA, MPI, GPU Direct
Preferred skills
Cloud platform adaptation, self-developed AI chip integration, product planning, large-scale cluster optimization
Responsibilities
Develop high-performance computing cluster platforms; Adapt and optimize mainstream AI frameworks for cloud platforms; Optimize AI model training and inference performance; Track AI trends and define product roadmaps; Explore self-developed AI chip cloud capabilities
