上海-大模型训练Infra研发工程师(基座研发方向)(J101257)
Core
Design, develop, and optimize infrastructure for training large-scale foundation models (e.g., Baidu ERNIE Bot) and the PaddlePaddle deep learning framework.
Role type
Senior IC infrastructure engineer (large model training)
Builds
Distributed training systems, high-performance computing libraries, and engineering efficiency platforms for AI models.
Domain
AI/ML infrastructure, distributed computing, high-performance computing (HPC)
Deliverable
production ML models
Required skills
C++, Python, CUDA programming, deep learning framework internals (PaddlePaddle, PyTorch, TensorFlow), distributed training architecture, Linux/Unix development, network programming, multi-threading
Preferred skills
DeepSpeed, Megatron, MPI, NCCL, RDMA, GPU Direct, Kubernetes, Docker, OCI, Istio, cloud-native application development, AI training communication optimization, hardware performance analysis tools (CodeXL, NVVP, GPA), parallel computing optimization
Technologies
CUDA, C++, Python, PaddlePaddle, PyTorch, TensorFlow, DeepSpeed, Megatron, MPI, NCCL, RDMA, Kubernetes, Docker, OCI, Istio, CodeXL, NVVP, GPA
Responsibilities
Optimize training efficiency for large models and PaddlePaddle distributed training; explore frontier technologies in algorithm-engineering co-optimization; improve framework compatibility across OS and hardware; design and develop high-performance computing and communication libraries; maintain CI/CE facilities to ensure stability; develop automation platforms for engineering efficiency metrics.