CareerPlanSign in

上海-大模型训练Infra研发工程师(基座研发方向)(J101257)

上海市💼 Full-time🗓 2026-07-21 → 2026-09-28

Core

Design, develop, and optimize infrastructure for training large-scale foundation models (e.g., Baidu ERNIE Bot) and the PaddlePaddle deep learning framework.

Role type

Senior IC infrastructure engineer (large model training)

Builds

Distributed training systems, high-performance computing libraries, and engineering efficiency platforms for AI models.

Domain

AI/ML infrastructure, distributed computing, high-performance computing (HPC)

Deliverable

production ML models

Required skills

C++, Python, CUDA programming, deep learning framework internals (PaddlePaddle, PyTorch, TensorFlow), distributed training architecture, Linux/Unix development, network programming, multi-threading

Preferred skills

DeepSpeed, Megatron, MPI, NCCL, RDMA, GPU Direct, Kubernetes, Docker, OCI, Istio, cloud-native application development, AI training communication optimization, hardware performance analysis tools (CodeXL, NVVP, GPA), parallel computing optimization

Technologies

CUDA, C++, Python, PaddlePaddle, PyTorch, TensorFlow, DeepSpeed, Megatron, MPI, NCCL, RDMA, Kubernetes, Docker, OCI, Istio, CodeXL, NVVP, GPA

Responsibilities

Optimize training efficiency for large models and PaddlePaddle distributed training; explore frontier technologies in algorithm-engineering co-optimization; improve framework compatibility across OS and hardware; design and develop high-performance computing and communication libraries; maintain CI/CE facilities to ensure stability; develop automation platforms for engineering efficiency metrics.

Sourced via baidu · Listed on CareerPlan, which tracks 845,000+ jobs from 20+ sources.