大模型训练系统与优化工程师(VLM/Agent RL方向)-Data
Core
Designing and optimizing large-scale distributed training systems for post-training, Agent RL, and multi-modal models.
Role type
Senior IC machine-learning systems engineer (VLM/Agent RL)
Builds
High-performance training frameworks and evaluation harnesses for 100B+ parameter models
Domain
AI Infrastructure / Large Language Models / Reinforcement Learning
Deliverable
production ML models
Required skills
Python, C++, PyTorch, DeepSpeed, Megatron, FSDP, distributed training optimization, operator fusion, memory optimization
Preferred skills
Agent RL frameworks (PPO/GRPO), MoE/Linear Attention architectures, multi-modal training, convergence debugging
Responsibilities
Refactor post-training frameworks for multi-modal compatibility; Optimize distributed training strategies for 100B–1T parameter models; Build standardized evaluation benchmarks and harnesses for Agent RL; Support training for novel architectures like MoE and multi-modal inputs.