CareerPlanSign in

大模型训练系统与优化工程师(VLM/Agent RL方向)-Data

北京💼 Full-time🗓 2026-09-28

Core

Designing and optimizing large-scale distributed training systems for post-training, Agent RL, and multi-modal models.

Role type

Senior IC machine-learning systems engineer (VLM/Agent RL)

Builds

High-performance training frameworks and evaluation harnesses for 100B+ parameter models

Domain

AI Infrastructure / Large Language Models / Reinforcement Learning

Deliverable

production ML models

Required skills

Python, C++, PyTorch, DeepSpeed, Megatron, FSDP, distributed training optimization, operator fusion, memory optimization

Preferred skills

Agent RL frameworks (PPO/GRPO), MoE/Linear Attention architectures, multi-modal training, convergence debugging

Responsibilities

Refactor post-training frameworks for multi-modal compatibility; Optimize distributed training strategies for 100B–1T parameter models; Build standardized evaluation benchmarks and harnesses for Agent RL; Support training for novel architectures like MoE and multi-modal inputs.

Sourced via bytedance · Listed on CareerPlan, which tracks 853,000+ jobs from 20+ sources.