豆包大模型算法工程师-火山方舟
Core
Improving RL training systems and optimizing performance/stability for large model SFT/RL training, supporting Reasoning, Agent, and VLM post-training tasks.
Role type
Senior IC large model algorithm engineer (RL & Post-Training)
Builds
RL training systems, post-training pipelines for reasoning/agent/VLM models
Domain
Large Language Models, Reinforcement Learning, Distributed Systems
Deliverable
production ML models
Required skills
Reinforcement Learning algorithms, Large model post-training (DPO, PPO, GRPO, Reward Modeling), Distributed training frameworks (PyTorch FSDP, DeviceMesh, DTensor), High-performance inference engines (vLLM, SGLang), Python, C/C++/Rust/Golang/Java, Data structures and algorithms
Preferred skills
OpenRLHF, VeRL development experience, Off-Policy RL, SRFT, OnPolicy Distillation
Responsibilities
Extend RL Trainer functionality based on Ray, explore Rollout/sampling strategies, integrate Reward systems, manage trajectories in complex Agent Loop tasks, optimize SFT/RL training performance and stability, explore frontier algorithms and training techniques
Seniority
Senior, hands-on IC