CareerPlanSign in

豆包大模型算法工程师-火山方舟

北京💼 Full-time🗓 2026-09-28

Core

Improving RL training systems and optimizing performance/stability for large model SFT/RL training, supporting Reasoning, Agent, and VLM post-training tasks.

Role type

Senior IC large model algorithm engineer (RL & Post-Training)

Builds

RL training systems, post-training pipelines for reasoning/agent/VLM models

Domain

Large Language Models, Reinforcement Learning, Distributed Systems

Deliverable

production ML models

Required skills

Reinforcement Learning algorithms, Large model post-training (DPO, PPO, GRPO, Reward Modeling), Distributed training frameworks (PyTorch FSDP, DeviceMesh, DTensor), High-performance inference engines (vLLM, SGLang), Python, C/C++/Rust/Golang/Java, Data structures and algorithms

Preferred skills

OpenRLHF, VeRL development experience, Off-Policy RL, SRFT, OnPolicy Distillation

Responsibilities

Extend RL Trainer functionality based on Ray, explore Rollout/sampling strategies, integrate Reward systems, manage trajectories in complex Agent Loop tasks, optimize SFT/RL training performance and stability, explore frontier algorithms and training techniques

Seniority

Senior, hands-on IC

Sourced via bytedance · Listed on CareerPlan, which tracks 855,000+ jobs from 20+ sources.