Research Scientist - Post-training
Core
Developing post-training and reinforcement learning methods to help large multimodal models reason, plan, and interact in real time.
Role type
Research Scientist (Post-training & RL)
Builds
Scalable preference-based training systems (RLHF, DPO, hybrid feedback loops) and evaluation frameworks for large-scale models.
Domain
Artificial Intelligence / Large Language Models / Reinforcement Learning
Deliverable
production ML models
Required skills
Large-scale post-training, Reinforcement Learning (RLHF, DPO, SFT), LLM or multimodal training systems, Reward model design, Scalable evaluation frameworks, Training strategy design
Preferred skills
Publication record at top venues (NeurIPS, ICLR, ICML, CVPR, ACL), Experience with model architecture
Technologies
RLHF, DPO, SFT pipelines
Responsibilities
Design reward models, create scalable evaluation frameworks, develop training strategies for large-scale learning
Seniority
Senior, hands-on IC