CareerPlanSign in

Research Scientist - Post-training

San Francisco💼 Full-time💰 $300,000–$300,000🗓 2026-02-11 → 2026-09-26

Core

Developing post-training and reinforcement learning methods to help large multimodal models reason, plan, and interact in real time.

Role type

Research Scientist (Post-training & RL)

Builds

Scalable preference-based training systems (RLHF, DPO, hybrid feedback loops) and evaluation frameworks for large-scale models.

Domain

Artificial Intelligence / Large Language Models / Reinforcement Learning

Deliverable

production ML models

Required skills

Large-scale post-training, Reinforcement Learning (RLHF, DPO, SFT), LLM or multimodal training systems, Reward model design, Scalable evaluation frameworks, Training strategy design

Preferred skills

Publication record at top venues (NeurIPS, ICLR, ICML, CVPR, ACL), Experience with model architecture

Technologies

RLHF, DPO, SFT pipelines

Responsibilities

Design reward models, create scalable evaluation frameworks, develop training strategies for large-scale learning

Seniority

Senior, hands-on IC

Sourced via techire · Listed on CareerPlan, which tracks 845,000+ jobs from 20+ sources.