CareerPlanGet AI match score →

Research Scientist, Agent Robustness

San Francisco, CA💼 Full-time💰 $216,000–$216,000🗓 2026-07-09 → 2026-07-31

Core

Researching fundamental challenges in building safe, aligned AI agents, designing evaluation harnesses, and characterizing failure modes for multi-agent systems.

Role type

Research Scientist (AI Safety & Agent Robustness)

Builds

Evaluation harnesses, exploits, mitigations, and research prototypes for AI agent safety.

Domain

Artificial Intelligence / AI Safety / Agent Systems

Deliverable

production ML models | research

Required skills

Technical research collaboration, agent scaffolding design, evaluation harness design, rapid prototyping, post-training techniques (RLHF, DPO, GRPO), generative AI research publication

Preferred skills

Agent evaluation frameworks (SWE-bench, WebArena, OSWorld), red-teaming, prompt injection, adversarial testing

Technologies

RLHF, DPO, GRPO, SWE-bench, WebArena, OSWorld, Inspect

Responsibilities

Research AI agent capabilities regarding safety and risk factors; Design and build harnesses to test AI agents for harmful actions; Design exploits and mitigations for unique failure modes in multi-agent systems; Characterize and design mitigations for risks involving multiple interacting AI agents.

Seniority

Mid-Senior, hands-on IC

Sourced via greenhouse · Listed on CareerPlan, which tracks 70,000+ jobs from 20+ sources.
Apply on Greenhouse ↗