Research Scientist, Agent Robustness
Core
Researching fundamental challenges in building safe, aligned AI agents, designing evaluation harnesses, and characterizing failure modes for multi-agent systems.
Role type
Research Scientist (AI Safety & Agent Robustness)
Builds
Evaluation harnesses, exploits, mitigations, and research prototypes for AI agent safety.
Domain
Artificial Intelligence / AI Safety / Agent Systems
Deliverable
production ML models | research
Required skills
Technical research collaboration, agent scaffolding design, evaluation harness design, rapid prototyping, post-training techniques (RLHF, DPO, GRPO), generative AI research publication
Preferred skills
Agent evaluation frameworks (SWE-bench, WebArena, OSWorld), red-teaming, prompt injection, adversarial testing
Technologies
RLHF, DPO, GRPO, SWE-bench, WebArena, OSWorld, Inspect
Responsibilities
Research AI agent capabilities regarding safety and risk factors; Design and build harnesses to test AI agents for harmful actions; Design exploits and mitigations for unique failure modes in multi-agent systems; Characterize and design mitigations for risks involving multiple interacting AI agents.
Seniority
Mid-Senior, hands-on IC