CareerPlanSign in

Member of Technical Staff - Safety

San Francisco, CA💼 Full-time🗓 2026-01-13 → 2026-09-25

Core

Own the red-teaming and adversarial evaluation pipeline for open AI models, acting as a gatekeeper for release safety and alignment.

Role type

Senior IC AI Safety Engineer (Red Teaming & Adversarial Evaluation)

Builds

Scalable, automated safety benchmarks and adversarial testing pipelines for open-weight LLMs.

Domain

Artificial Intelligence / Large Language Model Safety

Deliverable

production ML models

Required skills

LLM safety, adversarial attacks, red-teaming methodologies, interpretability, automated evaluation pipelines, large-scale ML systems

Preferred skills

Reinforcement Learning (RLHF/RLAIF), jailbreaking techniques and defenses

Technologies

LLMs, automated evaluation frameworks

Responsibilities

Continuously probe models for failure modes across security, misuse, and alignment gaps; translate safety findings into concrete guardrails; validate releases against risk thresholds; develop dynamic adversarial testing benchmarks; research and implement state-of-the-art jailbreaking techniques and defenses.

Seniority

Senior, hands-on IC

Sourced via ashby · Listed on CareerPlan, which tracks 70,000+ jobs from 20+ sources.