Member of Technical Staff - Safety
Core
Own the red-teaming and adversarial evaluation pipeline for open AI models, acting as a gatekeeper for release safety and alignment.
Role type
Senior IC AI Safety Engineer (Red Teaming & Adversarial Evaluation)
Builds
Scalable, automated safety benchmarks and adversarial testing pipelines for open-weight LLMs.
Domain
Artificial Intelligence / Large Language Model Safety
Deliverable
production ML models
Required skills
LLM safety, adversarial attacks, red-teaming methodologies, interpretability, automated evaluation pipelines, large-scale ML systems
Preferred skills
Reinforcement Learning (RLHF/RLAIF), jailbreaking techniques and defenses
Technologies
LLMs, automated evaluation frameworks
Responsibilities
Continuously probe models for failure modes across security, misuse, and alignment gaps; translate safety findings into concrete guardrails; validate releases against risk thresholds; develop dynamic adversarial testing benchmarks; research and implement state-of-the-art jailbreaking techniques and defenses.
Seniority
Senior, hands-on IC