CareerPlanGet AI match score →

Product Manager, Safeguards Rare Harms

San Francisco, CA💼 Full-time💰 $305,000–$305,000🗓 2026-06-11 → 2026-07-31

Core

Designing and deploying safety systems, evaluations, and interventions to protect users from risks associated with Anthropic's frontier AI models and generative AI products.

Role type

Product Manager, AI Safety & Safeguards

Builds

Safeguards systems, detection tools, evaluation frameworks, and product UX for AI safety across Claude.ai, 1P API, and external cloud providers.

Domain

Artificial Intelligence / AI Safety / Generative AI

Deliverable

production ML models | product features | dashboards & analysis

Required skills

Product management, safety system design, technical tradeoff decision-making, roadmap planning, metrics development, cross-functional collaboration, risk mitigation strategy, ambiguous environment navigation, zero-to-one product building, complex technical communication.

Preferred skills

Experience with AI/ML research teams, policy expertise, data detection and intervention infrastructure, user understanding of AI product usage.

Technologies

AI safety frameworks, evaluation tools, detection systems, cloud platforms, API infrastructure.

Responsibilities

Define upstream safety-by-design strategies and downstream defenses for frontier models; write safety evaluations and communicate safety findings externally; prioritize safety initiatives by defining problems and solution options; align with policy, research, engineering, and cross-functional stakeholders; plan for mitigation of deployment risks from powerful models; develop metrics to measure system performance, blindspots, and user impact.

Seniority

Mid-to-Senior, hands-on IC

Sourced via greenhouse · Listed on CareerPlan, which tracks 70,000+ jobs from 20+ sources.
Apply on Greenhouse ↗