Researcher, Recursive Self-Improvement Safety
Core
Designing and implementing control measures, risk assessments, and monitoring systems to mitigate future misalignment risks in AI systems capable of recursive self-improvement.
Role type
Senior IC AI safety researcher (recursive self-improvement safety)
Builds
Pre-deployment risk-assessment tools, control measures, automated auditing systems, and safety pipelines for production models.
Domain
AI Safety / Machine Learning / Recursive Self-Improvement
Deliverable
production ML models
Required skills
hypothesis-driven research, strategic prioritization in weak feedback loop domains, rapid prototyping, technical execution, risk assessment design, automated auditing, model behavior science, coordination and verification of safety agreements, blindspot identification in mitigation areas
Preferred skills
experience in ML research, AI alignment, AI verification, training model organisms of misbehavior, training interventions for safety-relevant capabilities
Technologies
production traffic analysis, Chain-of-Thought monitoring, reward hacking detection, sandbagging detection, scheming detection, automated auditing frameworks
Responsibilities
Prioritize concrete directions for preparing against future misalignment threats; execute rapid prototyping of safety interventions; build and iterate components for safety pipelines; secure buy-in and communicate work clearly; collaborate with or manage staff to scale problem-solving efforts
Seniority
Senior, hands-on IC