Data Scientist, AI/ML
Core
Transform millions of chaos engineering experiments into automated failure analysis and remediation to improve internet reliability.
Role type
Senior IC machine-learning engineer (chaos engineering & reliability)
Builds
Intelligent systems for automated failure detection, classification, explanation, and remediation orchestration.
Domain
Chaos Engineering, Reliability Engineering, Distributed Systems
Deliverable
production ML models
Required skills
causal inference, graph ML, time-series modeling, reinforcement learning, data pipeline development, feature store construction, MLOps, model evaluation, distributed systems architecture
Preferred skills
chaos engineering, site reliability engineering (SRE), agentic AI systems, large-scale causal inference in production
Technologies
MLOps tooling, model serving, feature store infrastructure
Responsibilities
Analyze proprietary chaos experiment datasets to identify failure patterns and root causes; Pretrain and fine-tune ML models for automatic failure detection and explanation; Build systems delivering automated remediation recommendations and orchestration; Develop scalable data pipelines and feature stores for training and real-time inference; Collaborate with platform engineers and SREs to integrate AI capabilities into the core product; Research and productionize novel ML approaches like causal AI and agentic systems.
Seniority
Senior, hands-on IC