Data Scientist, AI/ML
Core
Improving internet reliability by turning millions of chaos engineering experiments into automated failure analysis and remediation using applied machine learning.
Role type
Senior IC machine-learning engineer (chaos engineering & reliability)
Builds
Automated failure analysis and remediation systems for Gremlin's reliability platform
Domain
Chaos engineering, distributed systems, infrastructure reliability
Deliverable
production ML models
Required skills
causal inference, graph ML, time-series modeling, reinforcement learning, data pipeline development, feature store construction, model evaluation, distributed systems experience
Preferred skills
chaos engineering, site reliability engineering (SRE), agentic AI systems, MLOps tooling
Technologies
(none explicitly listed beyond general categories)
Responsibilities
Analyze proprietary chaos experiment datasets to identify failure patterns and root causes; Pretrain and fine-tune ML models to detect and classify failures; Build intelligent systems for automated remediation recommendations; Develop scalable data pipelines and feature stores; Collaborate with platform engineers and SREs to integrate AI capabilities; Research and productionize novel ML approaches like causal AI and agentic systems
Seniority
Senior, hands-on IC