Senior SRE - AI/ML & Data Platforms
Core
Senior SRE leading AI/ML and data platform reliability, designing observability strategies, and establishing safe AI workflows for large-scale distributed systems.
Role type
Senior IC Site Reliability Engineer (AI/ML & Data Platforms)
Builds
Scalable data platform infrastructure, observability solutions, and AI-assisted reliability workflows for distributed systems.
Domain
Financial services, AI/ML, Big Data, Distributed Systems
Deliverable
production ML models | infrastructure
Required skills
Site Reliability Engineering (SRE) principles, SLI/SLO/SLA management, observability (white/black-box monitoring), distributed systems design, disaster recovery, data-driven reporting, technical mentorship
Preferred skills
AWS platform administration, Databricks management, Spark/MapReduce pipeline development, containerization (Docker/Kubernetes), CI/CD and IaC (Terraform), Python automation
Technologies
AWS, Databricks, Spark, Kubernetes, Terraform, Python, Datadog, Dynatrace, Grafana, Prometheus, Splunk, CI/CD
Responsibilities
Create and deliver high-quality designs and roadmaps for data platform initiatives; Partner to design and implement observability and reliability approaches for complex systems; Drive evolution and troubleshooting of critical platform components; Lead reuse-first adoption of AI-assisted reliability workflows across SDLC; Contribute to the SRE community through forums and conferences.
Seniority
Senior, hands-on IC with mentorship responsibilities