Site Reliability Engineering Manager
Core
Lead a team of Site Reliability Engineers to ensure the reliability, scalability, and operational excellence of Apple's enterprise data warehouse, analytics platforms, and data pipelines supporting business functions like Sales, Finance, and Marketing.
Role type
Senior IC SRE Manager (hands-on technical leadership)
Builds
Scalable, resilient distributed data platforms and analytics solutions (ETL, real-time/batch processing)
Domain
Enterprise Data & Analytics / Cloud Infrastructure
Required skills
Site Reliability Engineering (SRE), People Management, Incident Response, Root Cause Analysis, Infrastructure as Code (IaC), Cloud-Native Services, Observability, Programming (Python/Java/Scala), Distributed Systems
Preferred skills
Enterprise Data Systems, Data Visualization Tools, Modern Distributed Databases, Generative AI for Operations, System Design
Technologies
Kafka, Spark, Iceberg, Airflow, AWS, GCP, Kubernetes, Prometheus, Grafana, CloudWatch, Snowflake, Cassandra, SingleStore, SAP HANA
Responsibilities
Lead and mentor an SRE team while actively contributing to code and platform design; Drive automation, cost optimization, and operational efficiency; Participate in on-call rotations and lead major incident response; Perform root cause analysis and drive infrastructure hardening; Collaborate with cross-functional teams to enhance system reliability; Establish production readiness standards for security and disaster recovery.