Senior Site Reliability Engineer
Core
Building and maintaining the telemetry infrastructure for AI platforms, ensuring high availability and reliability for enterprise observability data.
Role type
Senior Site Reliability Engineer (IC)
Builds
Cloud-based observability and telemetry products for enterprise customers
Domain
Cloud infrastructure, observability, and AI platform support
Deliverable
production ML models | infrastructure
Required skills
Linux Systems Engineering, Cloud platforms (AWS/Azure), Container orchestration, Infrastructure as Code (Terraform/Ansible), APM/Observability tools (Splunk/Prometheus/Grafana), JavaScript/Node.js/TypeScript, Continuous delivery, Incident response, SLOs
Preferred skills
Cloud SDKs, Cloud design patterns for scale and resiliency, Application security best practices
Technologies
Terraform, Ansible, AWS, Azure, Kubernetes, New Relic, Splunk, CloudWatch, Prometheus, Grafana, Kibana, Sentry, PagerDuty, FireHydrant, Blameless
Responsibilities
Design, implement, and operate observability systems for complex cloud platforms; Monitor production systems for availability, latency, and health; Drive operational excellence and reduce toil through automation; Engage with product teams to improve system reliability and resilience; Manage on-call duties and incident response
Seniority
Senior, hands-on IC