CareerPlanGet AI match score →

Senior Site Reliability Engineer

US - California🌐 Remote💼 Full-time💰 $141,800–$141,800🗓 2026-07-08 → 2026-07-31

Core

Building and maintaining the telemetry infrastructure for AI platforms, ensuring high availability and reliability for enterprise observability data.

Role type

Senior Site Reliability Engineer (IC)

Builds

Cloud-based observability and telemetry products for enterprise customers

Domain

Cloud infrastructure, observability, and AI platform support

Deliverable

production ML models | infrastructure

Required skills

Linux Systems Engineering, Cloud platforms (AWS/Azure), Container orchestration, Infrastructure as Code (Terraform/Ansible), APM/Observability tools (Splunk/Prometheus/Grafana), JavaScript/Node.js/TypeScript, Continuous delivery, Incident response, SLOs

Preferred skills

Cloud SDKs, Cloud design patterns for scale and resiliency, Application security best practices

Technologies

Terraform, Ansible, AWS, Azure, Kubernetes, New Relic, Splunk, CloudWatch, Prometheus, Grafana, Kibana, Sentry, PagerDuty, FireHydrant, Blameless

Responsibilities

Design, implement, and operate observability systems for complex cloud platforms; Monitor production systems for availability, latency, and health; Drive operational excellence and reduce toil through automation; Engage with product teams to improve system reliability and resilience; Manage on-call duties and incident response

Seniority

Senior, hands-on IC

Sourced via greenhouse · Listed on CareerPlan, which tracks 70,000+ jobs from 20+ sources.
Apply on Greenhouse ↗