CareerPlanSign in

Site Reliability Engineer

San Francisco💼 Full-time🗓 2026-05-11 → 2026-09-25

Core

Define and codify gold standards for day 2 operations of a mission-critical ML inference platform, building robust systems, automations, and observability tooling to ensure reliability at scale.

Role type

Senior Site Reliability Engineer (ML Infrastructure)

Builds

Multi-cloud Kubernetes infrastructure, observability tooling, automated mitigations, and incident response systems for AI model serving.

Domain

Cloud Infrastructure / Machine Learning Operations

Deliverable

production ML models | infrastructure

Required skills

Kubernetes (multi-cloud), observability tooling (metrics, logging, dashboards, alerting), infrastructure-as-code, GitOps workflows, incident response, runbook authoring, post-mortem analysis, system design, trade-off analysis

Preferred skills

VictoriaMetrics, Prometheus, Loki, ELK, Grafana, Terraform, Helm, Flux CD, ArgoCD, incident.io, AI-assisted tooling development

Technologies

Kubernetes, EKS, GKE, VictoriaMetrics, Prometheus, Loki, ELK, Grafana, Terraform, Helm, Flux CD, ArgoCD, incident.io

Responsibilities

Own reliability of multi-cloud Kubernetes infrastructure including incident response and remediation; Build and maintain observability infrastructure as code; Author and improve runbooks for recurring failure patterns; Convert high-frequency failure patterns into automated mitigations; Diagnose and resolve runtime issues related to latency, memory, GPU utilization, and concurrency; Define and instrument SLOs and SLIs across workloads

Seniority

Senior, hands-on IC

Sourced via ashby · Listed on CareerPlan, which tracks 70,000+ jobs from 20+ sources.