CareerPlanSign in

Site Reliability Engineer II (Full Time) - United States

Boulder, Colorado, US💼 Full-time💰 $125,700–$125,700🗓 2026-09-28 → 2026-10-01

Core

Maintain services in a FedRAMP compliant environment, ensuring 24/7 availability, resilience, and performance for global cloud platforms and mission-critical machine data.

Role type

Senior Site Reliability Engineer (SRE)

Builds

Global cloud observability platform and multi-tenant cloud services

Domain

Cloud infrastructure & Observability

Deliverable

production ML models | infrastructure

Required skills

Incident response, automated playbooks, root cause analysis, on-call rotation, multi-tenant environment management

Preferred skills

Configuration management (Puppet, Ansible, Terraform), containerization (Docker, Kubernetes), Splunk (SPL, dashboards), OpenTelemetry, AI developer tooling

Technologies

Splunk, OpenTelemetry, Puppet, Ansible, Terraform, Docker, Kubernetes, Claude, GitHub Copilot, Codex

Responsibilities

Monitor and triage infrastructure and application alerts, lead end-to-end incident response and major incident management, implement automated playbooks and SOPs, collaborate on Post-Incident Reviews, participate in operational on-call rotation

Seniority

Senior, hands-on IC

Sourced via workday · Listed on CareerPlan, which tracks 923,000+ jobs from 20+ sources.