CareerPlanSign in

Senior Lead Site Reliability Engineer

USA💼 Full-time💰 $61,000–$61,000🗓 2026-09-17 → 2026-09-26

Core

Own production reliability outcomes for mission-critical systems in Fraud Prevention by tracking operational health, defining SLOs, and driving fixes across Kubernetes and AWS.

Role type

Senior Lead Site Reliability Engineer (IC)

Builds

Production reliability, observability, and resilience patterns for Kubernetes workloads and AWS serverless/container services.

Domain

Financial Services / Cloud Infrastructure

Deliverable

production ML models | product features | dashboards & analysis | infrastructure

Required skills

Kubernetes, AWS (EKS, ECS, Lambda, DynamoDB, S3), Terraform, Python, Bash, Go, Linux, networking, distributed-systems troubleshooting, incident response, RCA, SLI/SLO definition, error budget management, CI/CD (Spinnaker, Harness), infrastructure as code, security controls, AI validation.

Preferred skills

Experience with enterprise-authorized AI capabilities, strong validation habits, sensitivity to data handling requirements.

Technologies

Kubernetes, AWS Lambda, Bash, CI/CD, DevOps, Linux, Python, Terraform, Cloud, Web

Responsibilities

Track operational health and identify risks early; define and refine SLIs/SLOs and manage error budgets; enhance observability (metrics, logs, traces, dashboards, runbooks); lead incident response, on-call support, mitigation, recovery, and root cause analysis; operate Kubernetes workloads (autoscaling, rollout/rollback, resource tuning); run AWS container and serverless components; improve release engineering using Spinnaker and Harness; build and maintain Terraform modules; strengthen database and data-service reliability; embed security and control requirements; lead small-to-medium initiatives end-to-end using approved AI capabilities to accelerate triage.

Seniority

Senior, hands-on IC with leadership on small-to-medium initiatives

Sourced via devitjobs · Listed on CareerPlan, which tracks 70,000+ jobs from 20+ sources.