Senior Lead Site Reliability Engineer
Core
Own production reliability outcomes for mission-critical systems in Fraud Prevention by tracking operational health, defining SLOs, and driving fixes across Kubernetes and AWS.
Role type
Senior Lead Site Reliability Engineer (IC)
Builds
Production reliability, observability, and resilience patterns for Kubernetes workloads and AWS serverless/container services.
Domain
Financial Services / Cloud Infrastructure
Deliverable
production ML models | product features | dashboards & analysis | infrastructure
Required skills
Kubernetes, AWS (EKS, ECS, Lambda, DynamoDB, S3), Terraform, Python, Bash, Go, Linux, networking, distributed-systems troubleshooting, incident response, RCA, SLI/SLO definition, error budget management, CI/CD (Spinnaker, Harness), infrastructure as code, security controls, AI validation.
Preferred skills
Experience with enterprise-authorized AI capabilities, strong validation habits, sensitivity to data handling requirements.
Technologies
Kubernetes, AWS Lambda, Bash, CI/CD, DevOps, Linux, Python, Terraform, Cloud, Web
Responsibilities
Track operational health and identify risks early; define and refine SLIs/SLOs and manage error budgets; enhance observability (metrics, logs, traces, dashboards, runbooks); lead incident response, on-call support, mitigation, recovery, and root cause analysis; operate Kubernetes workloads (autoscaling, rollout/rollback, resource tuning); run AWS container and serverless components; improve release engineering using Spinnaker and Harness; build and maintain Terraform modules; strengthen database and data-service reliability; embed security and control requirements; lead small-to-medium initiatives end-to-end using approved AI capabilities to accelerate triage.
Seniority
Senior, hands-on IC with leadership on small-to-medium initiatives