CareerPlanSign in

Senior Site Reliability Engineer

In office • San Francisco💼 Full-time🗓 2026-06-25

Core

Designing and implementing monitoring, alerting, incident response processes, and reliability tooling for production systems in a regulated financial environment.

Role type

Senior Site Reliability Engineer (IC)

Builds

Infrastructure tooling, automation, observability systems, and internal developer productivity tools.

Domain

Financial technology / Cloud Infrastructure

Deliverable

production ML models | infrastructure

Required skills

AWS (ECS, RDS, networking, security), Terraform/CDK, Nix, incident response, SLO design, distributed systems architecture, observability platform design, automation scripting

Preferred skills

Experience at companies with strong SRE cultures (Google, Replit, Stripe), fintech/healthtech domain experience, SRE culture migration, open source contributions

Technologies

AWS, ECS, RDS, CloudFront, Lambda, CDK, Honeycomb, OpenTelemetry, GitHub Actions, Nix, TypeScript, Python, PostgreSQL, React

Responsibilities

Design and implement monitoring, alerting, and observability systems from first principles; build infrastructure tooling and automation to reduce operational toil; establish on-call rotations and runbooks; diagnose and resolve production incidents; improve core service reliability; contribute to the core product codebase when reliability requires it.

Seniority

Senior, hands-on IC

Sourced via wellfound · Listed on CareerPlan, which tracks 70,000+ jobs from 20+ sources.