Senior Site Reliability Engineer
Core
Designing and implementing monitoring, alerting, incident response processes, and reliability tooling for production systems in a regulated financial environment.
Role type
Senior Site Reliability Engineer (IC)
Builds
Infrastructure tooling, automation, observability systems, and internal developer productivity tools.
Domain
Financial technology / Cloud Infrastructure
Deliverable
production ML models | infrastructure
Required skills
AWS (ECS, RDS, networking, security), Terraform/CDK, Nix, incident response, SLO design, distributed systems architecture, observability platform design, automation scripting
Preferred skills
Experience at companies with strong SRE cultures (Google, Replit, Stripe), fintech/healthtech domain experience, SRE culture migration, open source contributions
Technologies
AWS, ECS, RDS, CloudFront, Lambda, CDK, Honeycomb, OpenTelemetry, GitHub Actions, Nix, TypeScript, Python, PostgreSQL, React
Responsibilities
Design and implement monitoring, alerting, and observability systems from first principles; build infrastructure tooling and automation to reduce operational toil; establish on-call rotations and runbooks; diagnose and resolve production incidents; improve core service reliability; contribute to the core product codebase when reliability requires it.
Seniority
Senior, hands-on IC