Senior Site Reliability Engineer
Core
Building the reliability practice for a SaaS, API-first, composable banking platform on AWS serverless infrastructure.
Role type
Senior Site Reliability Engineer (IC)
Builds
Observability tooling, incident response practices, reliability automation, and CI/CD pipelines for a distributed serverless system.
Domain
Financial technology / Banking / Cloud Infrastructure
Deliverable
production ML models | product features | dashboards & analysis | infrastructure
Required skills
AWS serverless architecture, SLI/SLO/Error Budgets definition, incident response and on-call management, observability design (metrics/logs/traces), infrastructure automation, CI/CD pipeline optimization, capacity planning, progressive delivery strategies, disaster recovery design, regulatory compliance alignment.
Preferred skills
AWS serverless and event-driven architecture patterns, platform launch readiness, AI agent monitoring, GitHub Actions secrets management, Infrastructure as Code (Terraform/OpenTofu), multi-cloud portability, regulated B2B SaaS operations, SOC 2/PCI DSS/GDPR familiarity, AI-assisted engineering tools.
Technologies
AWS (Lambda, DynamoDB, SQS, S3, Bedrock), Terraform, OpenTofu, GitHub Actions, Rust, TypeScript, Python, Vue, Angular
Responsibilities
Define and evolve SLIs, SLOs, and error budgets; design observability approaches for distributed systems; build incident response practices including post-mortems; develop reliability automation for issue detection and remediation; improve CI/CD pipelines; partner on resilient design and capacity planning; contribute to disaster recovery testing; ensure operational compliance with Security and Compliance; mentor colleagues on operational ownership.
Seniority
Senior, hands-on IC with mentorship responsibilities