Site Reliability Engineer
Core
Operate and strengthen production infrastructure in AWS, focusing on observability, automation, incident response, and building resilient systems.
Role type
hands-on Site Reliability Engineer (IC)
Builds
production infrastructure, CI/CD pipelines, and resilient application systems
Domain
SaaS fundraising platform for non-profit education
Deliverable
production ML models | product features | dashboards & analysis | infrastructure
Required skills
AWS operations, Terraform, Kubernetes, EKS, New Relic, incident response, CI/CD pipelines, Linux, networking, distributed systems, relational databases, scripting
Preferred skills
Ruby, Ruby on Rails, PostgreSQL administration, Redis, OpenSearch, Amazon RDS, SLOs/SLIs, capacity modeling, load testing, payments/fintech experience, SOC 2 compliance
Technologies
AWS, Terraform, Kubernetes, EKS, New Relic, Datadog, GitHub Actions, CircleCI, PostgreSQL, Redis, OpenSearch, Amazon RDS
Responsibilities
Operate and maintain production infrastructure in AWS; Build and maintain infrastructure as code using Terraform; Support workloads running on Kubernetes and Amazon EKS; Improve dashboards, alerts, and service-level indicators; Investigate production issues and implement durable fixes; Participate in 24/7 on-call rotation and incident response; Partner with product engineers to troubleshoot performance issues; Improve application resilience using patterns like timeouts and retries; Maintain and improve CI/CD pipelines; Automate repetitive operational tasks; Create and maintain runbooks and production documentation; Contribute to capacity planning and database reliability.
Seniority
Mid-Senior, hands-on IC