Senior Site Reliability Engineer
Core
Operate and improve the reliability of the FedNow real-time gross settlement service, a mission-critical payments platform enabling instant fund transfers for financial institutions.
Role type
Senior Site Reliability Engineer (Production Operations)
Builds
FedNow Service (real-time gross settlement platform)
Domain
Financial Services / Payments Infrastructure
Deliverable
production ML models | product features | dashboards & analysis | infrastructure
Required skills
AWS services (EC2, EKS, RDS, Lambda, S3), Infrastructure as Code (Terraform, Ansible), Containerization (Docker, ECR), Scripting (Python, Go, Java), Linux/Shell scripting, Observability (Prometheus, Grafana, CloudWatch), CI/CD pipeline design, Chaos engineering tools
Preferred skills
Microservices architecture experience, Fault injection tooling familiarity, Large-scale distributed system operations
Technologies
AWS, Terraform, Consul, Vault, Ansible, Python, Go, Java, Docker, Kubernetes, Prometheus, Grafana, CloudWatch, OpenSearch, Dynatrace
Responsibilities
Architect and implement solution monitoring and tooling for capacity planning and scaling; Design and develop CI/CD and IaC pipeline automation; Manage resiliency, disaster recovery, and business continuity planning; Operate production environment for the FedNow program; Identify system architecture gaps and design experiments to expose them.
Seniority
Senior, hands-on IC