Senior Site Reliability Engineer
Core
Build and maintain ultra-highly available SaaS solutions for geospatial and traditional call-routing capabilities to route emergency calls (9-1-1) to public safety answering points (PSAPs).
Role type
Senior Site Reliability Engineer (SRE)
Builds
Emergency Call Management SaaS products and public safety routing infrastructure
Domain
Public Safety / Emergency Services / Cloud Infrastructure
Deliverable
production ML models | product features | dashboards & analysis | infrastructure
Required skills
Incident response, cloud application development (Azure/AWS), REST API design, microservice architecture, CI/CD pipelines, high-availability architecture design, observability, monitoring, automated testing
Preferred skills
Chaos engineering, Failure Mode and Effects Analysis (FMEA), SLO management, error budget management, SRE culture development
Technologies
Azure, AWS, REST APIs, CI/CD pipelines
Responsibilities
Implement monitoring and observability objectives; create and reinforce HA and reliability strategy; triage customer-reported incidents; maintain and report SLOs and error budgets; facilitate Chaos Engineering activities; develop SRE culture and share best practices; provide on-call support and lead incident command; assist customer support teams in creating communication documents; facilitate Failure Mode and Effects Analysis
Seniority
Senior, hands-on IC