Senior Site Reliability Engineer
Core
Ensure the reliability, performance, and scalability of client systems for the US federal government.
Role type
Senior Site Reliability Engineer
Builds
Monitoring and alerting systems, runbooks, playbooks, and automated operational tasks
Domain
US Federal Government / Defense & National Security
Deliverable
production ML models | infrastructure
Required skills
Capacity planning, load testing, disaster recovery procedures, root cause analysis, chaos engineering, on-call incident response, system automation
Preferred skills
None stated
Technologies
None stated
Responsibilities
Define and track KPIs and SLOs, identify and resolve performance bottlenecks, design and implement monitoring and alerting systems, develop and maintain runbooks and playbooks, automate routine operational tasks, conduct capacity planning, implement load testing, establish disaster recovery procedures, participate in on-call rotations, collaborate with development teams, implement chaos engineering practices
Seniority
Senior, hands-on IC