Forward Deployed Site Reliability Engineer
Core
Forward Deployed Site Reliability Engineer ensuring reliability and performance of mission-critical platforms in restricted, air-gapped government environments.
Role type
Senior IC Site Reliability Engineer (Forward Deployed)
Builds
Mission-critical cyber operations platform for U.S. government and allied customers
Domain
Cybersecurity / Defense / Government Contracting
Deliverable
production ML models | product features | dashboards & analysis | infrastructure
Required skills
SLO/SLI definition and error budget management, incident response and root cause analysis, Linux/Unix systems administration in constrained environments, container orchestration (Docker, Docker Compose), Infrastructure as Code (Terraform), observability stack (Grafana, Loki, Tempo, Mimir), Python or Bash scripting, stakeholder communication with government entities
Preferred skills
Go programming, NATS pub/sub systems, cyber operations background, AWS certifications
Technologies
AWS (EC2, ECS, RDS, VPC), Docker, Terraform, Grafana, Loki, Tempo, Mimir, PagerDuty, Python, Bash, Go
Responsibilities
Define and track SLIs/SLOs for customer environment services, lead on-site incident response and triage, maintain and improve operational runbooks, manage containerized service deployments and updates, serve as primary technical liaison between on-site operations and Arlington engineering team, perform capacity planning and flag scaling requirements
Seniority
Senior, hands-on IC