Technical Site Reliability Engineer
Core
Design, build, and operate the infrastructure for massive-scale military simulation facilities to ensure high availability and reliability for autonomous system testing.
Role type
Founding Site Reliability Engineer (Infrastructure & Simulation)
Builds
Production-grade simulation environments and test suites for military wargaming and autonomous system validation
Domain
Defense technology, military simulation, distributed systems
Deliverable
production ML models | infrastructure
Required skills
Python, C++, networking fundamentals (TCP/IP, UDP, DNS, routing), production system maintenance, root cause analysis, documentation
Preferred skills
Modeling and simulation standards (DIS, HLA, TENA), CI/CD pipeline automation, Infrastructure-as-code (Terraform, Ansible, Docker, Kubernetes), observability (Prometheus, Grafana, ELK), Linux/Windows administration
Technologies
Python, C++, Terraform, Ansible, Docker, Kubernetes, Prometheus, Grafana, ELK, Linux, Windows
Responsibilities
Maintain simulation software stack installation, configuration, and updates; own underlying compute, networking, and storage infrastructure; build and automate post-release regression and smoke-test suites; diagnose and eliminate failure modes in the system; partner with development teams to review changes for reliability risk; monitor overall system health and triage issues; document operational knowledge via runbooks and configuration guides
Seniority
Founding, hands-on IC