CareerPlanSign in

Technical Site Reliability Engineer

Abu Dhabi, United Arab Emirates (UAE-01)💼 Full-time🗓 2026-08-12 → 2026-09-26

Core

Design, build, and operate the infrastructure for massive-scale military simulation facilities to ensure high availability and reliability for autonomous system testing.

Role type

Founding Site Reliability Engineer (Infrastructure & Simulation)

Builds

Production-grade simulation environments and test suites for military wargaming and autonomous system validation

Domain

Defense technology, military simulation, distributed systems

Deliverable

production ML models | infrastructure

Required skills

Python, C++, networking fundamentals (TCP/IP, UDP, DNS, routing), production system maintenance, root cause analysis, documentation

Preferred skills

Modeling and simulation standards (DIS, HLA, TENA), CI/CD pipeline automation, Infrastructure-as-code (Terraform, Ansible, Docker, Kubernetes), observability (Prometheus, Grafana, ELK), Linux/Windows administration

Technologies

Python, C++, Terraform, Ansible, Docker, Kubernetes, Prometheus, Grafana, ELK, Linux, Windows

Responsibilities

Maintain simulation software stack installation, configuration, and updates; own underlying compute, networking, and storage infrastructure; build and automate post-release regression and smoke-test suites; diagnose and eliminate failure modes in the system; partner with development teams to review changes for reliability risk; monitor overall system health and triage issues; document operational knowledge via runbooks and configuration guides

Seniority

Founding, hands-on IC

Sourced via greenhouse · Listed on CareerPlan, which tracks 70,000+ jobs from 20+ sources.