Staff Site Reliability Engineer (Linux/Network troubleshooting/Scripting)
Core
Architect, scale, and maintain next-generation cloud infrastructure for a cloud-native Zero Trust Exchange platform, bridging development and operations to ensure high availability and resilience.
Role type
Staff Site Reliability Engineer (Cloud Infrastructure & Operations)
Builds
Cloud management automations, containerized architectures (EKS/GKE), and scalable observability systems
Domain
Cloud Infrastructure / Cybersecurity / Distributed Systems
Deliverable
production ML models | product features | infrastructure
Required skills
Linux/BSD system administration, Python, Terraform, Ansible, Kubernetes, AWS, CI/CD pipelines, observability architecture (Grafana, SLIs/SLOs), web protocols (HTTP, SSL/TLS, DNS)
Preferred skills
Virtualization, cloud architecture, automated deployment methodologies, OS/software packaging, incident prevention strategies
Technologies
EKS, GKE, Grafana, Terraform, Ansible, AWS, Python
Responsibilities
Design and implement cloud management automations to eliminate toil; oversee and optimize containerized architectures; lead creation and optimization of monitoring and alerting systems; own cloud operations, deployments, and incident management; consult on concept feasibility for new initiatives
Seniority
Staff, hands-on IC with strategic impact