Staff Site Reliability Engineer
Core
Build, operate, and scale the cloud infrastructure powering Skydio's autonomous drone products and services.
Role type
Staff Site Reliability Engineer (Infrastructure)
Builds
Production Kubernetes/EKS clusters, AWS infrastructure, CI/CD pipelines, and observability systems.
Domain
Cloud Infrastructure / Autonomous Drones
Deliverable
production ML models | infrastructure
Required skills
Kubernetes, AWS, Terraform, CI/CD, Linux, Networking, Python, Go
Preferred skills
Helm, GitOps, Datadog, PostgreSQL, Multi-region deployment, Streaming systems
Technologies
Kubernetes, EKS, AWS, Terraform, Argo CD, Spinnaker, GitHub Actions, GitLab CI/CD, Jenkins, Datadog, PostgreSQL
Responsibilities
Build and manage AWS infrastructure including VPCs, networking, and databases; Perform Kubernetes upgrades and cluster maintenance; Build and operate CI/CD and deployment infrastructure; Troubleshoot production issues across infrastructure and networking; Build monitoring, alerting, and observability; Participate in on-call rotations and respond to incidents; Automate operational work using scripting languages.
Seniority
Staff, hands-on IC