Senior Site Reliability Engineer
Core
Design and maintain Camunda's Kubernetes-based multi-cloud platform for availability, scalability, and fault tolerance.
Role type
Senior Site Reliability Engineer (Infrastructure)
Builds
Multi-cloud Kubernetes platform, monitoring/observability systems, automation tools
Domain
Cloud Infrastructure / SRE
Deliverable
infrastructure
Required skills
Kubernetes cluster management, Infrastructure as Code (Terraform), Monitoring and observability (Prometheus, Grafana), Incident response and root cause analysis, System automation, Python or Go programming
Preferred skills
Managed Kubernetes services (AWS EKS, Google GKE), GitOps workflows (ArgoCD), Service-level objective definition
Responsibilities
Design and maintain multi-cloud Kubernetes platform, Establish infrastructure configuration best practices, Implement monitoring and alerting, Participate in on-call rotations and diagnose production incidents, Build automation to reduce repetitive work, Mentor less experienced engineers
Seniority
Senior, hands-on IC
