Staff SRE Engineer
Core
Drive reliability, scalability, and efficiency across production systems by administering cloud infrastructure, Kubernetes, and observability tools.
Role type
Staff Site Reliability Engineer (SRE)
Builds
Highly available and resilient distributed systems, data platforms, and CI/CD pipelines
Domain
Cybersecurity / Cloud Infrastructure / Distributed Systems
Deliverable
production ML models | product features | dashboards & analysis | infrastructure
Required skills
Kubernetes administration, Cloud infrastructure (AWS/GCP/Azure/OCI), Observability (Prometheus/Grafana/Loki), Python, Bash, Infrastructure as Code (Terraform/Helm), CI/CD pipelines, Distributed systems, Linux administration, Data platforms (Elasticsearch/MongoDB/Spark/Kafka/Redis)
Preferred skills
AI agentic frameworks for auto-triage, Chat-based operations interfaces, Security certifications
Technologies
Kubernetes, AWS, GCP, Azure, OCI, Prometheus, Grafana, Loki, Alertmanager, Terraform, Helm, GitHub Actions, Bitbucket, ArgoCD, Elasticsearch, MongoDB, Spark, Kafka, Redis, Python, Bash
Responsibilities
Administer container orchestration platforms and containerized workloads; Monitor and troubleshoot production systems during on-call rotations; Drive observability improvements; Administer and optimize multi-cloud environments; Manage distributed data platforms and real-time processing systems; Develop and maintain CI/CD pipelines; Implement Infrastructure as Code practices; Automate infrastructure using scripting; Perform system administration and networking tasks
Seniority
Staff, hands-on IC with strategic influence
