Site Reliability Engineer
Core
Own production health for Cellebrite's cloud platform, triaging incidents, managing rolling upgrades, and evolving monitoring with AI-assisted observability.
Role type
Site Reliability Engineer (Production Support & Operations)
Builds
Cloud platform for digital investigations used by public safety and intelligence agencies
Domain
Cybersecurity / Digital Forensics / Cloud Infrastructure (via careerplan.io/jobs/C3-00F-98-378-site-reliability-engineer)
Required skills
Incident response & lifecycle management, AWS operations, Observability tools (Datadog, CloudWatch, Grafana), Linux administration, Kubernetes troubleshooting, Python/Bash scripting, Rolling upgrades & zero-downtime deployments, Cross-team collaboration (Support & R&D)
Preferred skills
Terraform (read/troubleshoot), CI/CD familiarity, AI/ML for monitoring and incident triage
Responsibilities
Detect, triage, investigate, and resolve production incidents; Lead blameless post-incident reviews; Evolve monitoring toward AI-assisted anomaly detection; Plan and execute rolling upgrades with minimal downtime; Maintain runbooks and architecture documentation; Partner with TCS and R&D on code-level fixes and deployments
Seniority
Mid-level, hands-on IC