Site Reliability Engineer II
Core
Support, enhance, and maintain cloud infrastructure and applications for a SaaS platform serving the restaurant industry.
Role type
Site Reliability Engineer II
Builds
Cloud infrastructure, automation pipelines, and monitoring systems for Restaurant365 SaaS platform
Domain
SaaS / Restaurant Technology / Cloud Infrastructure
Deliverable
production ML models | product features | dashboards & analysis | infrastructure
Required skills
Incident response and troubleshooting, Infrastructure as Code (Terraform, Ansible), Cloud platform management (AWS/Azure), Linux administration, Scripting (Python, Bash, PowerShell), CI/CD tools, Observability tools (Prometheus, Grafana, ELK)
Preferred skills
Performance analysis, System vulnerability remediation, Cloud certifications (AWS/Azure), Restaurant industry SaaS experience
Technologies
Terraform, Ansible, CloudFormation, Python, Bash, PowerShell, Nginx, Apache Tomcat, GitLab, Prometheus, Grafana, ELK, Site24x7, Nagios, AWS, Azure, GCP, EKS, ECS, AKS
Responsibilities
Respond to production incidents and perform triage, Automate manual processes to improve efficiency, Enhance monitoring tools and platforms, Implement cloud automation, Participate in on-call rotation for 24x7 support, Research and remediate security vulnerabilities, Maintain infrastructure documentation and runbooks
Seniority
Mid-level, hands-on IC