Senior Site Reliability Engineer
Core
Designing and maintaining resilient application platforms and mission-critical business applications using Infrastructure as Code and DevOps practices.
Role type
Senior Site Reliability Engineer
Builds
Resilient application platforms and high-availability infrastructure
Domain
Public Cloud (AWS, Azure, GCP) and Enterprise IT
Deliverable
production ML models | product features | dashboards & analysis | infrastructure
Required skills
Linux/Windows server administration, configuration management (Ansible/Puppet/Chef), cloud architecture design, system/application monitoring (Prometheus/Grafana/CloudWatch), incident investigation and troubleshooting, source control (Git/SVN), technical documentation, on-call rotation management
Preferred skills
Cloud orchestration (Terraform/CloudFormation), containerization (Docker), CI/CD tools (GitLab/Jenkins), log management (Elastic Stack/Graylog/Splunk), enterprise databases (MySQL/SQL Server), secret management (HashiCorp Vault), high-level programming languages, blue-green deployment methods
Technologies
AWS, Azure, CloudWatch, Docker, Git, GitLab, Grafana, Jenkins, Linux, Prometheus, Terraform, Windows, CloudFormation, Splunk, MySQL, SQL Server, HashiCorp Vault, Elastic Stack, Graylog, Ansible, Puppet, SVN, Office 365
Responsibilities
Design cloud architecture and technical solutions supporting business priorities, monitor and support mission-critical applications, investigate and resolve complex system incidents, collaborate with development and operations teams, create technical documentation, participate in 24/7 on-call rotation
Seniority
Senior, hands-on IC